Usando o Spark no RStudio

Embora o IDE do RStudio não possa ser iniciado em um tempo de execução do ambiente Spark com R, é possível usar o Spark em seus scripts R e apps Shiny acessando kernels do Spark programaticamente.

O RStudio usa o pacote sparklyr para se conectar à Spark de R. O pacote sparklyr inclui uma interface dplyr para quadros de dados Spark, bem como uma interface R para os gasodutos distribuídos de máquina distribuída da Spark.

Você pode se conectar ao Spark em RStudio :

  • Conectando-se a um kernel do Spark que é executado localmente no contêiner RStudio em IBM watsonx.ai Studio

O RStudio inclui trechos de código de amostra que mostram como se conectar a um kernel do Spark em seus aplicativos para ambos os métodos.

Para usar o Spark no RStudio depois de ter ativado o IDE:

  1. Localize o diretório ibm_sparkaas_demos em seu diretório inicial e abra-o. O diretório contém os scripts R a seguir:

    • Um leia-me com detalhes sobre os scripts de amostra R incluídos
    • spark_kernel_basic_local.R inclui código de amostra de como se conectar a um kernel Spark local
    • spark_kernel_basic_remote.R inclui código de amostra de como se conectar a um kernel Spark remoto
    • Os arquivos sparkaas_flights.R e sparkaas_mtcars.R são dois exemplos de como utilizar o Spark em um pequeno aplicativo de amostra
  2. Use os fragmentos de código de amostra em seus scripts R ou aplicativos para ajudá-lo a começar a usar o Spark.

Conectando-se ao Spark a partir de RStudio

Para se conectar ao Spark pelo site RStudio usando o pacote Sparklyr R, você precisa de um ambiente Spark com R. Você pode usar o Spark padrão com ambiente R que é fornecido ou criar um Spark personalizado com ambiente R. Para criar um ambiente personalizado, consulte Criando modelos de ambiente.

Siga estas etapas depois de iniciar o RStudio em um ambiente RStudio :

Use o código de exemplo a seguir para obter uma listagem dos detalhes do ambiente do Spark e para se conectar a um kernel do Spark em sua sessão RStudio :

# load spark R packages
library(ibmwsrspark)
library(sparklyr)

# load kernels
kernels <- load_spark_kernels()

# display kernels
display_spark_kernels()

# get spark kernel Configuration

conf <- get_spark_config(kernels[1])
# Set spark configuration
conf$spark.driver.maxResultSize <- "1G"
# connect to Spark kernel

sc <- spark_connect(config = conf)

Em seguida, para desconectar-se do Spark, use:

# disconnect
spark_disconnect(sc)

Exemplos desses comandos são fornecidos no leia-me em /home/wsuser/ibm_sparkaas_demos.