Usando o Spark no RStudio
Embora o IDE do RStudio não possa ser iniciado em um tempo de execução do ambiente Spark com R, é possível usar o Spark em seus scripts R e apps Shiny acessando kernels do Spark programaticamente.
O RStudio usa o pacote sparklyr para se conectar à Spark de R. O pacote sparklyr inclui uma interface dplyr para quadros de dados Spark, bem como uma interface R para os gasodutos distribuídos de máquina distribuída da Spark.
Você pode se conectar ao Spark em RStudio :
- Conectando-se a um kernel do Spark que é executado localmente no contêiner RStudio em IBM watsonx.ai Studio
O RStudio inclui trechos de código de amostra que mostram como se conectar a um kernel do Spark em seus aplicativos para ambos os métodos.
Para usar o Spark no RStudio depois de ter ativado o IDE:
Localize o diretório
ibm_sparkaas_demosem seu diretório inicial e abra-o. O diretório contém os scripts R a seguir:- Um leia-me com detalhes sobre os scripts de amostra R incluídos
spark_kernel_basic_local.Rinclui código de amostra de como se conectar a um kernel Spark localspark_kernel_basic_remote.Rinclui código de amostra de como se conectar a um kernel Spark remoto- Os arquivos
sparkaas_flights.Resparkaas_mtcars.Rsão dois exemplos de como utilizar o Spark em um pequeno aplicativo de amostra
Use os fragmentos de código de amostra em seus scripts R ou aplicativos para ajudá-lo a começar a usar o Spark.
Conectando-se ao Spark a partir de RStudio
Para se conectar ao Spark pelo site RStudio usando o pacote Sparklyr R, você precisa de um ambiente Spark com R. Você pode usar o Spark padrão com ambiente R que é fornecido ou criar um Spark personalizado com ambiente R. Para criar um ambiente personalizado, consulte Criando modelos de ambiente.
Siga estas etapas depois de iniciar o RStudio em um ambiente RStudio :
Use o código de exemplo a seguir para obter uma listagem dos detalhes do ambiente do Spark e para se conectar a um kernel do Spark em sua sessão RStudio :
# load spark R packages
library(ibmwsrspark)
library(sparklyr)
# load kernels
kernels <- load_spark_kernels()
# display kernels
display_spark_kernels()
# get spark kernel Configuration
conf <- get_spark_config(kernels[1])
# Set spark configuration
conf$spark.driver.maxResultSize <- "1G"
# connect to Spark kernel
sc <- spark_connect(config = conf)
Em seguida, para desconectar-se do Spark, use:
# disconnect
spark_disconnect(sc)
Exemplos desses comandos são fornecidos no leia-me em /home/wsuser/ibm_sparkaas_demos.