Ampliare le capacità di analisi con Spark ( Analytics Engine powered by Apache Spark )

È possibile utilizzare Analytics Engine powered by Apache Spark come motore di elaborazione per eseguire processi di analisi e di machine learning.

IBM Analytics Engine powered by Apache Spark offre un servizio gestito per l'utilizzo di Apache Spark con funzionalità aggiuntive quali il ridimensionamento automatico, le quote di risorse e la gestione delle code. È possibile eseguire applicazioni Spark in modo interattivo utilizzando Jupyter Notebook e script, sia in ambiente Python che in R. Le applicazioni possono essere eseguite anche utilizzando i lavori da Notebook, Spazio di distribuzione o utilizzando l'istanza del servizio Spark. IBM, disponibile all'indirizzo Analytics Engine powered by Apache Spark, crea cluster Spark su richiesta ed esegue carichi di lavoro utilizzando offerte quali applicazioni Spark, kernel Spark e Spark Labs.

Servizio Il servizio IBM Analytics Engine powered by Apache Spark non è disponibile per impostazione predefinita. Un amministratore deve installare questo servizio sulla piattaforma IBM Cloud Pak for Data. Per determinare se il servizio è installato, aprire il catalogo dei servizi e verificare se il servizio è abilitato.

Ogni volta che invii un lavoro, viene creato un cluster Spark dedicato per il lavoro. È possibile specificare la dimensione del driver Spark, la dimensione dell'executor e il numero di executor per il job. Ciò consente di ottenere prestazioni prevedibili e coerenti.

Una volta completato un lavoro, il cluster viene automaticamente ripulito in modo che le risorse siano disponibili per altri lavori. Il servizio include anche interfacce che ti consentono di analizzare le prestazioni delle tue applicazioni Spark e i problemi di debug.

In " IBM Cloud Pak for Data " è possibile eseguire carichi di lavoro Spark in due modi:

  • In un notebook che viene eseguito in un ambiente Spark in un progetto in Watson Studio
  • All'esterno di Watson Studio, in un'istanza di IBM Analytics Engine powered by Apache Spark che utilizza le API dei job Spark

Ambienti Spark nei progetti

Se hai installato il servizio Watson Studio, il servizio IBM Analytics Engine powered by Apache Spark aggiunge automaticamente una serie di modelli predefiniti di ambiente Spark ai progetti. È anche possibile creare modelli di ambiente Spark personalizzati in un progetto.

Puoi visualizzare i modelli di ambiente Spark in Modelli nella pagina Ambienti sulla scheda Manage del tuo progetto.

Per ulteriori dettagli, vedi Ambienti Spark.

API Spark

È possibile eseguire carichi di lavoro Spark direttamente su IBM Analytics Engine powered by Apache Spark utilizzando le API dei job Spark.

Puoi eseguire questi tipi di carichi di lavoro con le API dei lavori Spark:

  • Applicazioni Spark che eseguono Spark SQL
  • Lavori di trasformazione dati
  • Lavori di data science
  • Lavori di machine learning

Vedi Introduzione alle applicazioni Spark.

Ulteriori informazioni