Data Refinery ambienti

In Data Refinery, un runtime Spark & R viene avviato quando si formano i dati in Data Refinery e quando si esegue un flusso Data Refinery in un lavoro.

Forma dei dati in Data Refinery

Quando si seleziona di perfezionare i dati in Data Refinery, un runtime Data Refinery viene avviato nei copertine ed è elencato come un runtime attivo nei Runtime degli strumenti nella pagina Ambienti nella scheda Gestisci del progetto. È possibile arrestare il runtime da questa pagina.

Esecuzione di un flusso Data Refinery

È possibile creare un lavoro in cui eseguire il flusso Data Refinery :

  • Direttamente in Data Refinery facendo clic sull'icona Lavori l'icona dei lavori dalla barra degli strumenti Data Refinery e creando un job
  • Dalla pagina Risorse del progetto, selezionando il flusso Data Refinery e facendo clic su AZIONI> Crea lavoro

Opzioni di ambiente nei lavori

Quando si crea un processo in cui eseguire il flusso Data Refinery , è possibile scegliere di utilizzare uno dei seguenti ambienti:

  • Ambienti Spark & R

    Servizio Gli ambienti Spark non sono disponibili per impostazione predefinita. Un amministratore deve installare il servizio " Analytics Engine powered by Apache Spark " sulla piattaforma IBM Cloud Pak for Data. Per stabilire se il servizio è installato, aprire il catalogo Servizi e verificare se il servizio è abilitato.

    Con un ambiente Spark & R, il flusso Data Refinery viene eseguito nel proprio cluster Spark. Ogni ambiente Spark è costituito da un kernel SparkR come servizio. Il kernel dispone di un cluster Spark dedicato e degli esecutori Spark. Si consiglia di utilizzare un ambiente Spark & R solo se si sta lavorando su un dataset di grandi dimensioni. Se il dataset è piccolo, è necessario selezionare il runtime Default Data Refinery XS . Il motivo è che, sebbene il cluster SparkR in un ambiente Spark & R sia rapido e potente, la creazione richiede tempo, il che è evidente quando si esegue un lavoro Data Refinery su un dataset di piccole dimensioni.

    È possibile selezionare un modello di ambiente predefinito incluso in Watson Studio oppure creare il proprio modello di ambiente Spark & R.

    Se si crea il proprio modello di ambiente Spark & R, è possibile configurare la dimensione del driver Spark e la dimensione e il numero degli executor in base alla dimensione del dataset.

    Selezionare sempre un ambiente Spark & R per eseguire i flussi Data Refinery che operano su dataset di grandi dimensioni.

  • Data Refinery e predefinito XS

    Il runtime Default Data Refinery XS viene utilizzato quando si raffinano i dati in Data Refinery e può essere selezionato come runtime dell'ambiente quando si crea un lavoro in cui eseguire il flusso Data Refinery .

    È necessario selezionare il runtime Default Data Refinery XS per eseguire i flussi Data Refinery che operano su dataset di piccole dimensioni perché il runtime è immediatamente disponibile e non deve essere avviato prima dell'esecuzione del lavoro.

    Il runtime Default Data Refinery XS è pronto per HIPAA.

  • Hadoop gruppo

    Gli ambienti Servizio Hadoop non sono disponibili per impostazione predefinita. Un amministratore deve installare il servizio " Analytics Engine powered by Apache Spark " sulla piattaforma IBM Cloud Pak for Data. Per stabilire se il servizio è installato, aprire il catalogo Servizi e verificare se il servizio è abilitato.

    Se vuoi perfezionare i dati HDFS su un cluster Hadoop , puoi eseguire i tuoi lavori Data Refinery direttamente nel cluster Hadoop .

Dopo che il runtime è stato avviato, viene elencato come runtime attivo nella pagina Ambienti del tuo progetto. Il runtime viene arrestato quando l'esecuzione del lavoro Data Refinery viene arrestata.

Modelli di ambiente predefiniti

Watson Studio offre i seguenti modelli di ambiente Spark & R predefiniti che puoi utilizzare quando crei un lavoro in cui eseguire un flusso Data Refinery . La selezione di un modello di ambiente Spark consente di iniziare rapidamente ad eseguire lavori Data Refinery senza dover creare un modello di ambiente Spark & R. I modelli di ambiente inclusi sono elencati in Modelli nella pagina Ambienti nella scheda Gestisci del progetto.

Nota:
  • I runtime basati su R per l'editor di notebook e l' Data Refinery e non funzionano sulla piattaforma IBM Z ( s390x ).

Modelli di ambiente Spark & R predefiniti
Nome Configurazione hardware
Default Spark 3.5 & R 4.3 2 Executors ciascuno: 1 vCPU e 4 GB RAM;
Driver: 1 vCPU e 4 GB RAM

Log di runtime per i lavori

Per visualizzare i log accumulati per un lavoro Data Refinery :

  1. Dalla pagina Lavori del progetto, fare clic sul job che ha eseguito il flusso Data Refinery per cui si desidera visualizzare i log.
  2. Fare clic sul lavoro eseguito. È possibile visualizzare la coda di registrazione o scaricare il file di registrazione completo.

Passi successivi