Ottimizzazione dei dati memorizzati nelle tabelle di un data warehouse Hive in Data Refinery

Ottimizzare i dati memorizzati nelle tabelle di un data warehouse Hive sul cluster Hadoop.

Prerequisito

Creare la connessione al cluster Hadoop. Vedi il collegamento Hive via Execution Engine for Hadoop.

Limitazioni

La fonte e la destinazione del flusso Data Refinery e l 'ambiente Hadoop devono fare riferimento allo stesso sistema Hadoop.

Per eseguire i processi di elaborazione dei dati ( Data Refinery ) su un cluster Hadoop, è necessario utilizzare un ambiente Hadoop.

Procedura

  1. Crea un asset di dati collegato per la fonte (i dati che desideri elaborare):

    1. Vai alla pagina del progetto.
    2. Fai clic su Risorse > Importa risorsa > Dati collegati.
    3. Fai clic su «Seleziona origine ».
    4. Seleziona la connessione " Hive via Execution Engine for Hadoop ". Cerca i dati desiderati e clicca su «Seleziona ».
    5. Inserisci un nome e una descrizione.
    6. Fare clic su Crea. La risorsa viene visualizzata nella pagina Risorse del progetto.
  2. Ripeti il passaggio 1 per creare un asset di dati collegato per il file di destinazione dell'output del flusso " Data Refinery ".

  3. Crea un flusso " Data Refinery ":

    1. Fai clic sulla risorsa dati collegata alla fonte che hai creato al punto 1.
    2. Fai clic su «Prepara dati» per aprire « Data Refinery ».
    3. Applicare operazioni per perfezionare i dati.
  4. Modifica la posizione di destinazione del file di output:

    1. Fai clic sull'icona delle Impostazioni del flusso impostazioni di Flow sulla barra degli strumenti. Vai alla scheda "Set di dati di destinazione " e fai clic su "Seleziona destinazione".
    2. Fare clic su "Risorsa dati ", quindi selezionare la risorsa dati collegata per il file di output di destinazione e fare clic su "Avanti".
    3. Nella finestra " Seleziona proprietà di destinazione e formato ", seleziona una modalità di scrittura e un 'azione per la tabella.
    4. Fai clic su Salva e poi su Applica.
  5. Crea un processo che esegua il flusso " Data Refinery " nell'ambiente " Hadoop ":

    1. Dalla barra degli strumenti di Data Refinery, fare clic sull'icona Icona "Lavori""Lavori " e selezionare "Salva e crea un lavoro ".
    2. Inserisci un nome e una descrizione. Seleziona l'ambiente " Hadoop ".
    3. Facoltativo: aggiungi una pianificazione una tantum o ricorrente.
    4. Crea il processo ed eseguilo immediatamente, oppure crealo ed eseguilo in un secondo momento.

Problemi noti

Risoluzione dei problemi negli ambienti di " Hadoop "

Ulteriori informazioni