Ottimizzazione dei dati memorizzati nelle tabelle di un data warehouse Hive in Data Refinery
Ottimizzare i dati memorizzati nelle tabelle di un data warehouse Hive sul cluster Hadoop.
Prerequisito
Creare la connessione al cluster Hadoop. Vedi il collegamento Hive via Execution Engine for Hadoop.
Limitazioni
La fonte e la destinazione del flusso Data Refinery e l 'ambiente Hadoop devono fare riferimento allo stesso sistema Hadoop.
Per eseguire i processi di elaborazione dei dati ( Data Refinery ) su un cluster Hadoop, è necessario utilizzare un ambiente Hadoop.
Procedura
Crea un asset di dati collegato per la fonte (i dati che desideri elaborare):
- Vai alla pagina del progetto.
- Fai clic su Risorse > Importa risorsa > Dati collegati.
- Fai clic su «Seleziona origine ».
- Seleziona la connessione " Hive via Execution Engine for Hadoop ". Cerca i dati desiderati e clicca su «Seleziona ».
- Inserisci un nome e una descrizione.
- Fare clic su Crea. La risorsa viene visualizzata nella pagina Risorse del progetto.
Ripeti il passaggio 1 per creare un asset di dati collegato per il file di destinazione dell'output del flusso " Data Refinery ".
Crea un flusso " Data Refinery ":
- Fai clic sulla risorsa dati collegata alla fonte che hai creato al punto 1.
- Fai clic su «Prepara dati» per aprire « Data Refinery ».
- Applicare operazioni per perfezionare i dati.
Modifica la posizione di destinazione del file di output:
- Fai clic sull'icona delle
impostazioni di Flow sulla barra degli strumenti. Vai alla scheda "Set di dati di destinazione " e fai clic su "Seleziona destinazione". - Fare clic su "Risorsa dati ", quindi selezionare la risorsa dati collegata per il file di output di destinazione e fare clic su "Avanti".
- Nella finestra " Seleziona proprietà di destinazione e formato ", seleziona una modalità di scrittura e un 'azione per la tabella.
- Fai clic su Salva e poi su Applica.
- Fai clic sull'icona delle
Crea un processo che esegua il flusso " Data Refinery " nell'ambiente " Hadoop ":
- Dalla barra degli strumenti di Data Refinery, fare clic sull'icona
"Lavori " e selezionare "Salva e crea un lavoro ". - Inserisci un nome e una descrizione. Seleziona l'ambiente " Hadoop ".
- Facoltativo: aggiungi una pianificazione una tantum o ricorrente.
- Crea il processo ed eseguilo immediatamente, oppure crealo ed eseguilo in un secondo momento.
- Dalla barra degli strumenti di Data Refinery, fare clic sull'icona