Risoluzione degli ambienti Hadoop
Utilizzare queste soluzioni per risolvere i problemi che si potrebbero sperimentare quando si utilizzano ambienti Hadoop .
- Riavviare Execution Engine for Apache Hadoop da Cloudera Manager o Ambari
- Esportazione e importazione di progetti che fanno riferimento a Hadoop- sistemi integrati
- Errore durante l'importazione di dist - keras in una sessione remota Execution Engine for Apache Hadoop
- Impostazione di Hadoop quando viene riinstallato un sistema remoto
- Errori quando si perfezionano i dati su un cluster Hadoop
- La registrazione del cluster Cloud Pak for Data non riesce
Riavvio dei servizi di Execution Engine for Apache Hadoop da Cloudera Manager o Ambari
Se è necessario riavviare i servizi Execution Engine for Apache Hadoop da Cloudera Manager (CDH) o Ambari (HDP), riavviare tutti i servizi Execution Engine for Apache Hadoop eseguendo i seguenti comandi:
cd /opt/ibm/dsxhi/bin
./stop.py
./start.py
Esportazione e importazione di progetti
Se si esportano gli asset di progetto che contengono un riferimento a un sistema integrato Hadoope si sta importando il progetto in un cluster Cloud Pak for Data diverso, si potrebbe avere un problema in cui i notebook, le connessioni e i lavori di raffinazione non riescono.
Il motivo è che quando il progetto viene esportato, la registrazione Hadoop definita globalmente non viene inclusa come parte dell'esportazione poiché si tratta di una proprietà globale. Effettuare le seguenti operazioni per assicurarsi che il progetto importato funzioni correttamente. Questi passi sono necessari, poiché le informazioni di integrazione Hadoop non fanno parte di un'esportazione del progetto e sono definite globalmente come parte del cluster Cloud Pak for Data .
Questo scenario può verificarsi anche quando l'admin cancella una voce nella pagina di integrazione Hadoop a cui fa riferimento anche l'ambiente di un utente. Se l'amministratore aggiunge nuovamente la stessa voce, è comunque necessario effettuare le seguenti operazioni per correggere i problemi.
Problematiche e workaround
L'emissione del progetto di importazione ed esportazione interessa:
Per risolvere questo problema, vedi Soluzione temporanea. Dopo aver completato il workaround potrebbe essere necessario fare ulteriori passi. Le seguenti sezioni includono ulteriori informazioni.
Ambienti
Gli ambienti non mostrano tutti i dettagli Hadoop .
Notebook
Anche se è ancora possibile visualizzare il contenuto del notebook, quando si tenta di avviarlo in modalità Modifica , l'operazione non riesce. Inoltre, non è possibile eliminare il runtime attivo. L'eliminazione dell'ambiente di runtime fallisce anche.
Quando l'ambiente non valido viene eliminato, la pagina Risorse indica con un'icona che l'ambiente è stato rimosso dal notebook.
- Dal pulsante Azione , selezionare Modifica ambiente, quindi selezionare l'ambiente creato di recente nella soluzione temporanea Ambienti.
- Fare clic su Associatee quindi eseguire il notebook per convalidare che il workaround sia riuscito.
Lavori
Un lavoro avrà esito negativo con un errore Failed to find remote host for id .
Ciò si applica ai lavori Data Refinery e notebook. Quando l'ambiente non valido viene eliminato, l'interfaccia utente dei lavori indicherà che il lavoro ha un modello di ambiente mancante.
- Fare clic su Modifica accanto a Modello di ambientee nella scheda Modello di ambiente , selezionare il nuovo ambiente e fare clic su Submit.
- Eseguire il lavoro.
Connettori
Un dato connesso non riesce con uno strano errore. Esegui una delle seguenti operazioni:
- Se l'admin Cloud Pak for Data ha creato la voce di registrazione integrazione Hadoop utilizzando lo stesso nome definito in precedenza, non sono necessarie modifiche per la connessione.
- Se l'admin Cloud Pak for Data ha modificato il nome di registrazione integrazione Hadoop , allora è necessario navigare nella connessione e avviare la pagina Modifica connessione , e aggiornare gli URL HDFS/ Hive in base alla voce di registrazione rinominata.
Soluzione alternativa
Utilizzare il seguente workaround per risolvere ogni problema per ambienti, notebook, lavori e connettori:
- L'admin Cloud Pak for Data deve registrare lo stesso sistema nella pagina di integrazione Hadoop . Si consiglia di utilizzare lo stesso nome per questa registrazione.
- Gli utenti devono creare un nuovo modello di ambiente che faccia riferimento alla nuova voce di registrazione Hadoop .
- Gli utenti devono eliminare l'ambiente non valido.
- Gli utenti devono aggiornare il proprio lavoro o notebook per fare riferimento al nuovo ambiente.
Errore durante l'importazione di dist - keras in una sessione remota Execution Engine for Apache Hadoop
Il pacchetto dist - keras non è supportato sui cluster Python 3.7 su Power PC Hadoop .
Se stai eseguendo il push dell'immagine Jupyter Python 3.7 a un sistema registrato Execution Engine for Apache Hadoop tramite le configurazioni della Piattaforma, l'installazione dei dist - keras nell'immagine non riesce sulle macchine Power. In questo modo si produrrà un avviso come il seguente nei log push dell'immagine:
Attempting to install HI addon libs to active environment ...
==> Target env: /opt/conda/envs/Python-3.7-main ...
====> Installing conda packages ...
====> Installing pip packages ...
==> WARNING: HI addons could not be installed:
----------------------------------------------
Collecting package metadata: ...working... done
Solving environment: ...working... done
.
.
.
File "/opt/conda/envs/Python-3.7-main/lib/python3.7/site-packages/typing.py", line 1003, in __new__
self._abc_registry = extra._abc_registry
AttributeError: type object 'Callable' has no attribute '_abc_registry'
.
.
.
----------------------------------------------
A Hadoop admin may need to manually install some libraries
into the remote image after it is pushed ...
Mentre l'operazione di push dell'immagine deve continuare ed eventualmente riuscire, i tentativi di importare distkeras in una sessione Execution Engine for Apache Hadoop remota (Livy o JEG) non riescono con un errore come No module named 'distkeras'.
A parte la mancanza di supporto per dist-keras, l'immagine Python 3.7 di cui è stato eseguito il push per Power può essere utilizzata nelle sessioni Execution Engine for Apache Hadoop remote come qualsiasi altra immagine di cui è stato eseguito il push.
Impostazione di Hadoop quando viene riinstallato un sistema remoto
Si tratta di uno scenario in cui è necessario reinstallare Execution Engine Apache Hadoop (dsxhi) rpm sul proprio sistema Hadoop . Dopo che il sistema è stato reinstallato, sono necessari ulteriori passi per garantire che le connessioni Hadoop continuino a funzionare correttamente.
Hadoop System
Se hai aggiunto un nuovo endpoint esposto per Hadoop, ti consigliamo di registrare nuovamente il cluster Cloud Pak for Data che è stato registrato con questo sistema Hadoop . La registrazione di Cloud Pak for Data viene mantenuta se si utilizza ./uninstall.py e ./install.py per reinstallare l'applicazione. Questo passo non è necessario se è stato eseguito un yum erase dsxhie yum install dsxhi-*rpm ed è stata eseguita l'installazione. Quest' ultima opzione cancella i dati di registrazione.
Utilizzare ./manage_known_dsx.py -l per elencare e quindi utilizzare l'opzione ./manage_known_dsx.py -r <host> per aggiornare la registrazione.
Cloud Pak for Data
L'admin Cloud Pak for Data deve aggiornare anche la registrazione Hadoop .
Se la registrazione viene eliminata, ci sono alcune attività utente che devono essere eseguite. Per ulteriori informazioni, consultare Esportazione e importazione di progetti.
- Navigare nel pannello di integrazione Hadoop e selezionare il sistema aggiornato.
- Nella pagina dei dettagli, fare clic su
Update Certificate. Se l'aggiornamento fallisce la prima volta, il certificato probabilmente non è stato aggiornato. Riprova.
Errori durante la raffinazione dei dati su un cluster Hadoop
Utilizzare le seguenti informazioni per la risoluzione degli errori quando si rifanno i dati sul cluster Hadoop .
- Errore: "Verificare che la connessione URL e l'ambiente Hadoop URL per Livy spark2 facciano riferimento allo stesso percorso"
- Questo errore potrebbe verificarsi dopo l'aggiornamento di Cloud Pak for Data.
Per risolvere questo errore, verificare che la connessione URL e l'ambiente Hadoop URL per Livy spark2 facciano riferimento allo stesso percorso. L'amministratore può confermare gli URL da Amministrazione > Configurazione e impostazioni > Hadoop Execution Engine. Se gli URL non sono gli stessi, aggiornare la connessione URL e le informazioni sul certificato. - Errore: "Il tipo di connessione: '< tipo>' non è supportato per la forma dei dati in ambiente Hadoop "
- Solo le connessioni Hadoop Execution Engine sono supportate per l'esecuzione di lavori Data Refinery in ambiente Hadoop . Consultare l'elenco delle connessioni Hadoop Execution Engine in Raffinazione dei dati sul cluster Hadoop.
- Errore: "Il formato '< formato>' non è supportato per la lettura / scrittura HDFS "
- È stato selezionato un formato di dati non supportato per perfezionare i dati HDFS . Vedi HDFS via Execution Engine for Hadoop connection per l'elenco dei formati di dati supportati.
Registrazione di un cluster Cloud Pak for Data non riuscita
Se la registrazione di un cluster Cloud Pak for Data non riesce, controlla i seguenti dettagli:
- Assicurarsi che il sito URL fornito durante la registrazione sia corretto. Vedere Gestione dell'accesso per Cloud Pak for Data.
- Contatta l'amministratore Hadoop che ha installato il servizio sul cluster Hadoop e assicurati che l'ID utente del servizio fornito durante la registrazione sia corretto.
- Assicurarsi che il gestore DNS di Openshift sia configurato per risolvere correttamente l'hostname nel sito URL fornito durante la registrazione.
- Contattare l'amministratore Openshift per esaminare i log di
utils-api podper ulteriori informazioni di diagnostica.