Execution Engine for Apache Hadoop environnements

Vous pouvez créer des modèles d'environnement Hadoop et des sessions Jupyter Enterprise Gateway (JEG) dans des projets d'analyse Watson Studio pour exécuter des travaux sur le cluster Hadoop .

Les environnements de service d' Execution Engine for Apache Hadoop s ne sont pas disponibles par défaut. Un administrateur doit installer le service « Execution Engine for Apache Hadoop » sur la plateforme IBM Cloud Pak for Data. Pour vérifier si le service est installé, ouvrez le catalogue des services et vérifiez s'il est activé.

Utilisez un environnement « Hadoop » lorsque vous souhaitez effectuer les tâches suivantes :

Remarque: Un environnement Hadoop peut être utilisé avec un bloc-notes Jupyter, mais il ne s'applique pas aux blocs-notes dans JupyterLab.
  • Entraînez un modèle sur le cluster Hadoop dans un notebook Jupyter.
  • Gérer un modèle sur le cluster Hadoop à l'aide des méthodes de l'utilitaire d'intégration d' Hadoop, au sein d'un notebook Jupyter.
  • Prévisualisez et affinez les données d' Hadoop ( HDFS, Hive et Impala ) dans Watson Studio.
  • Exécutez les flux d' Data Refinery s sur le cluster Hadoop.
  • Planifiez l'exécution à distance de scripts Python ou R en tant que tâches sur les clusters d' Hadoop.

Si vous utilisez Livy pour exécuter des travaux Spark sur Hadoop, n'utilisez pas l'environnement Hadoop . Utilisez plutôt l'environnement qui s'exécute localement dans le cluster d' Cloud Pak for Data.

Modèles d'environnement Hadoop

Pour créer un modèle d'environnement Hadoop :

  1. Dans l'onglet Gérer de votre projet, sélectionnez la page Environnements , puis sous Modèles, cliquez sur Nouveau modèle.
  2. Entrez un nom et une description.
  3. Sélectionnez le type de configuration d'environnement « Hadoop ».
  4. Sélectionnez l'un des systèmes enregistrés dans la liste déroulante « Configuration d' Hadoop » de l' Hadoop.
    • Si le travail utilise les paquets d' Python s disponibles sur Watson Studio Local et Cloud Pak for Data pour le cluster Hadoop, vous pouvez sélectionner l'image qui a été poussée depuis la page d'enregistrement Hadoop dans le champ « Version du logiciel ».
  5. Utilisez le champ « YARN Queue » pour sélectionner la file d'attente dans laquelle votre environnement sera exécuté. Cela s'applique aux tâches et aux exécutions de notebooks.
    • Par défaut, toutes les exécutions sont envoyées vers la file d'attente YARN par défaut. L'administrateur d' Hadoop. peut configurer et afficher la liste des files d'attente Yarn disponibles que vous pouvez utiliser.
    • L'administrateur d' Hadoop aurait dû accorder à l'utilisateur Watson Studio Local les autorisations nécessaires pour soumettre la tâche à la file d'attente YARN spécifiée.
  6. Sélectionnez la taille de l'environnement avec lequel vous exécuterez votre bloc-notes ou vos travaux.
  7. Une fois que vous avez sauvegardé le nouvel environnement, vous pouvez le sélectionner en tant qu'environnement pour les blocs-notes et les travaux.

Ajouter des paramètres utilisateur

Lorsque vous travaillez avec des ensembles de données volumineux dans l' Hadoop, ou si vous avez besoin d'affiner les paramètres de votre session Spark, utilisez les variables de session définies par l'utilisateur. Les variables sont des paramètres qui vous permettent de définir des options Spark supplémentaires pouvant être utilisées lors du lancement de votre notebook ou de l'exécution d'un travail.

Avant de pouvoir utiliser les variables, l'administrateur de votre site Hadoop doit d'abord définir la liste des options disponibles et la plage de valeurs associées à ces options dans le cadre de la configuration de Hadoop. Contactez votre administrateur Hadoop pour connaître les options que vous pouvez configurer. Une fois les nouvelles options ajoutées, elles prendront effet dès que vous ouvrirez un nouveau bloc-notes ou lancerez une tâche.

Pour ajouter de nouveaux paramètres à votre modèle d'environnement Hadoop :

  1. Dans la section « Variables de session définies par l'utilisateur », cliquez sur « Nouvelle variable de session ».
  2. Sélectionnez les paramètres et les valeurs.