Analyse des données d' Apache Hadoop s à l'aide de l' Execution Engine for Apache Hadoop

Vous pouvez créer et entraîner des modèles sur un cluster d' Hadoop. Si vos données sont stockées dans un système de stockage Hive ou HDFS au sein d'un cluster Hadoop, vous pouvez les exploiter directement sur ce cluster Hadoop.

Service Le service « Execution Engine for Apache Hadoop » n'est pas disponible par défaut. Un administrateur doit installer ce service sur la plateforme IBM Cloud Pak for Data. Pour vérifier si le service est installé, ouvrez le catalogue des services et vérifiez s'il est activé.

Dans un projet avec l' Watson Studio, vous trouverez des modèles d'environnement d' Hadoop sur la page Environnements. Voir les environnements Hadoop.

Vous pouvez utiliser les environnements d' Hadoop s de la manière suivante :

  • Vous pouvez entraîner un modèle sur le cluster Hadoop en sélectionnant un environnement Hadoop dans un notebook Jupyter.
  • Vous pouvez gérer un modèle sur le cluster Hadoop en exécutant les méthodes de l'utilitaire d'intégration Hadoop dans un notebook Jupyter.
  • Vous pouvez exécuter des flux d' Data Refinery s sur le cluster Hadoop en sélectionnant un environnement Hadoop pour la tâche Data Refinery.

Ce schéma montre comment les data scientists travaillant sur un projet au sein d'un cluster Cloud Pak for Data peuvent entraîner un notebook sur un cluster Hadoop à l'aide de données provenant du cluster Hadoop.

Hadoop architecture

En savoir plus