使用 Execution Engine for Apache Hadoop 分析 Apache Hadoop 数据

您可以在 Hadoop 集群上构建和训练模型。 如果您在 Hadoop 集群上的 Hive 或 HDFS 存储系统中存有数据,则可以直接在 Hadoop 集群上处理这些数据。

服务 “ Execution Engine for Apache Hadoop ” 服务默认情况下不可用。 管理员必须在 IBM Cloud Pak for Data 平台上安装此服务。 要确定该服务是否已安装,请打开“服务”目录,并检查该服务是否已启用。

在 Watson Studio 项目中,您可以在 “环境 ”页面上找到 Hadoop 环境模板。 请参阅 Hadoop 环境

您可以通过以下方式使用 Hadoop 环境:

  • 您可以在 Hadoop 集群上训练模型,方法是在Jupyter笔记本中选择 Hadoop 环境。
  • 您可以在 Jupyter 笔记本中运行 Hadoop 集成实用程序方法,从而管理 Hadoop 集群上的模型。
  • 您可以在 Hadoop 集群上运行 Data Refinery 流程,方法是为 Data Refinery 作业选择 Hadoop 环境。

此图展示了在 Cloud Pak for Data 集群上开展项目的数据科学家,如何利用 Hadoop 集群上的数据,在 Hadoop 集群上训练笔记本。

Hadoop 建筑

了解更多