Execution Engine for Apache Hadoop entornos

Puede crear plantillas de entorno Hadoop y sesiones Jupyter Enterprise Gateway (JEG) en proyectos analíticos de Watson Studio para ejecutar trabajos en el clúster Hadoop .

Los entornos de ServiceExecution Engine for Apache Hadoop no están disponibles de forma predeterminada. Un administrador debe instalar el servicio « Execution Engine for Apache Hadoop » en la plataforma « IBM Cloud Pak for Data ». Para comprobar si el servicio está instalado, abra el catálogo de servicios y compruebe si el servicio está habilitado.

Utiliza un entorno de « Hadoop » cuando desees realizar las siguientes tareas:

Nota: Un entorno Hadoop se puede utilizar con un cuaderno Jupyter, pero no se aplica a los cuadernos en JupyterLab.
  • Entrena un modelo en el clúster de Hadoop en un cuaderno de Jupyter.
  • Gestiona un modelo en el clúster de Hadoop utilizando los métodos de la utilidad de integración de Hadoop dentro de un cuaderno de Jupyter.
  • Visualiza y perfecciona los datos de « Hadoop » ( HDFS, Hive y Impala ) en Watson Studio.
  • Ejecuta flujos de « Data Refinery » en el clúster de « Hadoop ».
  • Programa scripts de ` Python ` o `R` como tareas para ejecutarlas de forma remota en clústeres de ` Hadoop `.

Si utiliza Livy para ejecutar trabajos Spark en Hadoop, no utilice el entorno Hadoop . En su lugar, utiliza el entorno que se ejecuta localmente en el clúster de Cloud Pak for Data.

Plantillas de entorno de Hadoop

Para crear una plantilla de entorno Hadoop :

  1. En el separador Gestionar del proyecto, seleccione la página Entornos y, a continuación, en Plantillas, pulse Nueva plantilla.
  2. Introduce un nombre y una descripción.
  3. Selecciona el tipo de configuración de entorno « Hadoop ».
  4. Selecciona uno de los sistemas « Hadoop » registrados en el menú desplegable de configuración de « Hadoop ».
    • Si el trabajo utiliza los paquetes de Python, disponibles en Watson Studio Local y Cloud Pak for Data, en el clúster Hadoop, puedes seleccionar la imagen que se ha subido desde la página de registro Hadoop en el campo «Versión de software».
  5. Utiliza el campo «YARN Queue» para seleccionar la cola en la que se ejecutará tu entorno. Esto se aplica a los trabajos y a las ejecuciones de cuadernos.
    • Por defecto, todas las ejecuciones se envían a la cola predeterminada de YARN. El administrador de Hadoop puede configurar y mostrar la lista de colas de Yarn disponibles que puedes utilizar.
    • El administrador de Hadoop debería haber concedido al usuario Watson Studio Local los permisos necesarios para enviar el trabajo a la cola de YARN especificada.
  6. Seleccione el tamaño del entorno con el que va a ejecutar el cuaderno o los trabajos.
  7. Después de haber guardado el nuevo entorno, puede seleccionarlo como un entorno para cuadernos y trabajos.

Añadir ajustes de usuario

Cuando trabajes con conjuntos de datos de gran tamaño en Hadoop o necesites ajustar tu sesión de Spark, utiliza las variables de sesión definidas por el usuario. Las variables son parámetros que te ayudan a definir opciones adicionales de Spark que se pueden utilizar al iniciar un cuaderno o al ejecutar un trabajo.

Antes de poder utilizar las variables, el administrador de Hadoop debe definir primero la lista de opciones disponibles y el rango de valores de dichas opciones como parte de la configuración de Hadoop. Ponte en contacto con el administrador de Hadoop para saber qué opciones puedes configurar. Una vez añadidas las nuevas opciones, estas entrarán en vigor al abrir un nuevo cuaderno o al ejecutar un trabajo.

Para añadir nuevos parámetros a la plantilla de entorno Hadoop :

  1. En la sección «Variables de sesión definidas por el usuario», haz clic en «Nueva variable de sesión ».
  2. Selecciona los parámetros y los valores.