HDFS via Execution Engine for Hadoop connexion
Vous pouvez créer un actif de connexion pour HDFS via Execution Engine for Hadoop.
Utilisez la connexion « HDFS via Execution Engine for Hadoop » pour accéder aux données d'un système de fichiers distribué ( HDFS ) d' Hadoop au sein d'un cluster Hadoop.
Prérequis
- Votre administrateur doit enregistrer le cluster Hadoop à partir du panneau Hadoop Execution Engine . Demandez l' URL à votre administrateur.
- Vous devez créer une définition d'environnement d'exécution pour « Hadoop » dans votre projet.
- SSL certificat associé à l'adresse de connexion URL.
Chiffrement pris en charge
- Certificat SSL
- Cette connexion permet de se connecter à un environnement Hadoop sécurisé par Kerberos.
Conditions préalables pour l'authentification Kerberos
Si vous envisagez d'utiliser l'authentification Kerberos, vous devez remplir les conditions suivantes :
- Configurez la source de données pour l'authentification Kerberos. Facultatif : Cette connexion prend en charge Kerberos SSO avec impersonation de l'utilisateur, ce qui nécessite une configuration supplémentaire.
- Confirmez que le service que vous prévoyez d'utiliser pour la connexion prend en charge Kerberos. Pour plus d'informations, voir Kerberos authentification dans Cloud Pak for Data.
Données d'identification
Identifiants de connexion à la plateforme
Création d'une connexion HDFS via Execution Engine for Hadoop au cluster Hadoop
A partir de votre projet, sur le Actifs onglet, cliquez sur Nouvel actif > Se connecter à une source de données.
Sélectionnez HDFS via Execution Engine for Hadoop.
Saisissez un nom, une description et les informations de connexion.
Sélectionnez vos données d'identification de connexion à la plateforme.
Remarque: pour que les autres utilisateurs utilisent la connexion, ils doivent fournir leurs propres données d'identification Cloud Pak for Data .Entrez l' WebHDFS URL pour accéder à HDFS.
Important : Le site WebHDFS URL doit contenir le même URL dans la page Hadoop Registration Details (Détails de l'enregistrement) pour votre système cible Hadoop. Par exemple : <URL>/webhdfs/v1. L'administrateur peut confirmer l' URL à partir de Administration > Configuration et paramètres > Hadoop Execution Engine.Dans le champ « Certificat d' SSL », saisissez le certificat d' SSL correspondant à l'adresse de connexion URL (l'URL indiquée comme URL ) qui se trouve dans les détails d'enregistrement sous Administration > Configuration et paramètres > Moteur d'exécution d' Hadoop.
Cliquez sur Créer.
Conformité aux normes FIPS (Federal Information Processing Standards)
Cette connexion peut être utilisée sur un cluster compatible FIPS (tolérant FIPS); toutefois, elle n'est pas conforme à la norme FIPS.
Restriction
Dans l' SPSS Modeler e, vous ne pouvez exporter des données vers cette connexion ou vers une ressource de données connectée via l' HDFS via Execution Engine for Hadoop e que si ces données existent. Vous ne pouvez pas créer un nouvel ensemble de données.
Types de fichiers pris en charge
La connexion « HDFS via Execution Engine for Hadoop » prend en charge les types de fichiers suivants : CSV, texte délimité, JSON et Parquet.