Apache HDFS Verbindung
Um auf Ihre Daten in „ Apache HDFS “ zugreifen zu können, erstellen Sie dafür ein Verbindungs-Asset.
Apache Hadoop Distributed File System (HDFS) ist ein verteiltes Dateisystem, das auf Standardhardware ausgeführt werden kann. Apache HDFS war früher Hortonworks- HDFS.
Unterstützte Versionen
Apache HDFS 3.1.
Voraussetzungen für die Kerberos-Authentifizierung
Wenn Sie die Kerberos-Authentifizierung verwenden möchten, müssen Sie die folgenden Anforderungen erfüllen:
- Konfigurieren Sie die Datenquelle für die Kerberos-Authentifizierung. Optional: Diese Verbindung unterstützt Kerberos SSO mit Benutzer-Impersonation, was zusätzliche Konfiguration erfordert.
- Vergewissern Sie sich, dass der Dienst, den Sie für die Verbindung nutzen wollen, Kerberos unterstützt. Weitere Informationen finden Sie unter Kerberos-Authentifizierung in Cloud Pak for Data.
- Ein Administrator muss einen Satz der folgenden Einrichtungsschritte ausführen:
- Kerberos ohne SSO: Authentifizierung der Plattformverbindungen mit Kerberos
- Kerberos SSO: Konfiguration für Kerberos SSO
Stellen Sie eine Verbindung zu Apache HDFS her
Zum Erstellen des Verbindungsassets benötigen Sie die folgenden Verbindungsdetails. Die „ WebHDFS “ ( URL ) ist erforderlich.
Die im Verbindungsformular verfügbaren Eigenschaften hängen davon ab, ob Sie „Mit Apache Hive verbinden“ auswählen, damit Sie Tabellen in die Datenquelle „ Hive “ schreiben können.
- WebHDFS URL um auf HDFS zuzugreifen.
- Hive Host : Hostname oder IP-Adresse des „ Apache Hive “-Servers.
- Hive Datenbank : Die Datenbank unter Apache Hive.
- Hive Portnummer : Die Portnummer des „ Apache Hive “-Servers. Der Standardwert lautet
10000. - Hive HTTP Pfad : Der Pfad des Endpunkts, z. B. gateway/default/hive, wenn der Server für den Transportmodus „ HTTP “ konfiguriert ist.
- SSL Zertifikat (sofern vom Server „ Apache Hive “ verlangt).
Authentifizierungsmethode
Sie können Kerberos -Berechtigungsnachweise oder Benutzername und Kennwortauswählen.
Für Kerberos -Berechtigungsnachweisemüssen Sie die Voraussetzung für Kerberos -Authentifizierung erfüllen und die folgenden Verbindungsdetails benötigen. Sie benötigen außerdem die folgenden Details für Hive , wenn Sie Connect to Apache Hiveausgewählt haben:
- Der SPN (Service Principal Name), der für die Datenquelle konfiguriert ist.
- Name des Benutzerprinzipals für die Verbindung zur kerberisierten Datenquelle.
- Die Chiffrierschlüsseldatei für den Benutzerprincipalnamen, der für die Authentifizierung beim Key-Distribution-Center (KDC) verwendet wird.
Für Benutzername und Kennwortgeben Sie auch Werte für den Hive -Benutzer und das Kennwort an, wenn Sie eine Verbindung zu Apache Hiveherstellen.
Für Berechtigungsnachweise und Zertifikatekönnen Sie geheime Schlüssel verwenden, wenn eine Vault für die Plattform konfiguriert ist und der Service Vaults unterstützt. Weitere Informationen finden Sie unter Geheime Schlüssel aus Vaults in Verbindungen verwenden.
Konformität mit FIPS (Federal Information Processing Standards)
Diese Verbindung ist FIPS-konform und kann in einem FIPS-fähigen Cluster verwendet werden.
Apache HDFS Einrichtung
Unterstützte Dateitypen
Die Verbindung „ Apache HDFS “ unterstützt folgende Dateiformate: Avro, CSV, textgetrennter Text, Excel, JSON, ORC, Parquet, SAS, SAV, SHP und XML.
Tabellenformate
Neben „Flat File“ unterstützt die Verbindung „ Apache HDFS “ folgende Data-Lake-Tabellenformate: „ Delta Lake “ und „Iceberg“.