Integration mit der eigenständigen Version von „ watsonx.data “ ( Analytics Engine powered by Apache Spark )
Sie können „ Analytics Engine powered by Apache Spark “ mit „ watsonx.data “ integrieren.
Vorbereitende Schritte
Bevor Sie eine Analytics Engine powered by Spark-Instanz für watsonx.datakonfigurieren können, müssen Sie Folgendes ausführen:
- Installieren Sie watsonx.data eigenständig. Weitere Informationen finden Sie unter Eigenständige watsonx.datainstallieren.
- Installieren Sie Cloud Pak for Data 4.7.x mit Analytics Engine powered Apache Spark. Weitere Informationen finden Sie unter „ Analytics Engine powered by Apache Spark installieren “.
- Stellen Sie eine Instanz des Dienstes „ Analytics Engine powered by Apache Spark “ bereit. Siehe „Bereitstellung einer Instanz “.
Vorgehensweise
So konfigurieren Sie eine Analytics Engine powered by Spark-Instanz für watsonx.data:
Richten Sie ein „ Cloud Pak for Data “-Speichervolume ein, um die Zertifikate von SSL / TLS für den watsonx.data HMS ( Hive Metastore Server) dauerhaft zu speichern. Weitere Informationen finden Sie unter „Speichervolumes verwalten “.
- Erstellen Sie einen Knotenportservice. Siehe Zugriff auf Hive Metastore (HMS) über NodePort.
- Importieren Sie ein selbst signiertes Zertifikat. Siehe Selbst signierte Zertifikate aus einem Hive -Metaspeicherserver in einen Java-Truststore importieren.
- Laden Sie die Datei
truststore.jksauf den Speicherdatenträger in Cloud Pak for Datahoch.
Erstellen Sie ein Zugriffstoken, um die Standardkonfiguration der „ Analytics Engine powered by Apache Spark “-Instanz festzulegen. Siehe API-Berechtigungstoken generieren.
Führen Sie die API aus, um die Instanzstandardkonfiguration festzulegen:
c. curl -X PATCH --location --header "Authorization: ZenApiKey {ACCESS_TOKEN}" --header "Accept: application/json" --header "Content-Type: application/merge-patch+json" --data '{ d. <CONFIGURATION_DETAILS> }' "<https://<CloudPakforData_URL>/v4/analytics_engines/<INSTANCE_ID>/default_configs"CONFIGURATION_DETAILS: Kopieren Sie die folgenden Konfigurationsdetails und ersetzen Sie die folgenden Werte:
<infrastructure_node_ip>:<nodeport>: Rufen Sie den Infrastrukturknoten für die Instanz watsonx.data ab.<hms-user-from-watsonx.data>: Cloud Pak for Data -Clusterbenutzer mit Administratorberechtigung oder ein Benutzer mit Metaspeicheradministratorzugriff. Informationen zum Erteilen des Metaspeicheradministratorzugriffs für einen Benutzer finden Sie unter Zugriff auf Hive verwalten.<hms-password-from-watsonx.data>: Cloud Pak for Data -Clusteradministratorkennwort.<truststore-password>: HMStruststore.jks-Kennwort, das Sie in Schritt 2 abgerufen haben<watsonx-data-hms-certificate-volume>: Geben Sie den Namen des in Schritt 1 erstellten Datenträgers an.
{ "spark.sql.catalogImplementation": "hive", "spark.driver.extraClassPath": "/opt/ibm/connectors/iceberg-lakehouse/iceberg-3.3.2-1.2.1-hms-4.0.0-shaded.jar", "spark.sql.extensions": "org.apache.iceberg.spark.extensions.IcebergSparkSessionExtensions", "spark.sql.iceberg.vectorization.enabled": "false", "spark.sql.catalog.lakehouse": "org.apache.iceberg.spark.SparkCatalog", "spark.sql.catalog.lakehouse.type": "hive", "spark.sql.catalog.lakehouse.uri": "thrift://<infrastructure_node_ip>:<nodeport>", "spark.hive.metastore.client.auth.mode": "PLAIN", "spark.hive.metastore.client.plain.username": "<hms-user-from-watsonx.data>", # (for example, admin or metastoreadmin) "spark.hive.metastore.client.plain.password": "<hms-password-from-watsonx.data>", "spark.hive.metastore.use.SSL": "true", "spark.hive.metastore.truststore.type": "JKS", "spark.hive.metastore.truststore.path": "file:///<watsonx-data-hms-certificate-volume>/truststore.jks", "spark.hive.metastore.truststore.password": "<truststore-password>" }