Integration mit der eigenständigen Version von „ watsonx.data “ ( Analytics Engine powered by Apache Spark )

Sie können „ Analytics Engine powered by Apache Spark “ mit „ watsonx.data “ integrieren.

Vorbereitende Schritte

Bevor Sie eine Analytics Engine powered by Spark-Instanz für watsonx.datakonfigurieren können, müssen Sie Folgendes ausführen:

Vorgehensweise

So konfigurieren Sie eine Analytics Engine powered by Spark-Instanz für watsonx.data:

  1. Richten Sie ein „ Cloud Pak for Data “-Speichervolume ein, um die Zertifikate von SSL / TLS für den watsonx.data HMS ( Hive Metastore Server) dauerhaft zu speichern. Weitere Informationen finden Sie unter „Speichervolumes verwalten “.

    1. Erstellen Sie einen Knotenportservice. Siehe Zugriff auf Hive Metastore (HMS) über NodePort.
    2. Importieren Sie ein selbst signiertes Zertifikat. Siehe Selbst signierte Zertifikate aus einem Hive -Metaspeicherserver in einen Java-Truststore importieren.
    3. Laden Sie die Datei truststore.jks auf den Speicherdatenträger in Cloud Pak for Datahoch.
  2. Erstellen Sie ein Zugriffstoken, um die Standardkonfiguration der „ Analytics Engine powered by Apache Spark “-Instanz festzulegen. Siehe API-Berechtigungstoken generieren.

  3. Führen Sie die API aus, um die Instanzstandardkonfiguration festzulegen:

    c. curl -X PATCH --location --header "Authorization: ZenApiKey {ACCESS_TOKEN}" --header "Accept: application/json" --header "Content-Type: application/merge-patch+json" --data '{
    d. <CONFIGURATION_DETAILS>
    }' "<https://<CloudPakforData_URL>/v4/analytics_engines/<INSTANCE_ID>/default_configs"
    
  4. CONFIGURATION_DETAILS: Kopieren Sie die folgenden Konfigurationsdetails und ersetzen Sie die folgenden Werte:

    • <infrastructure_node_ip>:<nodeport>: Rufen Sie den Infrastrukturknoten für die Instanz watsonx.data ab.
    • <hms-user-from-watsonx.data>: Cloud Pak for Data -Clusterbenutzer mit Administratorberechtigung oder ein Benutzer mit Metaspeicheradministratorzugriff. Informationen zum Erteilen des Metaspeicheradministratorzugriffs für einen Benutzer finden Sie unter Zugriff auf Hive verwalten.
    • <hms-password-from-watsonx.data>: Cloud Pak for Data -Clusteradministratorkennwort.
    • <truststore-password>: HMS truststore.jks -Kennwort, das Sie in Schritt 2 abgerufen haben
    • <watsonx-data-hms-certificate-volume>: Geben Sie den Namen des in Schritt 1 erstellten Datenträgers an.
    {
    "spark.sql.catalogImplementation": "hive",
    "spark.driver.extraClassPath": "/opt/ibm/connectors/iceberg-lakehouse/iceberg-3.3.2-1.2.1-hms-4.0.0-shaded.jar",
    "spark.sql.extensions": "org.apache.iceberg.spark.extensions.IcebergSparkSessionExtensions",
    "spark.sql.iceberg.vectorization.enabled": "false",
    "spark.sql.catalog.lakehouse": "org.apache.iceberg.spark.SparkCatalog",
    "spark.sql.catalog.lakehouse.type": "hive",
    "spark.sql.catalog.lakehouse.uri": "thrift://<infrastructure_node_ip>:<nodeport>",
    "spark.hive.metastore.client.auth.mode": "PLAIN",
    "spark.hive.metastore.client.plain.username": "<hms-user-from-watsonx.data>", # (for example, admin or metastoreadmin)
    "spark.hive.metastore.client.plain.password": "<hms-password-from-watsonx.data>",
    "spark.hive.metastore.use.SSL": "true",
    "spark.hive.metastore.truststore.type": "JKS",
    "spark.hive.metastore.truststore.path": "file:///<watsonx-data-hms-certificate-volume>/truststore.jks",
    "spark.hive.metastore.truststore.password": "<truststore-password>"
    }
    

Weitere Informationen