Auf den Spark-Protokollserver zugreifen und ihn anpassen

Der Spark-History-Server liefert den Status laufender und abgeschlossener Spark-Jobs auf einer bereitgestellten Instanz von Analytics Engine powered by Apache Spark. Wenn Sie die Leistung der verschiedenen Phasen Ihres Spark-Jobs analysieren möchten, können Sie die Details im Spark-History-Server einsehen.

Sie können auf den Spark-Protokollserver mit zwei Methoden zugreifen und ihn anpassen:

Hinweise

  • Wenn Aktive Jobs abgebrochen oder gestoppt werden, wird die Spark-Anwendung auf der Registerkarte Unvollständige Anwendungen angezeigt.
  • Wenn Sie den Spark-Protokollserver öffnen, weisen nur die auf der Landing-Page aufgelisteten Spark-Anwendungen Zeitmarken in Ihrer Zeitzone auf. Wenn Sie einen Drilldown für weitere Informationen durchführen, werden alle anderen Zeitmarkenwerte in UTC angegeben. Dies ist das standardmäßige Open-Source-Spark-Verhalten.

Über den Cloud Pak for Data -Web-Client auf den Spark-Protokollserver zugreifen

Gehen Sie wie folgt vor, um über den Web-Client auf den Spark-Protokollserver zuzugreifen und diesen anzupassen:

  1. Melden Sie sich bei Cloud Pak for Dataan.
  2. Navigationsmenü Cloud Pak for DataWählen Sie im Navigationsmenü „Services“ > „Instances“ und anschließend die Instanz „ Analytics Engine powered by Apache Spark “ aus.
  3. Klicken Sie auf die Registerkarte Spark-Protokoll , um die Details der verarbeiteten Anwendungen anzuzeigen. Sie können den Spark-Protokollserver starten und stoppen. Gehen Sie wie folgt vor, um die Seite Benutzerschnittstelle des Spark-Protokollservers zu öffnen:
    1. Klicken Sie auf Verlaufsserver starten. Das Fenster Spark-Protokollserver starten wird geöffnet.
    2. Erhöhen oder verringern Sie den Wert für Kerne und Speicher (GB).
    3. Klicken Sie auf Start. Die Statusnachricht wird angezeigt.
    4. Klicken Sie auf Verlaufsserver stoppen , um den aktiven Server zu stoppen.
    5. Klicken Sie auf Spark-Protokoll anzeigen , um das vollständige Protokoll der verarbeiteten Anwendungen anzuzeigen.

Zugriff auf den Spark-Protokollserver über die REST-API

Der Verlaufsserver wird für eine Instanz von Analytics Engine powered by Apache Spark erst dann gestartet, wenn Sie die Start-API des Verlaufsservers aufrufen. Der History-Server wird angehalten, wenn Sie die Stopp-API des History-Servers aufrufen oder wenn die Instanz „ Analytics Engine powered by Apache Spark “ gelöscht wird.

Mit den Befehlen „ cURL “ starten und stoppen Sie den History-Server. Für den Zugriff auf den Protokollserver benötigen Sie den Endpunkt des Spark-Protokollservers und das Zugriffstoken für die Serviceinstanz. Weitere Informationen dazu, wie Sie diese Informationen abrufen können, finden Sie unter „Verwalten von „ Analytics Engine powered by Apache Spark “-Instanzen “.

Den History-Server starten

Um den Spark-Verlaufsserver zu starten, geben Sie folgenden cURL Befehl ein:

curl -ik -X POST <HISTORY_SERVER_ENDPOINT> -H "Authorization: ZenApiKey ${TOKEN}"

Beispiel für die Antwort:

{
    "state": "started",
    "cores": "1",
    "memory": "4G",
    "start_time": "2022-06-08T11:28:16.521Z"
}

Es wird einer der folgenden Rückgabecodes angezeigt:

Rückkehrcode Bedeutung des Rückgabecodes Beschreibung
200 OK Der History-Server wurde erfolgreich gestartet
401 Nicht berechtigt Ungültiges Berechtigungstoken
500 Interne Serverfehler Ungültige Instanz-ID oder andere interne Serverfehler

Status des Protokollservers anzeigen

Geben Sie den folgenden cURL -Befehl ein, um den Status des Spark-Protokollservers anzuzeigen:

curl -ik -X GET <HISTORY_SERVER_ENDPOINT> -H "Authorization: ZenApiKey ${TOKEN}"

Beispiel für die Antwort:

{
    "state": "started",
    "cores": "1",
    "memory": "4G",
    "start_time": "2022-06-08T11:28:16.521Z"
}

Es wird einer der folgenden Rückgabecodes angezeigt:

Rückkehrcode Bedeutung des Rückgabecodes Beschreibung
200 OK Protokollserverdetails erfolgreich abgerufen
401 Nicht berechtigt Ungültiges Berechtigungstoken
500 Interne Serverfehler Ungültige Instanz-ID oder andere interne Serverfehler

Den History-Server anhalten

Um den Verlaufsserver zu stoppen, geben Sie folgenden cURL -Befehl ein:

curl -ik -X DELETE <HISTORY_SERVER_ENDPOINT> -H "Authorization: ZenApiKey ${TOKEN}"

Es wird einer der folgenden Rückgabecodes angezeigt:

Rückkehrcode Bedeutung des Rückgabecodes Beschreibung
204 Kein Inhalt Der History-Server wurde erfolgreich beendet
401 Nicht berechtigt Ungültiges Berechtigungstoken
500 Interne Serverfehler Ungültige Instanz-ID oder andere interne Serverfehler

Web UI des Protokollservers öffnen

So rufen Sie den Link zum Spark-History-Server für Ihre bereitgestellte Instanz auf:

  1. Klicken Sie im Navigationsmenü Navigationsmenü Cloud Pak for Data in Cloud Pak for Dataauf Services > Instanzen, suchen Sie die Instanz und klicken Sie darauf, um die Instanzdetails anzuzeigen.
  2. Kopieren Sie den Endpunkt des Ansichtsprotokollservers.
  3. Fügen Sie den Endpunkt des Verlaufsservers in einen neuen Tab im selben Browserfenster von Cloud Pak for Data ein, um die Benutzeroberfläche des Verlaufsservers anzuzeigen.

Hinweise

  • Stellen Sie sicher, dass der Spark-Protokollserver aktiv ist, bevor Sie die Web UIöffnen.
  • Protokolllinks unter den Registerkarten Stages und Executors der Benutzerschnittstelle des Spark-Protokollservers funktionieren nicht, da Protokolle mit den Spark-Ereignissen nicht beibehalten werden.
  • Die Protokolle stdout und stderr werden in der Benutzerschnittstelle des Spark-Protokollservers nicht unterstützt.

Spark-Protokollserver anpassen

Standardmäßig belegt der Spark-Protokollserver 1 CPU-Core und 4 GiB Speicher, während er ausgeführt wird. Wenn Sie dem Spark-Protokollserver weitere Ressourcen zuordnen möchten, können Sie die folgenden Eigenschaften mit der REST API auf die gewünschten Werte setzen:

  • ae.spark.history-server.cores für die Anzahl der CPU-Cores
  • ae.spark.history-server.memory für die Speicherkapazität

CPU-Cores und Speichereinstellungen aktualisieren

Rufen Sie vom Protokollserverendpunkt die Instanz-ID ab. Weitere Informationen dazu, wie Sie diese Informationen abrufen können, finden Sie unter „Verwalten von „ Analytics Engine powered by Apache Spark “-Instanzen “.

Der Endpunkt hat das folgende Format: https://<CloudPakforData_URL>/v4/analytics_engines/<INSTANCE_ID>/spark_history_server.

Aktualisieren Sie die Einstellungen für CPU-Cores und Speicher mithilfe der REST-API wie folgt:

curl --location --request PATCH <https://<CloudPakforData_URL>/v4/analytics_engines/<INSTANCE_ID>/default_configs -H "Authorization: ZenApiKey ${TOKEN}" --header 'Content-Type: application/json' --data-raw '{
        "ae.spark.history-server.cores": "2",
        "ae.spark.history-server.memory": "8G"
}'

Zusätzliche Anpassungen

Sie können den Spark-Protokollserver weiter anpassen, indem Sie der Spark-Standardkonfiguration Ihrer Instanz von Analytics Engine Power by Apache Spark Eigenschaften hinzufügen. Siehe Standardkonfigurationsoptionen für Spark-Protokolle.

Best Practices

Stoppen Sie den Spark-Protokollserver immer, wenn Sie ihn nicht mehr benötigen. Beachten Sie, dass der Spark-Protokollserver kontinuierlich CPU-und Speicherressourcen verbraucht, während sein Status 'Gestartet' lautet.