Erweiterung der Analysen mit Spark ( Analytics Engine powered by Apache Spark )
Sie können „ Analytics Engine powered by Apache Spark “ als Rechenplattform nutzen, um Analyse- und Machine-Learning-Aufträge auszuführen.
IBM Analytics Engine powered by Apache Spark bietet einen Managed Service für die Nutzung von „ Apache Spark “ mit zusätzlichen Funktionen wie automatischer Skalierung, Ressourcenkontingenten und Warteschlangen. Sie können Spark-Anwendungen interaktiv ausführen, indem Sie Jupyter Notebooks und Skripte verwenden, sowohl in der „ Python “ als auch in R. Die Anwendungen können auch mithilfe von Jobs aus Notebook, Bereitstellungsbereich oder mithilfe der Spark-Serviceinstanz ausgeführt werden. Die „ IBM “ ( Analytics Engine powered by Apache Spark ) erstellt On-Demand-Spark-Cluster und führt Workloads mithilfe von Angeboten wie Spark-Anwendungen, Spark-Kernels und Spark-Labs aus.
Dienst Der Dienst „ IBM “ ( Analytics Engine powered by Apache Spark ) ist standardmäßig nicht verfügbar. Ein Administrator muss diesen Dienst auf der „ IBM Cloud Pak for Data “-Plattform installieren. Um festzustellen, ob der Service installiert ist, öffnen Sie den Servicekatalog und prüfen Sie, ob der Service aktiviert ist.
Bei jeder Übergabe eines Jobs wird ein dedizierter Spark-Cluster für den Job erstellt. Sie können die Größe des Spark-Treibers, die Größe des Executor und die Anzahl der Executor für den Job angeben. Auf diese Weise können Sie eine vorhersehbare und konsistente Leistung erzielen.
Wenn ein Job beendet wird, wird der Cluster automatisch bereinigt, sodass die Ressourcen für andere Jobs verfügbar sind. Der Service enthält außerdem Schnittstellen, mit deren Hilfe Sie die Leistung Ihrer Spark-Anwendungen analysieren und Fehler beheben können.
In „ IBM Cloud Pak for Data “ können Sie Spark-Workloads auf zwei Arten ausführen:
- In einem Notebook, das in einer Spark-Umgebung in einem Projekt in Watson Studio ausgeführt wird
- Außerhalb von „ Watson Studio “, in einer Instanz von „ IBM “ Analytics Engine powered by Apache Spark unter Verwendung der Spark-Job-APIs
Spark-Umgebungen in Projekten
Wenn der Watson Studio Dienst installiert ist, fügt der IBM Analytics Engine powered by Apache Spark -Dienst automatisch eine Reihe von Standard-Spark-Umgebungsvorlagen zu Projekten hinzu. Sie können auch angepasste Spark-Umgebungsvorlagen in einem Projekt erstellen.
Sie können Spark-Umgebungsvorlagen unter Vorlagen auf der Seite Umgebungen auf der Registerkarte Verwalten Ihres Projekts anzeigen.
Weitere Informationen finden Sie unter Spark-Umgebungen.
Spark-APIs
Sie können Spark-Workloads mithilfe der Spark-Job-APIs direkt in „ IBM “ ( Analytics Engine powered by Apache Spark ) ausführen.
Sie können diese Workloadtypen mit Spark-Jobs-APIs ausführen:
- Spark-Anwendungen, die Spark SQL ausführen
- Datentransformationsjobs
- Data-Science-Jobs
- Jobs für maschinelles Lernen