Drei Arbeiter am Computer

Verwaltung von KI-Workloads in großem Maßstab

Wie man KI-Workloads in großem Maßstab verwaltet

Die Verwaltung von KI-Workloads im großen Maßstab bezieht sich auf die Bereitstellung, den Betrieb und die Optimierung von KI-Modellen und -Anwendungen in komplexen Unternehmensumgebungen. Dieser Prozess erstreckt sich über den gesamten Lebenszyklus der künstlichen Intelligenz (KI), vom ersten Training bis zur Produktionsinferenz.

Wenn Anwendungen von Pilotprogrammen in die Serienproduktion überführt werden, wird der Betrieb kompliziert. Ein Finanzdienstleistungsunternehmen beispielsweise betreibt oft ein Betrugserkennungsmodell, das Transaktionen in Echtzeit zusammen mit einem kundenorientierten Assistenten bewertet. Jedes dieser Szenarien hat unterschiedliche Latenzanforderungen, Anforderungen an die Datenresidenz und Compliance-Kontrollen.

Heutzutage verwalten die meisten Unternehmen in der Produktion viele solche Systeme auf einmal. Die Herausforderungen werden nicht einfacher, je mehr Systeme hinzukommen; stattdessen vervielfachen sie sich. In einer Studie des IBM Institute for Business Value (IBV) gaben 77 % der Führungskräfte an, dass sie KI schnell einführen müssen, um wettbewerbsfähig zu bleiben. Allerdings stimmen nur 25 % voll und ganz zu, dass die IT-Infrastruktur ihres Unternehmens die Skalierung von KI im gesamten Unternehmen unterstützen kann.

Modelltraining und KI-Inferenz haben unterschiedliche Anforderungen. Für das Training ist eine enorme Rechenleistung erforderlich, die kontinuierlich auf Clustern spezialisierter Prozessoren läuft. Inferenz hingegen läuft in der Produktion ab, wo Latenz und Verfügbarkeit wichtiger sind als die rohe Rechenleistung.

Laut McKinsey wird erwartet, dass Inferenz-Workloads bis 2030 mehr als die Hälfte aller KI-Rechenleistungen ausmachen. Dieser Wandel bedeutet, dass der effiziente Betrieb von Modellen zu einem ebenso dringenden Geschäftsanliegen wird wie deren Entwicklung. 1

Angesichts all dieser Komplexität ist das Management von KI-Workloads im großen Maßstab nicht nur ein technisches Problem. Es handelt sich um eine operative Angelegenheit. Die Unternehmen, die diese Arbeit gut machen, sind diejenigen, die Best Practices für die Infrastruktur, die Verwaltung und den täglichen Betrieb einführen.

Herausforderungen bei der Verwaltung von KI-Workloads im großen Maßstab

Im Vergleich zu herkömmlichen Workloads verarbeiten KI-Workloads in der Regel unstrukturierte Daten (zum Beispiel Bilder, Text, Audio), was eine Komplexität mit sich bringt, für die eine Standard-IT-Infrastruktur nicht konzipiert wurde.

Rechenleistung wird zur am stärksten beanspruchten Ressource. Training und Inferenz erfordern grafische Verarbeitungseinheiten (GPUs) und Tensor-Processing Units (TPUs), die teurer in der Bereitstellung und im Betrieb sind als Standardrechenleistungen. Daher werden Kostenvorhersehbarkeit und Ressourcenallokation zu fortlaufenden Herausforderungen.

Die Rechenzentrumsinfrastruktur fügt eine weitere Ebene hinzu. Für das Training von KI-Workloads werden hochdichte Rechencluster mit fortschrittlicher Kühlung benötigt, während für Inferenz-Workloads ein latenzarmer Zugriff auf Daten und Anwendungen erforderlich ist. Beide übten Druck auf die ältere Rechenzentrumsinfrastruktur aus. Energiebeschränkungen beeinflussen zudem zunehmend die Skalierbarkeit, weshalb die Stromverfügbarkeit ein wichtiges Thema ist.

Auch die Leistungsanforderungen werden komplexer. Verzögerungen und Engpässe dürfen Produktionsanwendungen nicht ausbremsen, und Inferenz-Workloads müssen in der Nähe der Daten und Anwendungen positioniert werden, die sie bedienen, beispielsweise in Edge-Umgebungen.

Governance bringt auch Komplexität auf Organisations- und Compliance-Ebene mit sich. Mit zunehmender Vermehrung der Systeme wird es schwieriger, eine konsistente Datenabstammung, Audit-Trails und Cybersicherheitskontrollen aufrechtzuerhalten. Anforderungen an Datenresidenz und Datensouveränität, die je nach Region variieren, stellen zusätzliche Herausforderungen dar, insbesondere für Unternehmen, die grenzüberschreitend tätig sind.

Und schließlich stellt das operative Know-how für viele Unternehmen eine Qualifikationslücke dar. Der Betrieb von Workloads in der Produktion erfordert Fachkenntnisse in Data Engineering, Machine Learning Operations (MLOps) und Infrastrukturmanagement, die viele Unternehmen noch entwickeln.

Das Management mehrerer Systeme in unterschiedlichen Lebenszyklusphasen geht auch über traditionelle IT-Workflows hinaus. Viele Teams sind auf die daraus resultierende Komplexität nicht vorbereitet.

AI Academy

KI-Bereitschaft mit Hybrid Cloud

Das Programm, das von führenden IBM Experten geleitet wird, soll Führungskräften dabei helfen, das nötige Wissen zu erwerben, um die Prioritäten für KI-Investitionen zu setzen, die zu mehr Wachstum führen.

Best Practices für die Verwaltung von KI-Workloads in großem Maßstab

Die mit KI-Workloads verbundenen Herausforderungen sind real, aber sie sind bewältigbar. Die folgenden Betriebspraktiken können, wenn sie einheitlich angewendet werden, einen erheblichen Unterschied bei der Verwaltung von KI-Workloads im großen Maßstab ausmachen.

1. Anpassung der Infrastruktur an die Arbeitslast

Nicht jeder KI-Workload hat die gleichen Anforderungen, und sie so zu behandeln, als ob sie es wären, führt zu verschwendeten Ressourcen und Leistungsproblemen. Durch die Anpassung von Rechenleistung, Speicher und Netzwerk an die Anforderungen der einzelnen Workloads sind die Kosten vorhersehbar.

Workload Schedulers helfen Teams dabei, Rechenleistung effizient zuzuweisen und den übermäßigen Kauf von GPU-Ressourcen in Produktionsumgebungen zu vermeiden.

2. Werkzeuge standardisieren

Wenn jedes Team anders bereitstellt, erfolgt die Fehlerbehandlung in Silos.

Konsistente KI-Datenpipelines, gemeinsame Überwachungstools und gemeinsame Betriebsprozesse reduzieren diese Reibung, wenn die Anzahl der Systeme wächst. Neue Teams kommen schneller voran und die Qualität lässt sich leichter aufrechterhalten.

3. Frühzeitige Governance aufbauen

Compliance-Anforderungen lassen sich wesentlich einfacher von Anfang an einbauen als nachträglich hinzufügen.

Unternehmen, die Datenresidenz, Prüfpfade und Zugriffskontrollen als Anforderungen des ersten Tages und nicht als nachträgliche Überlegung behandeln, sind diejenigen, die weniger nacharbeiten, wenn sich die Vorschriften ändern. Für Unternehmen die regionsübergreifend arbeiten und in denen sich die Anforderungen erheblich unterscheiden können, ist diese Arbeit unerlässlich.

4. Die Qualifikationslücke schließen

Der Betrieb von KI in der Produktion erfordert Menschen, die Data Engineering, Modellbetrieb und Infrastrukturmanagement verstehen. In den meisten Unternehmen wird diese Kombination noch aufgebaut.

Ob durch Neueinstellungen, Schulungen oder externe Partnerschaften – wenn diese Lücke frühzeitig geschlossen wird, läuft der Betrieb reibungslos und die Kosten bleiben unter Kontrolle.

5. Observability integrieren

Ein Modell, das bei der Markteinführung gut abschneidet, wird nicht unbedingt auch sechs Monate später noch gut abschneiden. Daten verschieben sich, Bedingungen ändern sich und die Genauigkeit schwankt auf eine Weise, die nicht immer offensichtlich ist, bis ein Geschäftsergebnis beeinträchtigt wird.

Observability-Tools wie Prometheus und IBM Turbonomic sind ein kritischer Bestandteil jeder Produktionsbereitstellung, die Latenz, Durchsatz und Modellleistung über die Zeit verfolgen. Regelmäßige Nachschulungen und Wartung verhindern, dass kleine Probleme zu größeren werden.

6. Komplexität einplanen

Ein System ist überschaubar. Zehn Systeme in verschiedenen Umgebungen mit unterschiedlichen Teams, Anbietern und Compliance-Anforderungen stellen ein weitaus komplexeres Szenario dar.

Unternehmen, die ohne ständige Krisen wachsen können, sind diejenigen, die frühzeitig Strukturen schaffen. Das bedeutet klare Prozesse, definierte Verantwortlichkeiten und Werkzeuge, um alle KI-Workloads, die in der Produktion laufen, im Blick zu behalten.

Infrastruktur für die Verwaltung von KI-Workloads im großen Maßstab

Um den Herausforderungen der Verwaltung skalierbarer KI-Workloads gerecht zu werden, ist eine spezielle KI-Infrastruktur erforderlich. Diese Infrastruktur umfasst Hardware-, Software-, Netzwerk- und Speicherressourcen, die den Aufbau, das Training und die Bereitstellung großer KI-Modelle, wie z. B. Large Language Models (LLMs), über Rechenzentren und KI-Rechenzentren hinweg unterstützen können. Von der Modellbereitstellung bis zur laufenden Überwachung hat jede Phase unterschiedliche Infrastrukturanforderungen.

Infrastrukturkomponenten zur Verwaltung von KI-Workloads im großen Maßstab umfassen folgende Elemente:

  • Hybrid Cloud
  • Rechenressourcen
  • Microservices
  • Containerisierung und Kubernetes
  • Datenpipelines und Speicher
  • MLOps und GenAIOps

Hybrid Cloud

Heutzutage setzen Unternehmen auf hybride Multicloud-Umgebungen, die Public-Cloud-Services verschiedener Anbieter kombinieren und sich über die Infrastrukturen mehrerer Cloud-Provider erstrecken.

Keine einzelne IT-Umgebung kann alle Anforderungen von KI-Workloads erfüllen. Public-Cloud-Plattformen, die von Anbietern wie Amazon Web Services (AWS), Microsoft Azure, IBM Cloud und Google Cloud bereitgestellt werden, bieten bedarfsgerechte GPU-Kapazitäten, die sich für umfangreiche Trainings-Workloads in Hyperscale-Umgebungen eignen. Allerdings müssen Inferenz-Workloads, die mit sensiblen Kundendaten verknüpft sind, oft lokal oder in einer Private Cloud bleiben, um regulatorische Anforderungen zu erfüllen.

Die Hybrid Cloud bietet Unternehmen die Flexibilität, solche Entscheidungen über die Platzierung je nach den Anforderungen der einzelnen Workloads zu treffen, und ermöglicht gleichzeitig, dass cloudnative Technologien in allen Umgebungen einheitlich ausgeführt werden können.

Rechenressourcen

KI-Workloads, insbesondere Modelltraining, erfordern spezialisierte Rechenressourcen, darunter GPUs (wie NVIDIA) und TPUs, anstelle der Zentralprozessoren (CPUs), die traditionelle Unternehmenssysteme antreiben.

Frameworks wie TensorFlow und PyTorch sind für den Einsatz auf dieser Hardware ausgelegt und werden häufig für das Benchmarking der Leistung verwendet, bevor Workloads in die Produktion übernommen werden. Die Verfolgung der GPU-Auslastung und der Ressourcennutzung sowohl über die Trainings- als auch die Inferenzzyklen hinweg ist unerlässlich, um die Kosteneffizienz bei zunehmender Bereitstellung aufrechtzuerhalten.

Microservices

Viele Unternehmen bauen oder transformieren KI-Anwendungen, um eine Microservices-Architektur zu nutzen, die Anwendungen in kleinere, lose gekoppelte Komponenten aufteilt, die sich auf spezifische Geschäftsprozesse konzentrieren.

Dieser Ansatz erleichtert die unabhängige Entwicklung, Skalierung und Aktualisierung von KI-Workloads und ist ein wichtiger Bestandteil der Containerisierung für den Einsatz in hybriden Umgebungen.

Containerisierung und Kubernetes

Das Verständnis dafür, wie man containerisierte KI-Workloads in großem Umfang verwaltet, beginnt mit Containern, die die faktischen Recheneinheiten moderner Cloud-nativer Infrastrukturen darstellen. Container paketieren Anwendungen und deren Abhängigkeiten in portable Einheiten über eine Containerlaufzeit wie Docker, eine Open-Source-Plattform, die konsistent über Umgebungen hinweg läuft.

Die Container-Orchestrierungsplattform Kubernetes kann automatisieren, wie diese Container über Kubernetes-Cluster bereitgestellt, skaliert und verwaltet werden, die aus Knoten wie physischen oder virtuellen Maschinen bestehen. Dieser Ansatz stellt sicher, dass KI-Workloads verteilt und Ressourcen effizient durch Lastverteilung und Autoskalierung genutzt werden.

Jede Workload läuft in einem eigenen Pod, den Kubernetes plant und überwacht. Ein in einer Umgebung erstellter und getesteter KI-Workload kann in eine andere Umgebung übertragen werden, ohne dass er neu erstellt werden muss, wenn Systeme zwischen lokal und Cloud umgestellt werden müssen.

Datenpipelines und -speicher

Das Erstellen und Trainieren von Modellen erfordert schnellen Zugriff auf große Datensätze über zuverlässige Datenpipelines. Systeme kommunizieren über Programmierschnittstellen (APIs), weshalb ein einheitliches Daten-Routing, ein einheitlicher Datenzugriff und eine einheitliche Datenintegration über verschiedene Umgebungen hinweg mit zunehmender Anzahl von Modellen unerlässlich sind.

KI-Inferenz-Workloads benötigen Verbindungen mit geringer Latenz zu den Daten und KI-Anwendungen, die sie in der Produktion bedienen. Mit zunehmender Anzahl der Systeme in einem Unternehmen wächst auch die Schwierigkeit, Datenbewegungen zu verwalten, Qualität zu gewährleisten und sicherzustellen, dass die richtigen Daten das richtige Modell erreichen. Bei dieser Technologie kommt KI-Speicher ins Spiel.

MLOps und GenAIOps

MLOps wendet DevOps-Prinzipien auf den ML-Lebenszyklus (Maschinelles Lernen) und den KI-Lebenszyklus, einschließlich der Erstellung, des Testens, der Bereitstellung und der Überwachung von Modellen über CI/CD-Pipelines an. Dieser Lebenszyklus umfasst die Bereitstellung von Modellen bis hin zum laufenden Produktionsmanagement.

Ohne Machine Learning Operations (MLOPs) driften die Modelle ab, das Retraining gerät ins Stocken und die Teams verlieren den Überblick über wichtige Leistungskennzahlen wie Latenz und Durchsatz.

GenAIOps erweitert MLOps auf generative KI, bei der Basismodelle, RAG-Systeme und KI-Agenten neue Betriebsmuster einführen. Ein herkömmlicher Chatbot, der Informationen abruft, ist relativ einfach zu überwachen. Ein agentisches KI-System, wie ein virtueller Agent, kann nichtlinear arbeiten, zwischen Aktionen wählen und Anpassungen über mehrere Systeme und Endpunkte hinweg vornehmen.

Vorteile der Verwaltung von KI-Workloads im großen Maßstab

Die Verwaltung skalierbarer KI-Workloads bietet eine Reihe von Vorteilen für Unternehmen, die komplexe KI-Systeme betreiben:

  • Zentralisierte Sichtbarkeit und Kontrolle: Observability über KI-Bereitstellungen und -Leistung macht es einfacher, in großem Maßstab zu verwalten und Probleme zu erkennen, bevor sie das Geschäft beeinträchtigen. Die Portabilität zwischen Umgebungen bedeutet auch, dass Teams nicht an einen einzigen Infrastrukturansatz gebunden sind, wenn sich die Anforderungen ändern.
  • Operative Effizienz: Einheitliche Tools und Bereitstellungspraktiken in allen Teams gewährleisten einen zuverlässigen Betrieb auch bei wachsender Anzahl von KI-Systemen und sichern die Stabilität der Kernfunktionalität bei Hinzufügung neuer Funktionen.
  • Kostenkontrolle: Ohne angemessene Orchestrierung werden GPU-Ressourcen verschwendet oder zu viel gekauft. Die Verwaltung von Ressourcen unterstützt die Kosteneffizienz bei wachsenden KI-Einsätzen.
  • Schnelle Markteinführung: Teams mit den richtigen Prozessen können schneller arbeiten. Was früher Monate dauerte, kann in Wochen geschehen, wenn die richtige KI-Infrastruktur und die richtigen Prozesse vorhanden sind.
  • Compliance und Governance: Mit der Weiterentwicklung der Vorschriften sind Unternehmen mit KI-Workload-Management besser in der Lage, die Anforderungen an Datenresidenz, Audit und Transparenz zu erfüllen.
  • Innovation in großem Maßstab: Die richtige Infrastruktur und die richtigen Betriebspraktiken ermöglichen es den Teams, sich auf Innovationen zu konzentrieren, anstatt Probleme zu lösen.

Anwendungsfälle für die Verwaltung von KI-Workloads im großen Maßstab

Die Verwaltung von KI-Workloads in großem Maßstab gestaltet sich in verschiedenen Branchen unterschiedlich, jedoch spielen in allen Sektoren zentrale Herausforderungen wie Kosten, Compliance und Zuverlässigkeit eine Rolle.

Hier folgen einige Beispiele.

Versicherungswesen

Ein Versicherer betreibt oft Dutzende von KI-Workloads gleichzeitig, von der Schadensbearbeitung bis zur Betrugserkennung, jeweils mit unterschiedlichen Datenanforderungen und Compliance-Kontrollen. Die Verwaltung dieses Volumens in der Produktion bedeutet, dass die Leistung aller Systeme lückenlos aufrechterhalten werden muss.

Gesundheitswesen

Ein Gesundheitsunternehmen, das medizinische Bilddaten zusammen mit Patientendaten verarbeitet, unterliegt strengen Anforderungen an den Datenspeicherort, die oft verhindern, dass bestimmte KI-Workloads in die Public Cloud verlagert werden. Die Datenverarbeitung muss in der Nähe des Speicherorts der Daten erfolgen, was sich auf alle nachfolgenden Infrastrukturentscheidungen auswirkt.

Einzelhandel

Ein Einzelhändler, der seine Personalisierungsmodelle vor der Hochsaison skaliert, muss seine Rechenressourcen schnell hochfahren, Nachfragespitzen bewältigen und effizient wieder herunterfahren können. Die Herausforderung besteht darin, sicherzustellen, dass die Infrastruktur mit den Anforderungen des Unternehmens Schritt halten kann.

Herstellung

Ein Hersteller, der prädiktive Wartungsmodelle auf Fabrikflächen ausführt, benötigt Bearbeitung am Edge mit geringer Latenz und zentrale Sichtbarkeit über alle Standorte hinweg. Wenn Systeme ausfallen, ist das nicht nur ein IT-Problem – die Produktion steht still.

Stephanie Susnjara

Staff Writer

IBM Think

Ian Smalley

Staff Editor

IBM Think

Verwandte Lösungen
IBM Storage Fusion

Eine hybride, container-native Plattform, die skalierbaren Speicher, Schutz der gespeicherten Daten und einheitliches Management für moderne Kubernetes-Workloads bietet.

IBM Storage Fusion erkunden
KI-Infrastrukturlösungen

Mit einer Hybrid-by-Design-Strategie bietet IBM KI-Infrastrukturlösungen um die Auswirkungen in Ihrem gesamten Unternehmen zu beschleunigen.

KI-Infrastrukturlösungen entdecken
KI-Beratung und -Services

Erschließen Sie den Wert von Unternehmensdaten mit IBM Consulting und bauen Sie ein erkenntnisgesteuertes Unternehmen auf, das Ihnen geschäftliche Vorteile verschafft.

Erkunden Sie unsere KI-Beratungsleistungen
Machen Sie den nächsten Schritt

Power KI und Hybrid Cloud Workload mit einheitlichem, hochleistungsfähigem Speicher und KI-fähiger Infrastruktur – entwickelt, um Innovationen zu skalieren, zu automatisieren und zu beschleunigen.

  1. Erkunden Sie IBM FlashSystem
  2. KI-Infrastrukturlösungen entdecken
Fußnoten