Datenvisualisierung ist die grafische Darstellung von Daten durch die Verwendung visueller Elemente wie Diagramme, Grafiken, Schaubilder und Dashboards. Sie hilft dabei, komplexe Daten für Stakeholder oder eine nicht-technische Zielgruppe zu interpretieren, die sie für die Entscheidungsfindung nutzen können.
Beim maschinellen Lernen (ML) bedeutet es mehr als das Erstellen eines Dashboards oder eines Berichts. Dies beinhaltet die Erstellung, dasDebugging und die Verbesserung der ML-Modelle. Es dient dazu, die Daten vor dem Training zu analysieren, den Trainingsablauf zu überwachen und nach der Auswertung zu diagnostizieren, was gut oder schlecht gelaufen ist. Es geht weniger um Präsentation als vielmehr um Ermittlungen.
In der Praxis überschneiden sich beide Bereiche. Ein guter Praktiker im Bereich des maschinellen Lernens oder Data Science nutzt Datenvisualisierung für sich selbst, um Probleme zu erkennen und Modelle zu optimieren, sowie für andere, um Ergebnisse zu erklären und Vertrauen in Modellausgaben aufzubauen.
Die Datenvisualisierung beim maschinellen Lernen wirkt sich direkt auf die Qualität Ihrer Modelle aus, die Entscheidungen, die Sie treffen, und darauf, wie gut andere Ihre Arbeit verstehen.
Die Visualisierung läuft durch den gesamten ML-Workflow vom Moment des Erhalts der Rohdaten bis zur endgültigen Bewertung Ihres Modells. Hier wird es in jeder Phase angezeigt. Die in jedem Schritt erwähnten Visualisierungstechniken werden in den späteren Abschnitten ausführlich besprochen.
Bevor eine Analyse beginnt, müssen Sie verstehen, womit Sie arbeiten. Dies bedeutet, auf fehlende Werte, inkonsistente Datentypen und doppelte Datensätze zu prüfen, denn jedes strukturelle Problem in den Daten in dieser Phase wird stillschweigend alles Folgende verfälschen. Heatmaps für fehlende Werte, Datentypverteilungsdiagramme und Schaubilder zur Aufzeichnungshäufigkeit vermitteln einen schnellen, zuverlässigen Überblick über den Zustand der Daten, bevor Sie Zeit investieren, um darauf aufzubauen.
Explorative Datenanalyse hilft dabei, die Struktur, Verteilung und Zusammenhänge im Datensatz zu verstehen, bevor man etwas erstellt –und zwar durch die Verwendung von Histogrammen, Streudiagrammen, Korrelationsmatrizen, Boxplots und Paardiagrammen, um Muster, Anomalien und Zusammenhänge aufzudecken, die sich aus den reinen Zahlen allein nicht erkennen lassen. EDA ist von Natur aus iterativ: Man visualisiert etwas, stellt eine Hypothese auf, testet sie und visualisiert es erneut, bis man wirklich versteht, was die Daten einem sagen.
Nachdem Sie die Rohdaten verstanden haben, beginnen Sie mit der Transformation und Auswahl von Funktionen für das Modell. Durch die Visualisierung Ihrer Daten können Sie überprüfen, ob Ihre Transformationen das tun, was Sie erwarten, und herausfinden, welche Funktionen wirklich nützlich sind. Wenn Sie Verteilungsdiagramme, Funktionswichtigkeitsdiagramme oder das Verhalten von Funktionen über verschiedene Zielgruppen hinweg verstehen, werden willkürliche Vorverarbeitungen zu Entscheidungen, die Sie eindeutig begründen können.
Während das maschinelle Lernmodell trainiert wird, geht es bei der Visualisierung nicht mehr um die Untersuchung der Daten, sondern vielmehr darum, den Lernprozess des Modells zu verfolgen. Diagramme wie Lern- oder Verlustkurven zeigen, ob sich das Modell verbessert, einpendelt oder übermäßig anpasst. Mit diesem Feedback können Sie die Hyperparameter Feinabstimmung, die Regularisierung anpassen oder die Trainingsdauer ändern, bevor die Aufgabe abgeschlossen ist.
Nach dem Training ist die Visualisierung der Weg, um über eine einzelne Genauigkeitszahl hinauszugehen und wirklich zu verstehen, wie das Modell funktioniert. Konfusionsmatrizen, ROC-Kurven, Präzisionsabrufkurven und Residuendiagramme enthüllen jeweils eine andere Dimension des Modellverhaltens. Sie analysieren die Leistung nach Klassen, Schwellenwerten und dem gesamten Bereich der vorhergesagten Werte, sodass Sie nicht nur wissen, wie gut das Modell funktioniert, sondern auch, wo es erfolgreich ist und wo es Schwächen aufweist.
Die Arten der Datenvisualisierung zu verstehen, die beim maschinellen Lernen verwendet werden, bedeutet, in Anwendungsfällen zu denken, nicht nur in Diagrammnamen. Hier ist eine strukturierte Aufschlüsselung davon.
Ein Histogramm zeigt, wie eine einzelne numerische Funktion verteilt ist. Es teilt die Werte auf der x-Achse in Bins auf und zählt, wie viele Datenpunkte in jeden Bin auf der y-Achse fallen. In Python lässt sich mithilfe von Tools wie matplotlib oder seaborn durch das Erstellen eines Histogramms schnell erkennen, ob eine Variablenverteilung normalverteilt, rechtsschief, bimodal oder nahezu gleichmäßig ist.
Jedes Muster schlägt einen anderen Vorverarbeitungsschritt vor. Man könnte beispielsweise ein Histogramm der Produktpreise erstellen und feststellen, dass die meisten Preise unter 50 US-Dollar liegen, aber ein langer Bereich bis zu 500 US-Dollar reicht. Dieses Muster legt nahe, dass die Funktion von einer logarithmischen Transformation einen Vorteil hätte, bevor man sie in einem Modell verwendet.
Streudiagramme stellen zwei numerische Variablen auf der x-Achse und der y-Achse dar, wobei jeder Datenpunkt als Punkt repräsentiert wird. Sie sind nützlich, um sowohl lineare als auch nichtlineare Muster zu erkennen, zu identifizieren, wo sich Cluster bilden, und Sonderfälle zu kennzeichnen, die weit vom Rest der Daten entfernt sind. Wenn Sie beispielsweise die Hausgröße mit dem Verkaufspreis vergleichen, könnte dies einen deutlichen Aufwärtstrend bis zu einer bestimmten Größenschwelle zeigen, nach der sich die Preise abschwächen – ein Muster, das Sie vor dem Training untersuchen sollten.
Eine Korrelationsmatrix zeigt die paarweise Korrelation zwischen jeder numerischen Funktion in Ihrem Datensatz an. Als Heatmap dargestellt, wobei die Farbe der Zellen die Stärke der Korrelation widerspiegelt, lässt sich die Multikollinearität auf einen Blick erkennen. Merkmale mit einer Korrelation von 0,95 oder höher sind oft Kandidaten für eine Entfernung bei der Merkmalsauswahl, da sie redundante Informationen enthalten.
Korrelation erfasst nur lineare Beziehungen, eine Korrelation nahe null bedeutet also nicht, dass zwei Funktionen unabhängig sind. Beispielsweise weisen die Kategorien „Gesamtzahl der Zimmer“ und „Gesamtzahl der Schlafzimmer“ in einem Wohnungsdatensatz fast immer eine sehr hohe Korrelation auf, und die Beibehaltung beider Kategorien fügt dem Modell keine neuen Informationen hinzu.
Boxdiagramme geben eine kurze Zusammenfassung, wie eine Variable verteilt ist, indem sie den Median, den Hauptbereich der Daten (den Interquartilbereich) und eventuelle Sonderfälle anzeigen. Sie sind besonders nützlich im maschinellen Lernen, um zu vergleichen, wie sich eine numerische Funktion zwischen verschiedenen Zielgruppen unterscheidet, beispielsweise beim Vergleich des Einkommens von Personen, die einen Kredit nicht zurückgezahlt haben, mit dem von Personen, die dies nicht getan haben.
Paardiagramme erzeugen ein Raster aus Streudiagrammen für jede Kombination numerischer Funktionen im Datensatz, mit Histogrammen oder Dichtediagrammen entlang der Diagonale. Die Funktion pairplot () von Seaborn generiert diese Diagramme in einer einzigen Zeile. Bei Datensätzen mit bis zu 10–15 Merkmalen bieten Paardiagramme einen schnellen multivariaten Überblick, für dessen Darstellung viele Einzeldiagramme erforderlich wären.
Funktionen beziehen sich in diesem Zusammenhang einfach auf die einzelnen Spalten in Ihrem Datensatz, wie Alter, Einkommen oder Kaufhäufigkeit. Ein Paardiagramm für einen Umsatzdatensatz könnte beispielsweise schnell zeigen, dass sich Umsatz und verkaufte Einheiten eng miteinander bewegen, während der Diskontsatz mit keinem der beiden Werte in engem Zusammenhang steht. Solche Erkenntnisse können Ihnen bei der Entscheidung helfen, welche Funktionen es wert sind, beibehalten zu werden.
Dichtediagramme sind wie glattere Versionen von Histogrammen. Sie sind nützlich, um zu vergleichen, wie eine Funktion auf zwei Gruppen verteilt ist. Wenn die Kurven weit auseinanderliegen, hat die Funktion in der Regel eine hohe Vorhersagekraft. Aber wenn sie sich überschneiden, ist das weniger hilfreich.
Wenn Sie beispielsweise die Dichte der „Kaufhäufigkeit“ für treue und abgewanderte Kunden grafisch darstellen und die beiden Linien klar unterschiedliche Spitzen bilden, ist das ein gutes Zeichen, dass die Funktion in einem Modell zur Vorhersage der Abwanderung helfen wird.
Man kann nach dem Training eines Modells die Funktion-Bedeutungswerte extrahieren und sie in einem Balkendiagramm visualisieren, um zu sehen, welche Funktionen am wichtigsten sind. Modelle, die auf Entscheidungsbaum basieren, sind ein häufiges Beispiel, da sie diese Wichtigkeitswerte natürlich liefern. Funktionen mit sehr geringer Wichtigkeit eignen sich oft gut zum Entfernen, und Tools wie Plotly oder Matplotlib können diese Diagramme problemlos erstellen, selbst wenn viele Funktionen vorhanden sind.
Diese Diagramme vergleichen die Verteilung einer Funktion vor und nach einer Transformation (Skalierung, Kodierung, Log-Transformation) und bestätigen, ob der Vorverarbeitungsschritt die beabsichtigte Wirkung erzielt hat. Dieser Vergleich ist wichtig, weil die Eingabe eines schlecht transformierten Merkmals in ein Modell die Vorhersagen verzerren kann, und ein einfaches Paralleldiagramm wird das Problem erkennen, bevor es trainiert wird.
Eine Lernkurve ist eine Art von Modelltrainingsvisualisierung, die die Modellleistung (Genauigkeit oder Verlust) auf der Y-Achse gegen die Größe des Trainingssatzes oder die Trainingsiterationen auf der X-Achse darstellt, mit separaten Linien für Training und Validierung.
Diese einzige Visualisierung diagnostiziert die beiden häufigsten Fehlermodi von ML-Modellen: Überanpassung (große Lücke zwischen Training und Validierungsleistung) und Unteranpassung (beide Linien sind niedrig und konvergieren schnell). Die Anpassung der Modellkomplexität, der Regularisierung oder der Trainingsdatengröße wird gezielt und nicht mehr auf Vermutungen beruhend, sobald man die Lernkurve erkennen kann.
Bei Deep-Learning-Modellen ist es gängige Praxis, den Trainingsverlust und den Validierungsverlust über mehrere Epochen hinweg grafisch darzustellen. Ein Validierungsverlust, der aufhört, sich zu verbessern oder zunimmt, während der Trainingsverlust weiter sinkt, ist das Signal, das Training vorzeitig abzubrechen. Diese Diagramme werden in der Regel während des Trainings in Echtzeit mit Tools wie TensorBoard generiert.
Im weiteren Sinne vermitteln Liniendiagramme, die jede Metrik (Genauigkeit, F1-Score, Fläche unter der Kurve) über Trainingsiterationen verfolgen, ein kontinuierliches Bild der Modellentwicklung. Sie sind aussagekräftiger als eine einzelne Metrik am Ende der Ausbildung, da sie den Verlauf und nicht nur das Ziel aufzeigen.
Eine Konfusionsmatrix ist eine Art von Visualisierung der Modellbewertung, die jede Kombination von tatsächlichen und vorhergesagten Klassenbezeichnungen in einem Raster darstellt, wahre positive, richtig positive und falsch negative Ergebnisse, sodass Sie genau sehen können, wo Ihr Modell richtig und wo falsch ist.
Sie ist die Grundlage der meisten Metriken; Präzision, Trefferquote und F1-Score werden alle davon abgeleitet. Gerendert als Heatmap mit Anmerkungen, die Anzahl oder Prozentsätze anzeigen, macht es Fehler auf Klassenebene sofort lesbar. Ein Modell, das hinsichtlich der Genauigkeit „gut aussieht“, aber eine leere Zeile für eine kritische Klasse aufweist, wird diesen Fehler sofort in der Konfusionsmatrix sichtbar machen.
ROC-Kurven stellen die wahre Positivrate gegen die Falsch-Positiv-Rate bei jeder möglichen Klassifikationsschwelle von 0 bis 1 dar. Die Fläche unter der Kurve (AUC) fasst die allgemeine Fähigkeit zur Modellunterscheidung in einer einzigen Zahl zusammen: 0,5 ist zufälliges Erraten, 1,0 ist perfekt. ROC-Kurven sind besonders nützlich beim Vergleich mehrerer Modelle oder wenn die Kosten von Fehlalarmen und Falsch-Negativen unterschiedlich sind. Tools wie Scikit-Learn und Plotly haben beide eine eingebaute Unterstützung für deren Generierung.
Wenn Ihr Datensatz stark unausgewogen ist, liefern Präzisions-Recall-Kurven ein weitaus ehrlicheres Bild der Leistung des Modells als ROC-Kurven. Ein leistungsstarker Klassifikator drängt in Richtung der oberen rechten Ecke des Diagramms und behält dabei eine hohe Präzision bei, ohne die Trefferquote zu beeinträchtigen. Er stellt die Präzision auf der y-Achse der Trefferquote auf der x-Achse über verschiedene Entscheidungsschwellenwerte hinweg gegenüber.
In risikoreichen Bereichen wie der medizinischen Diagnostik oder der Betrugserkennung, wo das Übersehen eines seltenen Falls weitaus schädlicher ist als ein Fehlalarm, liefert diese Kurve oft mehr Informationen als jede andere Methode.
Bei Regressionsodellen zeigt ein Residualdiagramm die Differenz zwischen vorhergesagten und tatsächlichen Werten (das Residuum) auf der y-Achse gegen den vorhergesagten Wert auf der x-Achse. Die Residuen sollten zufällig und ohne erkennbares Muster um den Nullpunkt verstreut sein. Wenn sich die Residuen auffächern, systematisch verkrümmen oder sich clustern, hat das Modell ein strukturelles Problem, da es irgendeinen Aspekt der Beziehung in den Daten nicht erfasst.
Matplotlib ist die Open-Source-Grundlage, auf der alles andere aufbaut. Das Modul „pyplot“ (importiert als „plt“) deckt die gesamte Bandbreite an Standarddiagrammen ab, darunter Histogramme, Streudiagramme, Liniendiagramme, Balkendiagramme und mehr. Im Vergleich zu neueren Bibliotheken ist es zwar ausführlich, aber diese Ausführlichkeit ermöglicht Ihnen die präzise Kontrolle über jedes Detail: Anmerkungen, Achsenbeschriftungen, Abbildungslayout und Größe.
Seaborn basiert auf matplotlib und reduziert den Boilerplate-Code erheblich. Eine Heatmap, ein Paardiagramm oder ein Boxplot, die in matplotlib 15 Zeilen benötigen würde, benötigt in seaborn nur eine oder zwei Zeilen. Es liest direkt aus Pandas DataFrames und ist damit die erste Wahl für EDA in Jupyter Notebook-Umgebungen.
Plotly ist die richtige Wahl, wenn Ihre Ausgabe interaktiv sein soll. Die Diagramme werden in HTML gerendert, sodass die Betrachter mit der Maus über Datenpunkte fahren, hineinzoomen und Datenreihen umschalten können. Dadurch sind sie bei der Präsentation von Ergebnissen für Stakeholder über Dashboards oder Webberichte weitaus nützlicher als statische Bilder.
NumPy ist selbst kein Visualisierungstool, aber es ist das Rückgrat fast jedes Visualisierungs-Workflows, der die Array-Manipulation und die X-Achsen-/Y-Achsen-Datenaufbereitung abwickelt, von denen Matplotlib und Seaborn abhängen.
Yellowbrick wurde speziell für die ML-Evaluierung entwickelt. Es verpackt Scikit-Learn und generiert Konfusionsmatrizen, ROC-Kurven, Lernkurven und Funktionenbedeutungsdiagramme in einem einzigen Funktionsaufruf, wobei die manuelle Verkabelung übersprungen wird, die Matplotlib benötigt.
TensorBoard kümmert sich um den Bereich des Deep Learning. Es streamt Trainingsmetriken, Verlustkurven und Modellgraphen in Echtzeit während des Trainings, was für die Überwachung großer Datensätze und langlaufender Neural Networks notwendig ist.
Effektive Datenvisualisierung besteht nicht nur darin, das richtige Diagramm auszuwählen, sondern auch darin, die Muster zu vermeiden, die unterschwellig in die Irre führen.
Datenvisualisierung im maschinellen Lernen ist kein abschließender Schritt, sondern durchdringt jede Phase eines Projekts. So diagnostizieren Data Scientists Probleme, die sie in einer Tabelle nicht erkennen konnten, erkennen Modellfehler, die Metriken verbergen, kommunizieren die Ergebnisse an die Stakeholder und treffen in jeder Phase des Workflows selbstbewusste datenbasierte Entscheidungen.
Die Gewohnheit zu entwickeln, in jeder Phase bewusst zu visualisieren, ist eine der einfachsten und wirkungsvollsten Maßnahmen, die Sie tun können, um sowohl die Qualität Ihrer Modelle als auch die Klarheit Ihres Denkens zu verbessern.
Trainieren, validieren, optimieren und implementieren Sie generative KI, Foundation Models und maschinelle Lernfunktionen mit IBM watsonx.ai, einem Studio der nächsten Generation für AI Builder in Unternehmen. Erstellen Sie KI-Anwendungen mit einem Bruchteil der Zeit und Daten.
Setzen Sie KI in Ihrem Unternehmen ein – mit branchenführendem Fachwissen im Bereich KI und dem Lösungsportfolio von IBM an Ihrer Seite.
Erfinden Sie kritische Workflows und Abläufe neu, indem Sie KI einsetzen, um Erfahrungen, Entscheidungsfindung in Echtzeit und den geschäftlichen Nutzen zu maximieren.