Schnelleinstieg: Generieren von synthetischen Tabellendaten
In diesem Lernprogramm erfahren Sie, wie Sie synthetische Tabellendaten in IBM watsonx.aigenerieren. Der Vorteil synthetischer Daten besteht darin, dass Sie die Daten bedarfsgerecht beschaffen, dann an Ihren Anwendungsfall anpassen und in großen Mengen produzieren können. In diesem Lernprogramm erfahren Sie, wie Sie mit dem grafisch orientierten Flow-Editor-Tool Synthetic Data Generatormithilfe von visuellen Abläufen und Modellierungsalgorithmen synthetische Tabellendaten auf der Basis von Produktionsdaten oder eines angepassten Datenschemas generieren.
- Erforderliche Services
- Watson Studio
- Synthetic Data Generator
Ihr Basisworkflow umfasst die folgenden Tasks:
- Öffnen Sie ein Projekt. In Projekten können Sie mit anderen zusammenarbeiten, um mit Daten zu arbeiten.
- Fügen Sie Ihre Daten zum Projekt hinzu. Sie können „ CSV “-Dateien oder Daten aus einer externen Datenquelle über eine Verbindung hinzufügen.
- Erstellen Sie einen synthetischen Datenfluss zum Projekt und führen Sie ihn aus. Mit dem grafisch orientierten Flow-Editor-Tool Synthetic Data Generator können Sie synthetische Tabellendaten auf der Basis von Produktionsdaten oder eines angepassten Datenschemas mithilfe visueller Abläufe und Modellierungsalgorithmen generieren.
- Überprüfen Sie den synthetischen Datenfluss und die Ausgabe.
Informationen zu synthetischen Daten lesen
Synthetische Daten sind Informationen, die auf einem Computer generiert wurden, um reale Daten zu erweitern oder zu ersetzen, um KI-Modelle zu verbessern, sensible Daten zu schützen und Verzerrungen zu mindern. Synthetische Daten tragen dazu bei, viele der logistischen, ethischen und Datenschutzprobleme zu mindern, die mit dem Training von Modellen für maschinelles Lernen an Beispielen aus der Praxis verbunden sind.
Sehen Sie sich ein Video zum Generieren synthetischer Tabellendaten an
Sehen Sie sich dieses Video an, um eine Vorschau der Schritte in diesem Lernprogramm anzuzeigen. Möglicherweise gibt es geringfügige Unterschiede in der Benutzerschnittstelle, die im Video angezeigt wird. Das Video ist als Begleiter zum schriftlichen Lernprogramm gedacht. Das Video beginnt auf dem Startbildschirm von watsonx. Der Benutzer navigiert zur Ressourcendrehscheibe, wählt Daten und öffnet Beispieldaten.
Dieses Video bietet eine visuelle Methode zum Erlernen der Konzepte und Tasks in dieser Dokumentation.
Lernprogramm zum Generieren synthetischer Tabellendaten ausprobieren
In diesem Lernprogramm werden Sie die folgenden Tasks ausführen:
- Aufgabe 1: Projekt öffnen
- Aufgabe 2: Daten zu Ihrem Projekt hinzufügen
- Task 3: Ablauf für synthetische Daten erstellen
- Aufgabe 4: Datenfluss und Ausgabe überprüfen
Tipps zum Durcharbeiten dieses Lernprogramms
Im Folgenden finden Sie einige Tipps für die erfolgreiche Durchführung dieses Lehrgangs.
Browserfenster einrichten
Um dieses Tutorial optimal nutzen zu können, öffnen Sie Ihr Konto in einem Browserfenster und lassen Sie diese Tutorial-Seite in einem anderen Browserfenster geöffnet, damit Sie leicht zwischen den beiden Fenstern wechseln können. Es empfiehlt sich, die beiden Browserfenster nebeneinander anzuordnen, um die weitere Arbeit zu erleichtern.

Aufgabe 1: Projekt öffnen
Sie benötigen ein Projekt zum Speichern der Assets.
Führen Sie die Schritte aus, um zu prüfen, ob ein Projekt vorhanden ist, oder um ein Projekt zu erstellen.
Blättern Sie auf dem watsonx zum Abschnitt Projekte. Wenn Projekte aufgelistet werden, fahren Sie mit Aufgabe 2fort. Wenn keine Projekte angezeigt werden, führen Sie die folgenden Schritte aus, um ein Projekt zu erstellen.
Klicken Sie in der Schnellnavigationauf Alle Projekte.
Öffnen Sie ein vorhandenes Projekt oder erstellen Sie ein neues Projekt:
- Klicken Sie auf der Seite Projekte auf Neues Projekt .
- Wählen Sie Leeres Projekt erstellenaus.
- Geben Sie in der Anzeige Projekt erstellen einen Namen und optional eine Beschreibung für das Projekt ein.
- Klicken Sie auf Erstellen.
Weitere Informationen oder ein Video finden Sie unter Erstellen eines Projekts.
Überprüfen Sie Ihren Fortschritt
Die folgende Abbildung zeigt das leere Projekt. Sie können nun die Seite {{ site.data.keyword.fm_prompt }} öffnen.

Aufgabe 2: Daten zum Projekt hinzufügen
Das in diesem Lernprogramm verwendete Dataset enthält typische Informationen, die ein Unternehmen über seine Kunden sammelt. Führen Sie die folgenden Schritte aus, um das Dataset herunterzuladen und zu Ihrem Projekt hinzuzufügen:
Laden Sie das Dataset Auto Insurance Customers ' herunter (4KB).
Klicken Sie in Ihrem Projekt auf das Symbol „Asset zum Projekt
hochladen“.
Navigieren Sie in der Seitenanzeige, die geöffnet wird, zur Datei
Customers.csvund klicken Sie auf Öffnen. Bleiben Sie so lange auf der Seite, bis der Ladevorgang vollständig abgeschlossen worden ist.
Die DateiCustomers.csvwird Ihrem Projekt als Datenasset hinzugefügt.
Überprüfen Sie Ihren Fortschritt
Die folgende Abbildung zeigt die Registerkarte 'Assets' im Projekt. Jetzt können Sie den synthetischen Datenfluss erstellen.

Task 3: Ablauf für synthetische Daten erstellen
Verwenden Sie den Synthetic Data Generator , um einen Datenfluss zu erstellen, der synthetische Tabellendaten auf der Basis von Produktionsdaten oder eines angepassten Datenschemas mithilfe visueller Abläufe und Modellierungsalgorithmen generiert. Führen Sie die folgenden Schritte aus, um ein Asset für einen synthetischen Datenfluss in Ihrem Projekt zu erstellen:
- Klicken Sie auf der Registerkarte Assets in Ihrem Projekt auf Neues Asset > Synthetische Tabellendaten generieren.
- Geben Sie als Namen
Bank customersein. - Klicken Sie auf Erstellen.
- Klicken Sie in der Anzeige Willkommen bei Synthetic Data Generator auf Erstbenutzerund anschließend auf Weiter. Diese Option bietet Ihnen eine Anleitung zum Erstellen des Datenflusses.
- Sehen Sie sich die beiden Anwendungsfälle an:
- Nutzen Sie Ihre vorhandenen Daten: Generieren Sie auf der Basis Ihrer Produktionsdaten ein strukturiertes synthetisches Dataset. Vor dem Export können Sie eine Verbindung zu einer Datenbank herstellen, eine Datei importieren oder hochladen, maskieren und Ihre Ausgabe generieren.
- Aus angepassten Daten erstellen: Generiert eine strukturierte synthetische Datei auf der Basis von Metadaten. Sie können die Daten in jeder Tabellenspalte, ihre Verteilungen und Korrelationen definieren.
- Wählen Sie den Anwendungsfall Vorhandene Daten nutzen aus und klicken Sie auf Weiter , um vorhandene Daten zu importieren.
- Klicken Sie auf Daten aus Projekt auswählen , um das Kundendatenasset zu verwenden, das Sie vom Ressourcenhub hinzugefügt haben.
- Wählen Sie Datenasset > customers.csvaus.
- Klicken Sie auf Auswählen (Select).
- Klicken Sie auf Weiter.
- Suchen Sie in der Liste der Spalten nach
creditcard_number.- Wählen Sie in der Spalte Anonymisieren für
CREDITCARD_NUMBERJa aus, um die Kreditkartennummern von Kunden zu maskieren. - Klicken Sie auf Weiter.
- Wählen Sie in der Spalte Anonymisieren für
- Ändern Sie auf der Seite "Mimic-Optionen" die Anzahl der Zeilen in
1000. Akzeptieren Sie die Standardeinstellungen für die restlichen Optionen. Diese Optionen generieren synthetische Daten auf der Basis Ihrer Produktionsdaten unter Verwendung einer Gruppe von potenziellen statistischen Verteilungen, um jede Spalte in Ihren Daten zu ändern. Klicken Sie auf "Weiter ". - Aktivieren Sie auf dem Bildschirm „ Auswerten“ die Option „Auswertungsmetriken aktivieren“. Hier können Sie Einstellungen festlegen, um die generierten synthetischen Daten mit Ihren Ausgangsdaten zu vergleichen. Sie können auswählen, welche Metriken bewertet werden sollen.
- Wählen Sie die folgenden Metriken aus:
- Genauigkeits-Score
- Unterscheidbarkeit von Daten
- Bewertung der Leckageverhütung
- Nähebewertung
- Klicken Sie auf Weiter.
- Wählen Sie die folgenden Metriken aus:
- Geben Sie auf der Seite Daten exportieren den Dateinamen
bank_customers.csvein, und klicken Sie auf Weiter. - Überprüfen Sie die Einstellungen und klicken Sie auf "Speichern ". Das Tool Synthetic Data Generator wird mit dem Datenfluss angezeigt.
- Klicken Sie bei Aufforderung auf "Ausführen" und warten Sie, bis der Vorgang abgeschlossen ist.
Überprüfen Sie Ihren Fortschritt
Die folgende Abbildung zeigt den Datenfluss, der im Synthetic Data Generatorgeöffnet ist. Jetzt können Sie den Datenfluss untersuchen und die Ausgabe anzeigen.

Aufgabe 4: Datenfluss und Ausgabe überprüfen
Nach Abschluss der Ausführung können Sie den Datenfluss untersuchen. Gehen Sie wie folgt vor, um den Ablauf der synthetischen Daten und die Ergebnisse zu überprüfen:
Klicken Sie auf das Paletten -Symbol, um das
Knotenfenster zu schließen.
Doppelklicken Sie auf den Knoten Importieren , um die Einstellungen anzuzeigen.
- Überprüfen Sie die Dateneigenschaften . Das Tool liest die Datei aus dem Projekt und füllt die entsprechenden Dateneigenschaften aus.
- Erweitern Sie den Abschnitt Typen . Das Tool hat die Werte und Spalten im Dataset gelesen.
- Klicken Sie auf Abbrechen.
Doppelklicken Sie auf den Knoten Anonymisieren , um die Einstellungen anzuzeigen.
- Stellen Sie sicher, dass die Spalte CREDITCARD_NUMBER anonymisiert ist.
- Erweitern Sie den Abschnitt Werte anonymisieren . Hier können Sie anpassen, wie die Werte anonymisiert werden.
- Klicken Sie auf Abbrechen.
Doppelklicken Sie auf den Knoten Mimic , um die Einstellungen anzuzeigen.
- Überprüfen Sie die Standardeinstellungen, um die Daten im Quellenkundendataset nachzuahmen.
- Klicken Sie auf Abbrechen.
Doppelklicken Sie auf den Knoten "Evaluate ", um die Einstellungen anzuzeigen.
- Überprüfen Sie die folgenden Einstellungen:
- Der Baseline-Eingang ist auf Import eingestellt. Der Fluss zeigt, dass der Knoten "Evaluate" zwei Eingaben hat, die Ausgabe der Knoten "Anonymize" und "Generate ".
- Qualitätsmetriken, Datenschutzmetriken, Nutzungsmetriken und Bewertungsebene. Bewegen Sie den Mauszeiger über das Informations symbol,
um eine Beschreibung der einzelnen Einstellungen anzuzeigen.
- Klicken Sie auf Abbrechen.
- Überprüfen Sie die folgenden Einstellungen:
Doppelklicken Sie auf den Knoten Generieren , um die Einstellungen anzuzeigen.
- Überprüfen Sie die Liste der synthetisierten Spalten.
- Optional: Überprüfen Sie die Korrelationen und Erweiterte Optionen.
- Klicken Sie auf Abbrechen.
Klicken Sie doppelt auf den Knoten Export , um die Einstellungen anzuzeigen.
- Optional: Standardmäßig werden die exportierten Daten im Projekt gespeichert. Klicken Sie auf Pfad ändern , um die exportierten Daten in einer Verbindung wie Db2 Warehousezu speichern.
- Klicken Sie auf Abbrechen.
Klicken Sie im Bereich "Outputs" auf die Ergebnisse mit dem Namen "Evaluate ". Wenn Sie den Bereich „Ausgänge“ nicht sehen, klicken Sie auf das Symbol
„Ausgänge“.
Klicken Sie für jede Metrik auf das
Symbol „Details anzeigen“, um die Visualisierungen für diese Metrik anzuzeigen.
Auf der Register karte "Diagramm-Metriken" sehen Sie dieselben Werte. Wenn Sie fertig sind, schließen Sie das Fenster.
Klicken Sie auf Ihren Projektnamen, um zur Registerkarte Assets zurückzukehren.

Klicken Sie auf bank_customers.csv , um eine Vorschau der generierten synthetischen Tabellendaten anzuzeigen.
Überprüfen Sie Ihren Fortschritt
Die folgende Abbildung zeigt das exportierte, generierte synthetische Tabellendataset.

Weitere Schritte
Nutzen Sie diese zusätzlichen Lernprogramme, um mehr praktische Erfahrung mit watsonx.ai:
Weitere Ressourcen
- Weitere Videosansehen.