Generierung unstrukturierter synthetischer Daten
Mit diesem Synthetic Data Generator Dienst können Sie große, hochwertige, unstrukturierte Textdatensätze erstellen, die auf Ihre Bedürfnisse zugeschnitten sind. Sie können die generierten unstrukturierten synthetischen Datensätze verwenden, um Foundation-Modelle für Ihren spezifischen Anwendungsfall anzupassen und zu bewerten. Sie können auf den Dienst sowohl über die watsonx.ai Benutzeroberfläche als auch über die watsonx.ai API zugreifen.
- Erforderliche Berechtigungen für die API
- Rolle als Administrator oder Redakteur im Projekt
- Ein IBM Cloud Identity and Access Management (IAM) Token
- Eine Aufgabenberechtigung
- Datentypen
- YAML-Dateien als Projekt-Assets für Seed-Daten gespeichert
- PDF- und Markdown-Dateien als Wissensdatenbank für einige Datenersteller
- JSONL für generierte synthetische Daten
- Datenmenge
- Beliebig
Authentifizierungsanforderungen für die Nutzung der API
Um unstrukturierte synthetische Daten programmatisch zu erzeugen, müssen Sie zunächst die folgenden Einstellungen vornehmen:
Erstellen Sie ein Projekt und haben Sie die Rolle Admin oder Editor im Projekt. Ihr Projekt muss eine zugehörige Watson Machine Learning Service-Instanz haben.
Sie können ein GitHub Repository verwenden, um Projektressourcen wie Seed-Daten und Ausgaben zu speichern. Weitere Informationen finden Sie unter Zugriff auf ein Git Repository und Projekte mit Git Standardintegration.
Erstellen Sie einen IBM Cloud Benutzer-API-Schlüssel und verwenden Sie ihn, um ein IBM Cloud Identity and Access Management (IAM)-Token zu erhalten. Weitere Informationen finden Sie unter Berechtigungsnachweise für den programmatischen Zugang. Das IAM-Token wird über die Kopfzeile
Authorizationim Anfragekörper übergeben.
Funktionen
Große Sprachmodelle (LLMs) müssen auf großen Datensätzen trainiert werden, um Ergebnisse zu erzeugen, die auf Ihr Unternehmen zugeschnitten sind. Diese Modelle erfordern eine große Menge an hochwertigen und genauen Trainingsdaten. Ein kleiner oder minderwertiger Datensatz reicht nicht aus, um Modelle erfolgreich zu trainieren und eine für Ihren speziellen Anwendungsfall relevante Ausgabe zu erzeugen.
Verwenden Sie den Synthetic Data Generator Dienst, um große unstrukturierte Textdatensätze zu erstellen, indem Sie Datenersteller und Datenvalidierer einsetzen, die für die Generierung von Daten zur Feinabstimmung und Bewertung Foundation-Modelle optimiert sind.
Datenersteller
Ein Datenersteller nutzt die von Ihnen bereitgestellten Referenzdokumente, um synthetische Daten zu generieren, die die Beispiel-Startdaten nachahmen. Je nach Anwendungsfall können Sie aus den folgenden Datenerstellern wählen:
- Tool aufrufen
- Das Tool „Calling Data Builder“ erstellt Trainingsdatensätze, mit denen KI-Modelle trainiert werden können, um mit externen Tools, Anwendungsprogrammierschnittstellen (APIs) oder Systemen zu interagieren und so ihre Fähigkeiten zu verbessern.
- Text zu SQL
- Der Text-zu-SQL-Daten-Generator erzeugt synthetische SQL-Daten, die eine natürliche Sprachaussage zur Beschreibung einer Datenbankoperation und eine entsprechende SQL-Anweisung zur Ausführung der Datenbankoperation enthalten.
- Wissen
- Der Wissensdaten-Generator erstellt Frage-Antwort-Paare ( QnA ) auf der Grundlage von Beispielen in Dokumenten, die für einen bestimmten Geschäftsbereich spezifisch sind.
Weitere Informationen zu Seed-Datenformaten und zur Auswahl eines Datenerstellers finden Sie unter Datenersteller und Seed-Datenformate.
Wege zur Arbeit
Sie können unstrukturierte synthetische Daten auf folgende Weise generieren:
- Grafische Benutzeroberfläche
- Verwenden Sie die grafische Benutzeroberfläche, um Jobs zu erstellen und auszuführen, die unstrukturierte synthetische Daten generieren. Weitere Informationen finden Sie unter Erstellen von Jobs zum Generieren unstrukturierter synthetischer Daten.
- Programmatisch
- Erstellen und führen Sie Jobs mithilfe der API zur Generierung synthetischer Daten (SDG) aus. Weitere Informationen finden Sie unter Programmgesteuertes Erstellen von Jobs zum Generieren unstrukturierter synthetischer Daten.
Die synthetischen Daten werden mit Stiftungsmodellen erzeugt, die unter watsonx.ai zur Verfügung gestellt werden. Das Format der generierten Daten basiert auf den von Ihnen bereitgestellten Beispiel-Startdaten und dem von Ihnen verwendeten Daten-Builder. Nachdem das Foundation-Modell den Datensatz generiert hat, werden die Daten anhand der Qualitätsanforderungen des Datenerstellers validiert und in Ihrem Projekt-Asset gespeichert.
Weitere Informationen über den API-Endpunkt finden Sie in der watsonx.ai API-Referenzdokumentation.
Workflow
Das folgende Diagramm zeigt, wie die REST-API unstrukturierte synthetische Daten erzeugt.