Generierung unstrukturierter synthetischer Daten

Mit diesem Synthetic Data Generator Dienst können Sie große, hochwertige, unstrukturierte Textdatensätze erstellen, die auf Ihre Bedürfnisse zugeschnitten sind. Sie können die generierten unstrukturierten synthetischen Datensätze verwenden, um Foundation-Modelle für Ihren spezifischen Anwendungsfall anzupassen und zu bewerten. Sie können auf den Dienst sowohl über die watsonx.ai Benutzeroberfläche als auch über die watsonx.ai API zugreifen.

Erforderliche Berechtigungen für die API
Rolle als Administrator oder Redakteur im Projekt
Ein IBM Cloud Identity and Access Management (IAM) Token
Eine Aufgabenberechtigung
Datentypen
YAML-Dateien als Projekt-Assets für Seed-Daten gespeichert
PDF- und Markdown-Dateien als Wissensdatenbank für einige Datenersteller
JSONL für generierte synthetische Daten
Datenmenge
Beliebig

Authentifizierungsanforderungen für die Nutzung der API

Um unstrukturierte synthetische Daten programmatisch zu erzeugen, müssen Sie zunächst die folgenden Einstellungen vornehmen:

  • Erstellen Sie ein Projekt und haben Sie die Rolle Admin oder Editor im Projekt. Ihr Projekt muss eine zugehörige Watson Machine Learning Service-Instanz haben.

    Sie können ein GitHub Repository verwenden, um Projektressourcen wie Seed-Daten und Ausgaben zu speichern. Weitere Informationen finden Sie unter Zugriff auf ein Git Repository und Projekte mit Git Standardintegration.

  • Erstellen Sie einen IBM Cloud Benutzer-API-Schlüssel und verwenden Sie ihn, um ein IBM Cloud Identity and Access Management (IAM)-Token zu erhalten. Weitere Informationen finden Sie unter Berechtigungsnachweise für den programmatischen Zugang. Das IAM-Token wird über die Kopfzeile Authorization im Anfragekörper übergeben.

Funktionen

Große Sprachmodelle (LLMs) müssen auf großen Datensätzen trainiert werden, um Ergebnisse zu erzeugen, die auf Ihr Unternehmen zugeschnitten sind. Diese Modelle erfordern eine große Menge an hochwertigen und genauen Trainingsdaten. Ein kleiner oder minderwertiger Datensatz reicht nicht aus, um Modelle erfolgreich zu trainieren und eine für Ihren speziellen Anwendungsfall relevante Ausgabe zu erzeugen.

Verwenden Sie den Synthetic Data Generator Dienst, um große unstrukturierte Textdatensätze zu erstellen, indem Sie Datenersteller und Datenvalidierer einsetzen, die für die Generierung von Daten zur Feinabstimmung und Bewertung Foundation-Modelle optimiert sind.

Datenersteller

Ein Datenersteller nutzt die von Ihnen bereitgestellten Referenzdokumente, um synthetische Daten zu generieren, die die Beispiel-Startdaten nachahmen. Je nach Anwendungsfall können Sie aus den folgenden Datenerstellern wählen:

Tool aufrufen
Das Tool „Calling Data Builder“ erstellt Trainingsdatensätze, mit denen KI-Modelle trainiert werden können, um mit externen Tools, Anwendungsprogrammierschnittstellen (APIs) oder Systemen zu interagieren und so ihre Fähigkeiten zu verbessern.
Text zu SQL
Der Text-zu-SQL-Daten-Generator erzeugt synthetische SQL-Daten, die eine natürliche Sprachaussage zur Beschreibung einer Datenbankoperation und eine entsprechende SQL-Anweisung zur Ausführung der Datenbankoperation enthalten.
Wissen
Der Wissensdaten-Generator erstellt Frage-Antwort-Paare ( QnA ) auf der Grundlage von Beispielen in Dokumenten, die für einen bestimmten Geschäftsbereich spezifisch sind.

Weitere Informationen zu Seed-Datenformaten und zur Auswahl eines Datenerstellers finden Sie unter Datenersteller und Seed-Datenformate.

Wege zur Arbeit

Sie können unstrukturierte synthetische Daten auf folgende Weise generieren:

Grafische Benutzeroberfläche
Verwenden Sie die grafische Benutzeroberfläche, um Jobs zu erstellen und auszuführen, die unstrukturierte synthetische Daten generieren. Weitere Informationen finden Sie unter Erstellen von Jobs zum Generieren unstrukturierter synthetischer Daten.
Programmatisch
Erstellen und führen Sie Jobs mithilfe der API zur Generierung synthetischer Daten (SDG) aus. Weitere Informationen finden Sie unter Programmgesteuertes Erstellen von Jobs zum Generieren unstrukturierter synthetischer Daten.

Die synthetischen Daten werden mit Stiftungsmodellen erzeugt, die unter watsonx.ai zur Verfügung gestellt werden. Das Format der generierten Daten basiert auf den von Ihnen bereitgestellten Beispiel-Startdaten und dem von Ihnen verwendeten Daten-Builder. Nachdem das Foundation-Modell den Datensatz generiert hat, werden die Daten anhand der Qualitätsanforderungen des Datenerstellers validiert und in Ihrem Projekt-Asset gespeichert.

Achtung:Ihnen entstehen Kosten für die vom Foundation-Modell generierten Token. Weitere Informationen finden Sie unter Unterstützte Foundation-Modelle.

Weitere Informationen über den API-Endpunkt finden Sie in der watsonx.ai API-Referenzdokumentation.

Workflow

Das folgende Diagramm zeigt, wie die REST-API unstrukturierte synthetische Daten erzeugt.

watsonx.ai generierung unstrukturierter synthetischer Daten API-Arbeitsablauf

Weitere Informationen