Constructeurs de données et formats de données de semences

Utilisez Synthetic Data Generator et les constructeurs de données pour créer des ensembles de données synthétiques dans différents formats. Le format des données synthétiques non structurées est déterminé par le constructeur de données que vous avez choisi.

Choisissez l'un des constructeurs de données suivants pour générer des ensembles de données synthétiques :

  • Connaissances
  • Texte vers SQL
  • Appel d'outils

Vous devez fournir les données suivantes pour le constructeur de données que vous spécifiez dans votre demande de génération de données non structurées :

Données de départ
Tous les constructeurs de données ont besoin de données de base en entrée. Les données de base entraînent le modèle, qui génère ensuite les ensembles de données synthétiques dans le même format que les données de base. Les différents constructeurs de données utilisent différents types de données de départ. Par exemple, le constructeur de données de connaissance a besoin de données de départ sous la forme de paires de questions et de réponses
Documents de référence
Certains constructeurs de données, comme les constructeurs d'outils d'appel et de données de connaissance, ont besoin de documents de référence spécifiques au domaine qui servent de base de connaissances lorsque le modèle de base est invité à générer des ensembles de données synthétiques. Par exemple, vous pouvez fournir une spécification d'API ou plusieurs fichiers Markdown contenant des informations spécifiques à votre cas d'utilisation ou à votre entreprise.

Comparaison des constructeurs de données

Pour vous aider à choisir le constructeur de données le mieux adapté à votre cas d'utilisation, consultez le tableau comparatif.

Tableau 1. Différences entre les constructeurs de données
Générateur de données Format des données sur les semences Utilisation de données synthétiques générées
Connaissances - Paires de questions-réponses ( QnA ) basées sur une base de connaissances
- Documents de référence servant de base de connaissances
Utilisé pour former les LLM à des tâches de réponse aux questions, de résumé et de conversation basées sur les thèmes d'une taxonomie commerciale.
Texte vers SQL - Opération de base de données en texte clair
- Instruction SQL
- Schéma de base de données
Utilisé pour former les LLM à traduire une invite lisible par l'homme en une requête de base de données précise qui peut être utilisée directement par les applications.
Appel d'outils - Paires d'instructions et de réponses
- Fichiers de spécification de l'API contenant des définitions de fonctions pour les outils
Utilisé pour affiner les LLM afin d'automatiser les flux de travail, d'interagir avec les bases de données, de résoudre des problèmes complexes, de prendre des décisions en temps réel, etc. Convient le mieux aux applications d'IA agentique.

Types de fichiers pris en charge pour les constructeurs de données

Le tableau suivant indique les types de fichiers que vous pouvez utiliser pour chaque constructeur de données. Tous les constructeurs de données utilisent les mêmes types de fichiers pour les données de départ et les données synthétiques générées, mais ils ont besoin de documents de référence différents pour la base de connaissances.

Tableau 2. Types de fichiers pris en charge
Générateur de données Données de départ Documents de référence Données générées
Connaissances .yaml .pdf
.md
.zip*
.jsonl
Texte vers SQL .yaml Non requis .jsonl
Appel d'outils .yaml .yaml .jsonl

*Pour le constructeur de données de connaissance, vous pouvez également ajouter les fichiers PDF ou Markdown à un fichier.zip.

Formats de sortie personnalisés

Le format par défaut des données synthétiques non structurées que vous générez convient à l'entraînement des LLM si vous utilisez watsonx.ai Tuning Studio. Si vous souhaitez utiliser les données synthétiques non structurées avec d'autres outils, vous devrez peut-être transformer le fichier JSONL généré dans un format adapté à ces outils de réglage. Vous pouvez ajouter instruction_format au fichier YAML contenant les données de départ pour modifier les valeurs par défaut dans la sortie.

Par exemple, pour le constructeur de données text to SQL, vous pouvez remplacer utterance par input et query par output en ajoutant le champ instruction_format au fichier YAML :

instruction_format: { "input": "{{utterance}}", "output": "{{query}}" }
task_description: <Description of this task>
seed_examples:
- utterance: <input question 1>
query: <sample SQL 1>
- utterance: <input question 2>
query: <sample SQL 2>
database:
schema: "<Data Definition Language (DDL) statement of one or more tables. Separate each DDL by a semi-colon>"

En savoir plus