Costruttori di dati e formati di dati seme

Utilizzate Synthetic Data Generator e i data builder per creare insiemi di dati sintetici in diversi formati. Il formato dei dati sintetici non strutturati è determinato dal costruttore di dati scelto.

Scegliere uno dei seguenti costruttori di dati per generare insiemi di dati sintetici:

  • Conoscenza
  • Testo in SQL
  • Chiamata di strumenti

È necessario fornire i seguenti input per il costruttore di dati specificato nella richiesta di generazione di dati non strutturati:

Dati seed
Tutti i costruttori di dati richiedono come input i dati di partenza. I dati di partenza addestrano il modello, che poi genera i set di dati sintetici nello stesso formato dei dati di partenza. I diversi costruttori di dati utilizzano diversi tipi di dati di partenza. Ad esempio, il costruttore di dati sulla conoscenza richiede dati di partenza sotto forma di coppie di domande e risposte
Documenti di riferimento
Alcuni costruttori di dati, come il tool calling e il knowledge data builder, richiedono documenti di riferimento specifici per il dominio, che servono come base di conoscenza quando il modello di base viene sollecitato a generare insiemi di dati sintetici. Ad esempio, è possibile fornire una specifica API o più file Markdown contenenti informazioni specifiche sul proprio caso d'uso o sulla propria attività.

Confronto tra i costruttori di dati

Per aiutarvi a scegliere il data builder più adatto al vostro caso d'uso, consultate la tabella di confronto.

Tabella 1. Differenze tra i costruttori di dati
Generatore di dati Formato dei dati del seme Utilizzo dei dati sintetici generati
Conoscenza - Coppie di domande e risposte ( QnA ) basate su una base di conoscenza
- Documenti di riferimento che fungono da base di conoscenza
Utilizzato per addestrare i LLM a svolgere compiti di risposta alle domande, riassunto e conversazione basati su argomenti di una tassonomia aziendale.
Testo in SQL - Operazioni di database in chiaro
- Istruzione SQL
- Schema del database
Utilizzato per addestrare i LLM a tradurre una richiesta leggibile dall'uomo in una precisa interrogazione di database che può essere utilizzata direttamente dalle applicazioni.
Chiamata di strumenti - Coppie di istruzioni e risposte
- File di specifiche API contenenti definizioni di funzioni per gli strumenti
Utilizzato per mettere a punto gli LLM per automatizzare i flussi di lavoro, interagire con i database, affrontare compiti complessi di risoluzione dei problemi, prendere decisioni in tempo reale e altro ancora. È più adatto per le applicazioni di intelligenza artificiale agenziale.

Tipi di file supportati per i costruttori di dati

La tabella seguente mostra i tipi di file che è possibile utilizzare per ciascun costruttore di dati. Tutti i costruttori di dati utilizzano gli stessi tipi di file per i dati di partenza e i dati sintetici generati, ma richiedono documenti di riferimento diversi per la base di conoscenza.

Tabella 2. Tipi di file supportati
Generatore di dati Dati seed Documenti di riferimento Dati generati
Conoscenza .yaml .pdf
.md
.zip*
.jsonl
Testo in SQL .yaml Non richiesto .jsonl
Chiamata di strumenti .yaml .yaml .jsonl

*Per il costruttore di dati sulla conoscenza, è possibile aggiungere i file PDF o Markdown a un file.zip.

Formati di output personalizzati

Il formato predefinito dei dati sintetici non strutturati generati è adatto all'addestramento degli LLM se si utilizza watsonx.ai Tuning Studio. Se si desidera utilizzare i dati sintetici non strutturati con altri strumenti, potrebbe essere necessario trasformare il file JSONL generato in un formato adatto a tali strumenti di sintonizzazione. È possibile aggiungere instruction_format al file YAML con i dati del seme per modificare i valori predefiniti nell'output.

Ad esempio, per il costruttore di dati da testo a SQL, è possibile cambiare utterance in input e query in output aggiungendo il seguente campo instruction_format al file YAML:

instruction_format: { "input": "{{utterance}}", "output": "{{query}}" }
task_description: <Description of this task>
seed_examples:
- utterance: <input question 1>
query: <sample SQL 1>
- utterance: <input question 2>
query: <sample SQL 2>
database:
schema: "<Data Definition Language (DDL) statement of one or more tables. Separate each DDL by a semi-colon>"

Ulteriori informazioni