Costruttori di dati e formati di dati seme
Utilizzate Synthetic Data Generator e i data builder per creare insiemi di dati sintetici in diversi formati. Il formato dei dati sintetici non strutturati è determinato dal costruttore di dati scelto.
Scegliere uno dei seguenti costruttori di dati per generare insiemi di dati sintetici:
- Conoscenza
- Testo in SQL
- Chiamata di strumenti
È necessario fornire i seguenti input per il costruttore di dati specificato nella richiesta di generazione di dati non strutturati:
- Dati seed
- Tutti i costruttori di dati richiedono come input i dati di partenza. I dati di partenza addestrano il modello, che poi genera i set di dati sintetici nello stesso formato dei dati di partenza. I diversi costruttori di dati utilizzano diversi tipi di dati di partenza. Ad esempio, il costruttore di dati sulla conoscenza richiede dati di partenza sotto forma di coppie di domande e risposte
- Documenti di riferimento
- Alcuni costruttori di dati, come il tool calling e il knowledge data builder, richiedono documenti di riferimento specifici per il dominio, che servono come base di conoscenza quando il modello di base viene sollecitato a generare insiemi di dati sintetici. Ad esempio, è possibile fornire una specifica API o più file Markdown contenenti informazioni specifiche sul proprio caso d'uso o sulla propria attività.
Confronto tra i costruttori di dati
Per aiutarvi a scegliere il data builder più adatto al vostro caso d'uso, consultate la tabella di confronto.
| Generatore di dati | Formato dei dati del seme | Utilizzo dei dati sintetici generati |
|---|---|---|
| Conoscenza | - Coppie di domande e risposte ( QnA ) basate su una base di conoscenza - Documenti di riferimento che fungono da base di conoscenza |
Utilizzato per addestrare i LLM a svolgere compiti di risposta alle domande, riassunto e conversazione basati su argomenti di una tassonomia aziendale. |
| Testo in SQL | - Operazioni di database in chiaro - Istruzione SQL - Schema del database |
Utilizzato per addestrare i LLM a tradurre una richiesta leggibile dall'uomo in una precisa interrogazione di database che può essere utilizzata direttamente dalle applicazioni. |
| Chiamata di strumenti | - Coppie di istruzioni e risposte - File di specifiche API contenenti definizioni di funzioni per gli strumenti |
Utilizzato per mettere a punto gli LLM per automatizzare i flussi di lavoro, interagire con i database, affrontare compiti complessi di risoluzione dei problemi, prendere decisioni in tempo reale e altro ancora. È più adatto per le applicazioni di intelligenza artificiale agenziale. |
Tipi di file supportati per i costruttori di dati
La tabella seguente mostra i tipi di file che è possibile utilizzare per ciascun costruttore di dati. Tutti i costruttori di dati utilizzano gli stessi tipi di file per i dati di partenza e i dati sintetici generati, ma richiedono documenti di riferimento diversi per la base di conoscenza.
| Generatore di dati | Dati seed | Documenti di riferimento | Dati generati |
|---|---|---|---|
| Conoscenza | .yaml | .pdf .md .zip* |
.jsonl |
| Testo in SQL | .yaml | Non richiesto | .jsonl |
| Chiamata di strumenti | .yaml | .yaml | .jsonl |
*Per il costruttore di dati sulla conoscenza, è possibile aggiungere i file PDF o Markdown a un file.zip.
Formati di output personalizzati
Il formato predefinito dei dati sintetici non strutturati generati è adatto all'addestramento degli LLM se si utilizza watsonx.ai Tuning Studio. Se si desidera utilizzare i dati sintetici non strutturati con altri strumenti, potrebbe essere necessario trasformare il file JSONL generato in un formato adatto a tali strumenti di sintonizzazione. È possibile aggiungere instruction_format al file YAML con i dati del seme per modificare i valori predefiniti nell'output.
Ad esempio, per il costruttore di dati da testo a SQL, è possibile cambiare utterance in input e query in output aggiungendo il seguente campo instruction_format al file YAML:
instruction_format: { "input": "{{utterance}}", "output": "{{query}}" }
task_description: <Description of this task>
seed_examples:
- utterance: <input question 1>
query: <sample SQL 1>
- utterance: <input question 2>
query: <sample SQL 2>
database:
schema: "<Data Definition Language (DDL) statement of one or more tables. Separate each DDL by a semi-colon>"