Creazione di lavori in modo programmatico per generare dati sintetici non strutturati
Con l'API per la generazione di dati sintetici di watsonx.ai, è possibile creare insiemi di dati testuali non strutturati di grandi dimensioni e di alta qualità che riproducono i dati in tempo reale della vostra organizzazione. Utilizzate i set di dati sintetici generati per mettere a punto e valutare i modelli di fondazione per il vostro caso d'uso specifico.
Procedura
Seguite questi passaggi di alto livello per generare dati di testo sintetici non strutturati utilizzando l'API REST:
Configurare il progetto e ottenere il token IBM Cloud Identity and Access Management (IAM). Per ulteriori informazioni, consulta i requisiti di autenticazione per l'utilizzo dell'API.
Scegli un generatore di dati e carica i file di dati seed di input e i documenti di riferimento nel tuo progetto.
Il formato dei dati di input dipende dal generatore di dati selezionato. Per tutti i costruttori di dati, è necessario fornire i dati di partenza come input per la richiesta di generazione dei dati. Per alcuni generatori di dati, è necessario fornire anche documenti di riferimento per la base di conoscenza. Per ulteriori informazioni, consultare Generatori di dati e dati seed.
Utilizzare il metodo API REST
/synthetic_data/generation/unstructuredper creare il lavoro di generazione di dati sintetici non strutturati.Per vedere un esempio della richiesta e delle impostazioni di configurazione, consultare Configurazione per la creazione di lavori. Per ulteriori informazioni sul metodo API REST, vedere Creare un processo di generazione di dati sintetici non strutturati.
Opzionale : se desideri utilizzare un modello di base diverso per generare set di dati sintetici, specifica l'ID del modello API del modello di base da utilizzare. Per un elenco dei modelli compatibili, vedere Configurazione per la creazione di lavori. Per i modelli distribuiti su richiesta, utilizzare il
deployment_iddel modello una volta che lo si è distribuito nello spazio di distribuzione.L'API utilizza il modello
granite-3-8b-instructper impostazione predefinita. Per i dettagli sul modello, comprese le informazioni sulla fatturazione e gli ID del modello API, vedere Modelli di fondazione supportati.Suggerimento: per trovare il modello di base più adatto al vostro caso d'uso, sperimentate più modelli di base certificati generando una piccola quantità di dati sintetici con ciascuno di essi. Modifica il parametro `num_outputs_to_generate` impostandolo su `10` per regolare la quantità di set di dati generati. Dopo aver verificato la qualità dei risultati generati, procedere con la generazione di set di dati più grandi.Opzionale : se desideri generare dati sintetici non strutturati che utilizzano un formato di output specifico, aggiungi il
instruction_formatcampo al file yaml con i dati seed.È possibile modificare il formato dei dati sintetici non strutturati se necessario per soddisfare requisiti specifici di uno strumento di ottimizzazione che si desidera utilizzare. Per ulteriori dettagli, consultare Generatori di dati e dati seed.
Eseguire il lavoro di generazione di dati sintetici non strutturati in uno dei seguenti modi:
- Utilizzo dell'API REST delle esecuzioni dei lavori. Per maggiori dettagli, vedere Dati e API Common Core.
- Dalla pagina Lavori del progetto nell'interfaccia utente. Per ulteriori informazioni, vedere Creazione e gestione dei lavori.
L'esecuzione di un processo può richiedere alcuni minuti o alcune ore, a seconda del volume dell'output generato, del generatore di dati e del modello. È possibile monitorare lo stato del lavoro di generazione di dati sintetici non strutturati facendo clic sull'esecuzione del lavoro per accedere al registro dalla pagina dei dettagli dell'esecuzione del lavoro. I dati sintetici non strutturati vengono salvati come file JSONL e aggiunti alle risorse di dati del progetto una volta completato il lavoro.
Attenzione:L'utente è tenuto a pagare i gettoni generati dal modello di fondazione. Per i dettagli, vedere Modelli di fondazione supportati. Scarica il file JSONL dalla scheda Risorse.
Non è possibile visualizzare l'anteprima dei dati nella scheda Attività. È necessario scaricare il file JSONL per visualizzarlo. I dati generati vengono formattati in base al generatore di dati selezionato.
Importante: scaricare sempre il file JSONL prima di eseguire nuovamente il processo. Ogni volta che viene eseguito un processo, qualsiasi file JSONL nel progetto con lo stesso nome viene sovrascritto dai risultati dell'ultima esecuzione.
Passi successivi
Ora è possibile utilizzare i dati per addestrare i modelli. Controlla sempre i dati sintetici non strutturati prodotti prima di utilizzarli per l'addestramento.
Dettagli di output per le richieste API REST
Per evitare di incorrere in costi involontari, è possibile creare un massimo di 1000 QnA coppie, a meno che non si sia stati inseriti nell'elenco delle autorizzazioni per la generazione di set di dati più grandi. Per generare un set di dati più ampio, contattare il team di assistenza aprendo un caso nel portale di assistenza IBM Cloud. Per maggiori dettagli, vedere Creazione di casi di supporto nella documentazione di IBM Cloud.