Scelta di un modello di base in watsonx.ai
Ci sono molti fattori da considerare quando si sceglie un modello di base da utilizzare per l'inferenza in un progetto di IA generativa.
Ad esempio, per una soluzione che sintetizza le segnalazioni di problemi dei call center, potrebbe essere opportuno utilizzare un modello di base con le seguenti caratteristiche:
- Ottime prestazioni nei test di benchmark relativi alle attività di sintesi
- Gestisce grandi quantità di testo, il che comporta una finestra di contesto di notevole lunghezza
- È in grado di interpretare le immagini di oggetti danneggiati, pertanto accetta input sia in formato testuale che in formato immagine
Determinate quali sono i fattori più importanti per voi e per la vostra organizzazione.
- I compiti che il modello può svolgere
- Modelli di base multimodali
- Lingue supportate
- Opzioni di messa a punto per la personalizzazione del modello
- Termini di licenza e indennità di proprietà intellettuale
- Attributi del modello, come dimensioni, architettura e lunghezza della finestra di contesto
Dopo aver stilato un breve elenco dei modelli più adatti alle vostre esigenze, potete testare i modelli per vedere quali restituiscono costantemente i risultati desiderati.
Modelli di base che supportano il tuo caso d'uso
Per iniziare, trova i modelli di base che possono eseguire il tipo di attività che vuoi completare.
La tabella seguente illustra i tipi di attività supportati dai modelli di base disponibili su IBM watsonx.ai. Un segno di spunta (✓) indica che l'attività indicata nell'intestazione della colonna è supportata dal modello di base. Per alcune attività, puoi cliccare su un link per visualizzare un esempio di istruzione relativa all'attività.
| Modello | Conversazione dall'API Chat |
Interazione con gli strumenti tramite l'API della chat |
Generazione potenziata dal recupero (RAG) | Esempi |
|---|---|---|---|---|
| ibm-defense-4-0-small | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Esempio di richiamo di strumenti • API di chat |
| ibm-defense-4-0-micro | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Esempio di richiamo di strumenti • API di chat |
| ibm-defense-3-3-8b-instruct | ✓ | ✓ | ✓ • RAG da Prompt Lab |
• API di chat |
| granite-4-h-tiny | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Esempio di richiamo di strumenti • API di chat |
| granite-4-h-small | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• API di chat |
| granite-docling-258M | ✓ | ✓ RAG tratto da Prompt Lab |
• Esempio di chat con immagini• API di chat |
|
| granite-3-3-8b-instruct | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Domande e risposte | |
| granite-3-2-8b-instruct | ✓ | ✓ | ✓ RAG tratto da Prompt Lab |
• API di chat |
| granite-3-2b-instruct | ✓ | • Codice • API della chat |
||
| granite-3-8b-instruct | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Codice • API di chat • Richiamo di strumenti |
| granite-3b-code-instruct | • Codice | |||
| granite-4-1b-speech | ✓ | ✓ | ||
| granite-8b-code-instruct | • Codice | |||
| granite-20b-code-instruct | ✓ | • Codice • API della chat |
||
| granite-20b-code-base-schema-linking | • Codice | |||
| granite-20b-code-base-sql-gen | • Codice | |||
| granite-34b-code-instruct | ✓ | • Codice • API della chat |
||
| granite-guardian-3-2b | ✓ RAG tratto da Prompt Lab |
• Classificazione | ||
| granite-guardian-3-8b | ✓ RAG tratto da Prompt Lab |
• Classificazione | ||
| granite-guardian-3-2-5b | ✓ | ✓ RAG tratto da Prompt Lab |
• Classificazione • API di chat |
|
| granite-vision-3-3-2b | ✓ | • Esempio di chat con immagini• API di chat |
||
| allam-1-13b-instruct | • Classificazione • Traduzione |
|||
| codestral-2501 | • Codice | |||
| codestral-2508 | • Codice | |||
| devstral-small-2512 | ✓ | ✓ | • Classificazione • Domande e risposte• Sintesi |
|
| devstral-medium-2507 | ✓ | ✓ | • Classificazione • Domande e risposte• Sintesi |
|
| devstral-medium-2512 | ✓ | ✓ | • Classificazione • Domande e risposte• Sintesi |
|
| gpt-oss-20b | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• API di chat |
| gpt-oss-120b | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• API di chat |
| llama-4-maverick-17b-128e-instruct-fp8 | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Finestra di dialogo • Chat • API della chat |
|
| llama-4-scout-17b-16e-instruct-int4 | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Finestra di dialogo • Chat • API della chat |
|
| llama-3-3-70b-instruct | ✓ | ✓ | ✓ • RAG da Prompt Lab • RAG da AutoAI |
• Esempio di chat • Esempio di chiamata agli strumenti • API della chat |
| llama-3-2-1b-instruct | ✓ | ✓ RAG tratto da Prompt Lab |
• Codice • Finestra di dialogo • Richiamo di strumenti |
|
| llama-3-2-3b-instruct | ✓ | ✓ RAG tratto da Prompt Lab |
• Codice • Finestra di dialogo • Richiamo di strumenti |
|
| llama-3-2-11b-vision-instruct | ✓ | ✓ | ✓ RAG tratto da Prompt Lab |
• Es empio di chat con immagini• API di chat• Esempio di chiamata a uno strumento |
| llama-3-2-90b-vision-instruct | ✓ | ✓ | ✓ RAG tratto da Prompt Lab |
• Es empio di chat con immagini• API di chat• Esempio di chiamata a uno strumento |
| llama-3-1-8b | ✓ RAG tratto da Prompt Lab |
• Dialogo | ||
| llama-guard-3-11b-vision | ✓ | ✓ RAG tratto da Prompt Lab |
• Classificazione • Esempio di chat con immagini • API di chat |
|
| llama-3-1-8b-instruct | ✓ | ✓ | ✓• RAG da Prompt Lab • RAG da AutoAI |
• Finestra di dialogo • API di chat • Richiamo di strumenti |
| llama-3-1-70b-instruct | ✓ | ✓ | ✓• RAG da Prompt Lab • RAG da AutoAI |
• Finestra di dialogo • API di chat • Richiamo di strumenti |
| magistral-small-2509 | ✓ | ✓ | ✓ | |
| magistral-medium-2509 | ✓ | ✓ | ✓ | |
| ministral-3-8B-instruct-2512 | ✓ | ✓ | ✓ | |
| ministral-3B-instruct-2512 | ✓ | ✓ | ✓• RAG da Prompt Lab |
|
| ministral-8b-instruct | • Classificazione • Estrazione • Sintesi • Traduzione |
|||
| ministral-14b-instruct-2512 | ✓ | ✓ | ✓ RAG tratto da Prompt Lab |
• API di chat • Esempio di chat con immagini |
| mistral-large-2512 | ✓ | ✓ | ✓• RAG da Prompt Lab |
• Classificazione • Estrazione • Sintesi • Codifica • Traduzione • API di chat • Richiamo di strumenti • Esempio di chat con immagini |
| mistral-large-instruct-2411 | ✓ | ✓ RAG tratto da Prompt Lab |
• Classificazione • Estrazione • Sintesi • Codice • Traduzione |
|
| mistral-small-3-2-24b-instruct-2506 | ✓ | ✓ | ✓• RAG da Prompt Lab • RAG da AutoAI |
• API di chat • Esempio di chat con immagini |
| mistral-small-3-1-24b-instruct-2503 | ✓ | ✓• RAG da Prompt Lab • RAG da AutoAI |
• API di chat | |
| nvidia-nemotron-nano-12b-v2-vl-fp8 | ✓ | ✓ | ✓ | |
| nvidia-nemotron-3-nano-30b-a3b-fp8 | ✓ | ✓ | ✓ | |
| pixtral-12b | ✓ | ✓ RAG tratto da Prompt Lab |
• Classificazione • Estr azione • Sintesi • Esempio di chat con immagini |
|
| pixtral-large-instruct-2411 | ✓ | • Esempio di chat con immagine | ||
| voxtral-small-24b-2507 | ✓ | ✓ | ✓• RAG da Prompt Lab • RAG da AutoAI |
• API di chat • Classificazione • Estrazione • Generazione • Sintesi • Traduzione |
| voxtral-mini-2507 | ✓ | ✓ |
- Per consultare vari esempi di richieste raggruppati per tipo di attività, consultare la sezione "Esempi di richieste".
- Per valutare l'efficacia di un modello di base nell'esecuzione di determinati compiti, consultare i benchmark dei modelli di base.
Modelli di base multimodali
I modelli di base multimodali sono in grado di elaborare e integrare informazioni provenienti da diverse modalità o tipi di dati. Tali modalità possono includere testo, immagini, audio, video e altre forme di stimoli sensoriali.
I modelli di base multimodali disponibili su watsonx.ai sono in grado di svolgere i seguenti tipi di attività:
- Generazione di testo a partire da immagini
- Utile per rispondere a domande di carattere visivo, interpretare tabelle e grafici, aggiungere didascalie alle immagini e molto altro ancora.
- Conversione da audio a testo
- Utile per il riconoscimento vocale, la trascrizione di contenuti parlati, la comprensione dei comandi vocali, la creazione di appunti durante le riunioni, il supporto all'accessibilità e altro ancora.
La tabella seguente elenca i modelli di base disponibili che supportano modalità diverse dall'input e dall'output di testo.
| Modello | Modalità di immissione | Modalità di output |
|---|---|---|
| granite-vision-3-2-2b | immagine, testo | Testo |
| llama-4-maverick-17b-128e-instruct-fp8 | immagine, testo | Testo |
| llama-3-2-11b-vision-instruct | immagine, testo | Testo |
| llama-3-2-90b-vision-instruct | immagine, testo | Testo |
| llama-guard-3-11b-vision | immagine, testo | Testo |
| ministral-8b-instruct-2512 | immagine, testo | Testo |
| ministral-14b-instruct-2512 | immagine, testo | Testo |
| mistral-large-2512 | immagine, testo | Testo |
| mistral-small-3-2-24b-instruct-2506 | immagine, testo | Testo |
| pixtral-12b | immagine, testo | Testo |
| voxtral-small-24b-2507 | audio, testo | Testo |
Modelli di base che supportano la tua lingua
Molti modelli di fondazione funzionano bene solo in inglese. Ma alcuni creatori di modelli includono più lingue negli insiemi di dati di pre - addestramento per ottimizzare il loro modello sulle attività in lingue differenti e per testare le prestazioni del loro modello in più lingue. Se si pianifica di creare una soluzione per un pubblico globale o una soluzione che esegue attività di traduzione, cercare i modelli che sono stati creati con un supporto multilingue in mente.
La seguente tabella elenca le lingue naturali supportate oltre all'inglese dai modelli di base in watsonx.ai. Per ulteriori informazioni sulle lingue supportate per i modelli di fondazione multilingue, vedi la scheda del modello per il modello di fondazione.
| Modello | Lingue diverse dall'inglese |
|---|---|
| Granite 4.0 (granite-4-h-small, granite-4-h-micro, granite-4-h-tiny ) | Tedesco, spagnolo, francese, giapponese, portoghese, arabo, ceco, italiano, coreano, olandese e cinese. È possibile ottimizzare questi modelli di " Granite " per lingue diverse da queste 12 |
| Granite Contatta 3.3 ( granite-3-3-2b-instruct, granite-3-3-8b-instruct ) | Tedesco, spagnolo, francese, giapponese, portoghese, arabo, ceco, italiano, coreano, olandese e cinese. È possibile ottimizzare questi modelli Granite per lingue diverse da queste 12. |
| Granite Vision ( granite-vision-3-3-2b, granite-vision-3-2-2b ) | Tedesco, spagnolo, francese, giapponese, portoghese, arabo, ceco, italiano, coreano, olandese, cinese |
| IBM Difesa 4.0 | Tedesco, spagnolo, francese, giapponese, portoghese, arabo, ceco, italiano, coreano, olandese e cinese. |
| allam-1-13b-instruct | Arabo |
| gpt-oss-120b | Multilingua |
| Llama 4 ( llama-4-maverick-17b-128e-instruct-fp8 ) | Arabo, francese, tedesco, hindi, indonesiano, italiano, portoghese, spagnolo, tagalog, thailandese e vietnamita. |
| Llama 3.3 ( llama-3-3-70b-instruct ) | Tedesco, francese, italiano, portoghese, hindi, spagnolo e thailandese |
| Llama 3.2 ( llama-3-2-1b-instruct, llama-3-2-3b-instruct. Inoltre llama-3-2-11b-vision-instruct, llama-3-2-90b-vision-instruct e llama-guard-3-11b-vision (con campi di inserimento solo testo) | inglese, tedesco, francese, italiano, portoghese, hindi, spagnolo e thailandese |
| Llama 3.1 ( llama-3-1-8b-instruct, llama-3-1-70b-instruct ) | inglese, tedesco, francese, italiano, portoghese, hindi, spagnolo e thailandese |
| Ministral 3 ( ministral-3b-instruct-2512, ministral-8b-instruct-2512, ministral-14b-instruct-2512 ) | Francese, spagnolo, tedesco, italiano, portoghese, olandese, cinese, giapponese, coreano, arabo e decine di altre lingue. |
| ministral-8b-instruct | Multilingue ( vedi scheda del modello ) |
| mistral-large-2512 | Francese, tedesco, italiano, spagnolo, cinese, giapponese, coreano, portoghese, olandese, polacco e decine di altre lingue. |
| Mistral Medium ( mistral-medium-2505 , mistral-medium-2508 ) | Multilingue (vedi scheda del modello) |
| mistral-small-3-2-24b-instruct-2506 | Francese, tedesco, greco, hindi, indonesiano, italiano, giapponese, coreano, malese, nepalese, polacco, portoghese, rumeno, russo, serbo, spagnolo, svedese, turco, ucraino, vietnamita, arabo, bengalese, cinese, farsi. |
| voxtral-small-24b-2507 | Spagnolo, francese, portoghese, hindi, tedesco, olandese, italiano. |
Modelli di fondazione che si possono mettere a punto
È possibile eseguire esperimenti di ottimizzazione che modificano i pesi dei parametri del modello di base sottostante, in modo da indirizzare il modello verso la generazione di output ottimizzati per un determinato compito.
La tabella seguente mostra i modelli di fondazione che è possibile ottimizzare utilizzando vari metodi di ottimizzazione disponibili su IBM watsonx.ai. Un segno di spunta (✓) indica che il modello di base supporta la regolazione fine.
| Nome modello | Messa a punto completa | LoRA messa a punto | QLoRA messa a punto |
|---|---|---|---|
| allam-1-13b-instruct | ✓ | ||
| granite-3b-code-instruct | ✓ | ||
| granite-8b-code-instruct | ✓ | ||
| granite-20b-code-instruct | ✓ | ||
| granite-3-1-8b-base | ✓ | ✓ | |
| llama-3-1-8b | ✓ | ✓ | |
| llama-3-1-8b-instruct | ✓ | ||
| llama-3-1-70b | ✓ | ||
| llama-3-1-70b-gptq | ✓ |
Per ulteriori informazioni, consultare la sezione "Scelta di un modello da ottimizzare".
Tipi di modelli e indennizzo della proprietà intellettuale
Esaminare la politica di indennizzo della proprietà intellettuale per il modello di fondazione che si desidera utilizzare. Alcuni fornitori di modelli di fondazione di terze parti richiedono di esonerarli dalla responsabilità per qualsiasi violazione della proprietà intellettuale che potrebbe derivare dall'uso dei loro modelli di IA.
I modelli di fondazione sviluppati da IBM e disponibili su watsonx.ai godono di una protezione standard della proprietà intellettuale, simile a quella che IBM fornisce per i prodotti hardware e software.
IBM estende la sua indennità standard per la proprietà intellettuale all'output generato dai modelli coperti. I modelli coperti comprendono modelli sviluppati da IBM e alcuni modelli di fondazione di terze parti disponibili su watsonx.ai. I modelli coperti di terze parti sono identificati nella tabella 4.
La tabella seguente descrive i diversi modelli di fondazione e le relative politiche di indennizzo. Per tutti i dettagli, consultare i materiali di riferimento.
| Tipo di modello di fondazione | Politica di indennizzo | Modelli Foundation | Dettagli | Materiali di riferimento |
|---|---|---|---|---|
| IBM Modello coperto | Indennizzo non limitato IBM | - IBM Granite - IBM Ardesia |
IBM -modelli di base sviluppati, disponibili all'indirizzo watsonx.ai. | Informazioni sulla licenza |
| Modello coperto da terzi | Indennizzo massimo IBM | Modelli commerciali Mistral | Modelli di terze parti coperti dalla garanzia disponibili su watsonx.ai. | Informazioni sulla licenza |
| Prodotto nonIBM | Nessun IBM indennizzo | Varie | Modelli di terze parti disponibili su watsonx.ai e soggetti ai rispettivi termini di licenza, compresi gli obblighi e le restrizioni associati. | Vedere le informazioni sul modello. |
| Modello personalizzato | Nessun IBM indennizzo | Varie | I modelli Foundation importati per essere utilizzati in watsonx.ai sono contenuti del cliente. | Il cliente è l'unico responsabile della scelta e dell'uso del modello e dell'output e della conformità ai termini, agli obblighi e alle restrizioni della licenza di terzi. |
Per ulteriori informazioni sui termini di licenza dei modelli di terze parti, consultare la sezione "Modelli di base di terze parti ".
Altre considerazioni per la scelta del modello
| Attributo Modello | Considerazioni |
|---|---|
| Lunghezza contesto | A volte denominata lunghezza della finestra di contesto, finestra di contestoo lunghezza massima della sequenza, la lunghezza del contesto è il valore massimo consentito per il numero di token nella richiesta di input più il numero di token nell'output generato. Quando si genera l'output con i modelli in watsonx.ai, il numero di token nell'output generato è limitato dal parametro Numero massimo di token. |
| Ottimizzato | Dopo che un modello di base è stato preaddestrato, molti modelli di base sono ottimizzati per attività specifiche, come la classificazione, l'estrazione delle informazioni, il riepilogo, la risposta alle istruzioni, la risposta alle domande o la partecipazione a una conversazione di dialogo di tipo back-and-forth. Un modello che subisce un'ottimizzazione delle attività simili all'utilizzo pianificato in genere funziona meglio con i prompt zero - shot rispetto ai modelli che non sono ottimizzati in un modo che si adatta al tuo caso d'uso. Un modo per migliorare i risultati di un modello ottimizzato consiste nel strutturare il prompt nello stesso formato dei prompt nei dataset utilizzati per ottimizzare il modello. |
| Istruzioni ottimizzate | Istruzioni ottimizzate significa che il modello è stato ottimizzato con istruzioni che includono un'istruzione. Quando un modello è ottimizzato per le istruzioni, in genere risponde bene ai prompt che hanno un'istruzione anche se tali prompt non hanno esempi. |
| Indennità IP | Oltre ai termini della licenza, esaminare la politica di indennizzo della proprietà intellettuale per il modello. Per ulteriori informazioni, vedere Tipi di modello e indennizzo IP. |
| Licenza | In generale, ogni modello di fondazione viene fornito con una licenza differente che limita la modalità di utilizzo del modello. Esaminare le licenze del modello per assicurarsi di poter utilizzare un modello per la propria soluzione pianificata. |
| Architettura del modello | L'architettura del modello influenza il comportamento del modello. Un modello basato sul trasformatore generalmente ha una delle seguenti architetture: Solo codificatore: comprende il testo di input a livello di frase trasformando le sequenze di input in vettori di rappresentazione denominati embeddings. Le attività comuni per i modelli solo codificatore includono la classificazione e l'estrazione di entità. Solo decodificatore: genera il testo di output parola per parola in base all'inferenza dalla sequenza di input. Le attività comuni per i modelli di solo decodificatore includono la creazione di testo e la risposta alle domande. codificatore - decodificatore: entrambi comprendono il testo di input e generano il testo di output in base al testo di input. Le attività comuni per i modelli encoder - decoder includono la conversione e il riepilogo. |
| Linguaggi di programmazione supportati | Non tutti i modelli di base funzionano bene per la programmazione dei casi di utilizzo. Se si prevede di creare una soluzione che riepiloghi, converta, generi o altrimenti elabori il codice, esaminare quali linguaggi di programmazione sono stati inclusi nei dataset di preaddestramento di un modello e le attività di ottimizzazione per determinare se tale modello è adatto al proprio caso d'uso. |