Confronto di risorse AI con Evaluation Studio
Con Evaluation Studio, potete valutare e confrontare le vostre risorse di IA generativa con metriche quantitative e criteri personalizzabili che si adattano ai vostri casi d'uso. Valutare le prestazioni di più asset contemporaneamente e visualizzare analisi comparative dei risultati per identificare le soluzioni migliori.
È possibile utilizzare Evaluation Studio per ottimizzare il processo di sviluppo dell'intelligenza artificiale generativa, automatizzando il processo di valutazione di più risorse di intelligenza artificiale per vari tipi di attività. Invece di esaminare singolarmente ogni modello di prompt e confrontarne manualmente le prestazioni, è possibile configurare un singolo esperimento per valutare più modelli di prompt contemporaneamente, risparmiando tempo durante lo sviluppo.
Le seguenti funzioni sono incluse in Evaluation Studio per aiutarvi a valutare e confrontare i modelli di prompt per identificare le risorse più performanti per le vostre esigenze:
Impostazione dell'esperimento personalizzabile
- Scegliete tra diversi tipi di attività per soddisfare le vostre esigenze specifiche.
- Caricare i dati di prova selezionando le risorse del progetto.
- Selezionate fino a cinque modelli di prompt da valutare e confrontare.
- Scegliere le dimensioni di valutazione per configurare le metriche specifiche dell'attività.
Analisi flessibile dei risultati
- Visualizzate i risultati in formato di tabella o grafico per aiutarvi a raccogliere informazioni.
- Selezionare i modelli di prompt di riferimento per facilitare i confronti
- Filtrare o ordinare i risultati in base a metriche o valori specifici.
- Ricerca tra i risultati della valutazione con intervalli di valori.
- Confrontate più modelli di prompt uno accanto all'altro con i grafici.
- Acquisizione automatica dei dettagli della valutazione in AI Factsheets per tenere traccia delle prestazioni nei vari casi d'uso dell'IA.
- Create classifiche personalizzate per dare priorità ai risultati più importanti per il vostro caso d'uso.
- Aggiungere o rimuovere modelli di prompt dagli esperimenti e rieseguire le valutazioni per effettuare nuovi confronti.
Requisiti
È possibile confrontare le risorse AI in Evaluation Studio se si soddisfano i seguenti requisiti:
Ruoli richiesti
Per utilizzare Evaluation Studio, è necessario essere assegnati ai ruoli di Admin o Editor per il progetto in watsonx.governance. Potrebbe essere necessario assegnare il ruolo di amministratore alla propria istanza. Per ulteriori informazioni sui ruoli, vedere Gestione degli utenti per il servizio Watson OpenScale nella documentazione di IBM Software Hub.
Dati di test
I dati di test caricati devono contenere colonne di output e di input di riferimento per ciascuna variabile richiesta. Le colonne di output di riferimento vengono utilizzate per calcolare le metriche basate sul riferimento, come ROUGE e BLEU. Per ulteriori informazioni, vedere Gestione dei dati per la valutazione dei modelli.
La sezione seguente descrive come valutare e confrontare gli asset AI con Evaluation Studio:
Confronto e valutazione di più risorse di IA
Per valutare e confrontare le risorse con Evaluation Studio, è possibile eseguire le seguenti operazioni:
- Selezionare il compito di valutazione.
- Nella scheda Assets del progetto watsonx.governance, selezionare New asset.
- Nella finestra Cosa si desidera fare, selezionare il riquadro attività Valutare e confrontare i prompt.
- Impostare la valutazione. Quando si apre la procedura guidata Valutazione e confronto dei prompt e vengono visualizzati i tipi di attività disponibili per la valutazione, specificare un nome di valutazione e selezionare il tipo di attività associato ai modelli di prompt che si desidera valutare.
- Selezionate i modelli di prompt del vostro progetto che volete valutare e confrontare. È necessario che ti sia stato assegnato il ruolo di amministratore per la tua istanza. Se al progetto non è associata alcuna istanza di watsonx.governance, è necessario selezionare "Associa un'istanza del servizio" nella finestra di dialogo "Associa un'istanza del servizio" per associare un'istanza al progetto.

- Selezionare le metriche. Watsonx.governance seleziona automaticamente le metriche disponibili per il tipo di attività dei modelli di prompt e configura le impostazioni predefinite per ciascuna metrica. È possibile modificare le selezioni delle metriche oppure selezionare "Configura" per configurare le valutazioni con impostazioni personalizzate.
- Selezionare i dati di prova selezionando un asset dal progetto. Quando si selezionano i dati di test, watsonx.governance rileva automaticamente le colonne associate alle variabili del prompt.
- Esaminare ed eseguire la valutazione.
- Prima di eseguire la valutazione del modello di prompt, è possibile rivedere le selezioni per il tipo di attività, i dati di test caricati, le metriche e il tipo di valutazione da eseguire.
- Selezionare la casella di controllo Abilita credenziali attività. Questa impostazione è necessaria per tutte le sottoscrizioni che necessitano di un'autorizzazione per l'esecuzione sicura dei lavori di valutazione.
- Dopo aver avviato la valutazione, puoi selezionare "Visualizza attività" per visualizzare un elenco che mostra lo stato della valutazione in corso e delle valutazioni precedenti che hai completato.

- Esaminare il confronto delle metriche.
- Al termine della valutazione, è possibile visualizzare le visualizzazioni dei dati che confrontano i risultati per ciascun modello di richiesta selezionato. Le visualizzazioni mostrano se i punteggi violano le soglie per ciascuna metrica. I risultati vengono visualizzati anche in una tabella che si può utilizzare per analizzare i risultati selezionando, filtrando o classificando le metriche che si desidera visualizzare per gli asset.
- Per effettuare dei confronti, seleziona un asset di riferimento per evidenziare le colonne della tabella e vedere se gli altri asset stanno ottenendo risultati migliori o peggiori rispetto a quello selezionato.

- Per analizzare i risultati, è anche possibile creare una classifica personalizzata delle metriche tra i diversi gruppi, specificando i fattori di ponderazione e una formula di classificazione per determinare quali modelli di prompt presentano le migliori prestazioni.

- Se si desidera eseguire nuovamente le valutazioni, fare clic su Regola impostazioni
nel riquadro Dettagli valutazione per aggiornare i dati del test o riconfigurare le metriche. - Se si desidera modificare l'esperimento, fare clic su Edit Assets
per rimuovere o aggiungere asset alla valutazione e modificare il confronto.
Confronto tra diverse risorse di IA e le valutazioni esistenti
È possibile seguire i passaggi riportati di seguito per valutare e confrontare le risorse già valutate in Evaluation Studio, invece di eseguire una nuova valutazione:
- Selezionare il compito di valutazione.
- Nella scheda Assets del progetto watsonx.governance, selezionare New asset.
- Nella finestra Cosa si desidera fare, selezionare il riquadro attività Valutare e confrontare i prompt.
- Seleziona i modelli di prompt (offline).
- Imposta il confronto. Quando si apre la procedura guidata "Valuta e confronta prompt" e vengono visualizzati i tipi di attività disponibili per il confronto, specificare un nome per il confronto e selezionare il tipo di attività associato ai modelli di prompt che si desidera confrontare.
- Fare clic su Avanti.
- Seleziona i modelli di prompt che desideri confrontare.
- Controlla ed esegui il confronto.
- Prima di eseguire il confronto dei modelli di prompt, puoi verificare le impostazioni relative al tipo di attività e al tipo di confronto da eseguire.
- Selezionare la casella di controllo "Credenziali attività ". Questa impostazione è necessaria per tutti gli abbonamenti che richiedono un'autorizzazione per eseguire i processi di confronto in modo sicuro.
- Esaminare il confronto delle metriche.
- Una volta completato il confronto, potrai visualizzare le rappresentazioni grafiche che mettono a confronto i risultati per ciascun modello di prompt selezionato. Le visualizzazioni mostrano se i punteggi violano le soglie per ciascuna metrica. I risultati vengono visualizzati anche in una tabella che si può utilizzare per analizzare i risultati selezionando, filtrando o classificando le metriche che si desidera visualizzare per gli asset.
I confronti completati relativi all'attività sulle risorse di IA esistenti sono disponibili nella scheda "Risorse " del tuo progetto watsonx.governance.
Passi successivi
È stata creata una nuova risorsa di valutazione AI nel progetto. È possibile riaprire la risorsa nel progetto per modificare o eseguire nuovi esperimenti.