Évaluation des résultats de l'IA générative dans plusieurs langues
Vous pouvez évaluer les résultats de l'IA générative dans plusieurs langues en utilisant le moniteur de qualité de l'IA générative sur watsonx.governance. Vous pouvez sélectionner la langue pour laquelle vous souhaitez calculer les mesures de qualité lorsque vous configurez votre évaluation.
Pour effectuer des évaluations multilingues :
Lors de l'exécution à l'aide de l'API ou du SDK, voir le carnet de support multilingue de l'exécution.
Au moment de la conception, à l'aide du SDK ou d'un tokenizer personnalisé, voir le manuel de prise en charge multilingue au moment de la conception.
Langues supportées
- Arabe (ar)
- Danois (da)
- Anglais (en)
- Français (fr)
- Allemand (de)
- Italien (it)
- Japonais (ja)
- Coréen (ko)
- Portugais (pt)
- Espagnol (es)
Remarque : pour obtenir les résultats les plus précis, utilisez la même langue pour les instructions, les données d'entrée et les résultats générés. Si des langues différentes sont utilisées, les mesures d'évaluation sont toujours calculées, mais les résultats risquent d'être moins fiables.
Mesures prises en charge par type de tâche
- Récapitulation
- Score ROUGE
- Similitude cosinus
- Similitude de Jaccard
- Précision normalisée
- Rappel normalisé
- Score normalisé F1
- SARI
- METEOR
- Score HAP
- Détection des IPI
- Génération
- Score ROUGE
- Précision normalisée
- Rappel normalisé
- Score normalisé F1
- METEOR
- Score HAP
- Détection des IPI
- Extraction
- Correspondance exacte
- Score ROUGE
- Réponse aux questions (QA)
- Correspondance exacte
- Score ROUGE
- Score HAP
- Détection des IPI
- Génération améliorée par récupération (RAG)
- Score ROUGE
- Correspondance exacte
- Score HAP
- Détection des IPI
Exécution d'évaluations à partir de l'interface utilisateur
- Créez un projet : Sélectionnez New Asset et créez un nouveau Prompt Template Asset dans le projet, puis sélectionnez Chat et construisez des invites avec des modèles de fondation à l'aide de Prompt Lab.

- Créez et enregistrez votre Asset Prompt Template avec les données dans la langue dans laquelle vous souhaitez évaluer l'invite. Ajoutez vos variables d'entrée et un exemple d'entrée.
- Vous trouverez ci-dessous un exemple d'assurance automobile japonaise avec le modèle de demande de récapitulation de sinistre.


- Enregistrez l' actif de modèle d'invite avec le type de tâche correct.


- Vous pouvez lancer une évaluation en sélectionnant le bouton Évaluer de la page Prompt Lab de la page.

- Sélectionnez la langue pour laquelle vous souhaitez évaluer les mesures, puis cliquez sur Suivant.
- Une fois que vous avez sélectionné une langue, vous ne pouvez plus la modifier. Vous devez créer un nouveau modèle d'invite pour une autre langue.
- Les mesures qui ne sont pas prises en charge ne sont pas disponibles pour l'évaluation dans l'interface utilisateur.


- Téléchargez l'ensemble des données de test dans la langue sélectionnée et sélectionnez le mappage des colonnes. Ensuite, sélectionnez Suivant pour passer à la section Examiner et évaluer où vous pouvez vérifier la langue sélectionnée.
Note : Le champ de la langue peut encore être modifié en retournant à la section Sélectionner les dimensions.

- Cliquez sur Évaluer pour évaluer plus précisément les mesures choisies pour la langue sélectionnée. Vous pouvez également voir la langue sélectionnée dans le résumé du modèle une fois l'évaluation terminée.
