Évaluer les modèles d'IA
Vous pouvez suivre et évaluer les résultats de vos ressources d'IA afin de vous assurer qu'elles sont conformes aux processus métier, quel que soit l'endroit où vos modèles sont développés ou exécutés.
Vous pouvez utiliser les évaluations de modèles dans le cadre de vos stratégies de gouvernance de l'IA pour vous assurer que les modèles déployés dans les environnements répondent aux normes de conformité établies, quels que soient les outils et les cadres utilisés pour construire et exécuter les modèles. Cette approche garantit que les modèles sont exempts de biais, qu'ils peuvent être facilement expliqués et compris par les utilisateurs métier et qu'ils sont auditables dans les transactions commerciales.
Service Le service d' Watson OpenScale s n'est pas disponible par défaut. Un administrateur doit installer le service. Pour savoir si le service est installé, ouvrez le catalogue Services. Si le service est installé et prêt à l'emploi, la vignette du catalogue indique Prêt à l'emploi.
Watsonx.governance, vous pouvez évaluer les ressources d'IA générative et les modèles d'apprentissage automatique pour obtenir des informations sur les performances des modèles tout au long du cycle de vie de l'IA.
Vous pouvez exécuter les types d'évaluations suivants avec watsonx.governance:
- Qualité Évalue la capacité de votre modèle à prédire correctement les résultats qui correspondent aux données de test étiquetées.
- Équité Évalue si votre modèle produit des résultats biaisés qui favorisent un groupe par rapport à un autre. Évalue l'évolution de la précision et de la cohérence des données de votre modèle en comparant les transactions récentes à vos données d'entraînement.
- Drift v2 Évalue les changements dans les résultats de votre modèle, la précision de vos prévisions et la distribution de vos données d'entrée.
- Santé du modèle Évalue l'efficacité avec laquelle votre modèle traite vos transactions.
- Qualité de l'IA générative Évalue la capacité de votre modèle de base à accomplir des tâches
Lorsque vous activez les évaluations, vous pouvez choisir de les exécuter en continu aux intervalles planifiés par défaut suivants :
| Évaluation | Calendrier par défaut de l'abonnement en ligne | Programme par défaut de l'abonnement par lots |
|---|---|---|
| Qualité | 1 heure | 1 semaine |
| Equité | 1 heure | 1 semaine |
| Drift v2 | 1 journée | ND |
| Modèle de santé | 1 heure | ND |
| Qualité IA générative | 1 heure | ND |
Les évaluations de modèles de santé sont activées par défaut lorsque vous fournissez des données de charge utile pour évaluer les ressources d'IA générative et les modèles d'apprentissage automatique.
Évaluation des actifs d'IA générative
Vous pouvez évaluer les ressources d'IA générative pour mesurer la qualité de l'exécution des tâches suivantes par votre modèle :
- Classification de texte
- Catégoriser le texte en classes ou en étiquettes prédéfinies.
- Synthèse de texte
- Résumez le texte de manière précise et concise.
- Génération de contenu
- Produire des textes pertinents et cohérents ou d'autres formes de contenu basés sur vos contributions.
- Réponse aux questions
- Fournir des réponses précises et pertinentes à vos questions.
- Extraction d'entités
- Identifier et classer par catégories des segments d'information spécifiques dans un texte.
- Génération augmentée par récupération
- Récupérez et intégrez des connaissances externes dans les résultats de votre modèle.
Le type d'évaluation que vous pouvez exécuter est déterminé par le type de tâche que vous souhaitez que votre modèle effectue. Les évaluations de l'IA générative calculent des mesures qui fournissent des informations sur les performances de votre modèle pour ces tâches. Les évaluations d'équité et de qualité ne peuvent mesurer les performances que pour les tâches de classification de texte. Les évaluations de la qualité de l' v2 e de dérive et de l'IA générative permettent de mesurer les performances pour tout type de tâche.
Vous pouvez évaluer les ressources de modèles instantanés pour mesurer les performances des modèles créés par IBM ou évaluer les modèles instantanés détachés pour les modèles qui ne sont pas créés ou hébergés par IBM. Vous pouvez exécuter ces évaluations dans des projets et des espaces de déploiement afin d'obtenir des informations sur les ressources individuelles au sein de votre environnement de développement.
Pour exécuter des évaluations, vous devez gérer les données des évaluations de modèle en fournissant des données de test qui contiennent des colonnes de référence incluant l'entrée et la sortie attendue du modèle pour chaque actif. Le type de données de test que vous fournissez peut déterminer le type d'évaluation que vous pouvez exécuter. Vous pouvez fournir des commentaires ou des données de charge utile pour permettre des évaluations des actifs d'IA générative. Pour effectuer des évaluations de la qualité, vous devez fournir des données de retour d'information afin de mesurer les performances des tâches de classification de texte. Les évaluations d'équité et de dérive d' v2 s utilisent les données de charge utile pour mesurer les performances de votre modèle. Les évaluations de qualité de l'IA générative utilisent des données de retour d'information pour mesurer les performances des tâches d'extraction d'entités.
Les évaluations de qualité de l'IA générative peuvent utiliser les données de charge utile et de retour d'information pour calculer des mesures pour les types de tâches suivants :
- Résumé de texte
- Génération de contenu
- Réponse aux questions
- Génération augmentée par récupération
Les données de charge utile sont nécessaires pour les tâches de génération augmentée par récupération.
Évaluer les modèles d'apprentissage automatique
Vous pouvez évaluer les modèles d'apprentissage automatique pour mesurer leur capacité à prédire les résultats. Watsonx.governance prend en charge les évaluations pour le type suivant de modèles d'apprentissage automatique :
- Modèles de classification
Prédire des résultats catégoriels en fonction de vos caractéristiques d'entrée
- Classification binaire : prédire l'un des deux résultats possibles
- Classification multiclasses : prédire l'une des issues possibles
- modèles de régression
Prévoir des résultats numériques continus
watsonx.governance, vous permet d'évaluer des modèles d'apprentissage automatique dans des espaces de déploiement. Pour exécuter des évaluations, vous devez vous préparer à évaluer des modèles en fournissant des détails sur vos données d'apprentissage et les résultats du modèle.
Vous devez également gérer les données pour les évaluations de modèles afin de déterminer le type d'évaluation que vous pouvez exécuter pour générer des informations métriques. Pour effectuer des évaluations de la qualité, vous devez fournir des données de rétroaction qui contiennent la même structure et les mêmes colonnes de prédiction que vos données d'apprentissage avec le résultat connu du modèle. Pour effectuer des évaluations v2 d'équité et de dérive, vous devez fournir des données de charge utile qui correspondent à la structure des données d'entraînement.
Watsonx.governance enregistre ces types de données pour calculer les métriques de vos résultats d'évaluation. Vous devez envoyer des transactions types pour générer des résultats précis en continu.
Vous pouvez également créer des évaluations et des mesures personnalisées pour générer une plus grande variété d'informations sur les performances de votre modèle. Pour obtenir des informations sur la façon dont votre modèle prédit les résultats, vous pouvez configurer l'explicabilité.