Évaluation de l'IA dans « Instana »

Évaluez et surveillez la qualité des résultats générés par votre modèle LLM grâce à des fonctionnalités d'évaluation complètes.

Qu'est-ce que l'évaluation de l'IA?

L'évaluation de l'IA est une approche systématique visant à évaluer la qualité, la précision et la fiabilité des résultats générés par les modèles d'IA. À mesure que les entreprises déploient de plus en plus d'applications basées sur des modèles de langage de grande envergure (LLM), il devient essentiel de mesurer et de surveiller leurs performances afin de s'assurer qu'elles répondent aux exigences opérationnelles et aux normes de qualité.

L'évaluation de l'IA comprend généralement :

  • Évaluation de la qualité : mesure de la précision, de la pertinence et de l'exhaustivité des réponses du modèle
  • Contrôle de cohérence : garantir la cohérence logique et la clarté des résultats
  • Suivi des performances : suivi des indicateurs d'évaluation pour identifier les problèmes

Comment l' Instana e facilite l'évaluation de l'IA

La plateforme d'observabilité « GenAI » de Instana offre un cadre complet d'évaluation de l'IA qui vous permet de :

  1. Définir des évaluateurs personnalisés : créez des critères d'évaluation adaptés à vos cas d'utilisation spécifiques
  2. Tirez parti des évaluateurs prêts à l'emploi : utilisez des indicateurs d'évaluation conformes aux normes du secteur, prêts à l'emploi
  3. Suivi des résultats : suivi des taux de réussite/d'échec, des notes et des résultats détaillés de l'évaluation
  4. Évaluation de l'IA générative : utilisez des modèles d'IA avancés pour évaluer objectivement les résultats de vos modèles de langage à grande échelle (LLM)

Le système d'évaluation s'intègre parfaitement à la collecte de traces d' Instana, ce qui vous permet d'analyser des données de production réelles et d'obtenir des informations sur les performances de votre application GenAI.

Prérequis

Avant d'utiliser les fonctionnalités d'évaluation par IA, procédez à la configuration suivante :

Activer la passerelle IA dotée de la fonctionnalité d'évaluation de l'IA générative : la fonctionnalité d'évaluation nécessite une passerelle IA configurée avec la fonctionnalité « LLM-as-a-judge ». Cette passerelle utilise les modèles d'IA d' WatsonX pour effectuer des évaluations automatisées.

Identifiants WatsonX requis :

  • Référence du projet : votre identifiant de projet « WatsonX »
  • API clé : Clé d'authentification pour l'accès à WatsonX API
  • URL : WatsonX point de terminaison du service URL

Modèles disponibles :

Instana prend en charge trois modèles d'IA à des fins d'évaluation :

  • openai/gpt-oss-120b (par défaut)
  • Options de modèles supplémentaires disponibles dans la configuration de l'AI Gateway

Configurer la passerelle IA

  1. Dans l'interface utilisateur d' Instana, accédez à AI Gateway.
  2. Sélectionnez « LLM Gateways ».
  3. Créer une nouvelle passerelle ou modifier une passerelle existante
  4. Entrez vos identifiants pour WatsonX :
    • ID de projet
    • Clé d'API
    • URL
  5. Sélectionnez la fonctionnalité : Évaluation de l' GenAI.
  6. Choisissez votre modèle d'IA préféré (ou utilisez celui par défaut)
  7. Enregistrez la configuration.
  8. Activez la passerelle en basculant le commutateur d'activation

Une fois la passerelle activée, elle peut être utilisée dans le cadre d'évaluations. Le bouton de lecture permettant de lancer les évaluations n'est activé que lorsque la passerelle est activée.

Premiers pas avec l'évaluation de l'IA

Accéder à l'interface d'évaluation

  1. Ouvrez l'interface utilisateur d' Instana
  2. Sélectionnez « Observabilité d' GenAI » dans la barre latérale
  3. Cliquez sur l'onglet « Évaluations » dans la barre de navigation

Une bannière s'affiche, présentant un aperçu de la fonctionnalité d'évaluations ainsi qu'un guide de configuration en trois étapes.

Comprendre le système de navigation à trois onglets

La page des évaluations est structurée en trois onglets principaux :

1. Cycles d'évaluation (onglet par défaut)

Il s'agit de votre tableau de bord principal de suivi, où vous pouvez consulter les résultats des évaluations terminées et en cours. À chaque exécution, le programme affiche :

  • Historique des exécutions avec horodatage et durée
  • État général de l'exécution (terminée, échouée ou en cours)
  • Indicateurs récapitulatifs, notamment les taux de réussite et d'échec ainsi que les notes moyennes
  • Répartition par évaluateur indiquant les résultats pour chaque critère d'évaluation

2. Définitions relatives à l'évaluation

C'est ici que vous configurez ce qu'il faut évaluer et comment. Une définition d'évaluation précise :

  • Quelles traces évaluer (sélectionnées par plage horaire)
  • Quels évaluateurs choisir (un seul ou plusieurs)
  • Nom et description de l'évaluation pour faciliter son identification
  • Une fois créées, exécutez les définitions à plusieurs reprises d'un simple clic sur le bouton de lecture

3. Évaluateurs

Cet onglet permet de gérer les critères et la logique d'évaluation. Vous pouvez :

  • Utilisez des évaluateurs prêts à l'emploi pour les indicateurs de qualité courants : précision, pertinence, exhaustivité, cohérence logique et clarté
  • Créez des évaluateurs personnalisés avec vos propres critères d'évaluation et seuils de notation
  • Définissez ce qui constitue une « réussite » ou un « échec » pour chaque évaluateur
  • Les évaluateurs peuvent être réutilisés dans plusieurs définitions d'évaluation

Principales fonctionnalités et déroulement des opérations

Créer des évaluateurs

Commencez par définir les critères d'évaluation utilisés pour évaluer les résultats de votre modèle LLM.

Étape 1 : Accédez à l'onglet « Évaluateurs »

Cliquez sur l'onglet « Évaluateurs » pour afficher et créer des évaluateurs.

Étape 2 : Choisissez le type d'évaluateur

Évaluateurs prêts à l'emploi :

Instana propose cinq évaluateurs prêts à l'emploi :

  • Précision : évalue la conformité du résultat obtenu par rapport aux résultats attendus
  • Pertinence : évalue dans quelle mesure le résultat correspond à la requête saisie
  • Exhaustivité : évalue si le résultat répond pleinement à la requête
  • Cohérence logique : vérification de la cohérence logique de la réponse
  • Clarté : évalue le degré de clarté et de compréhensibilité du résultat

Évaluateur personnalisé :

Pour répondre à des besoins d'évaluation spécifiques, créez un évaluateur personnalisé :

  1. Sélectionnez l'option « Personnalisé »
  2. Indiquez les informations suivantes :
    • Nom : un nom évocateur pour votre évaluateur
    • Critères d'évaluation : Définissez votre propre logique d'évaluation
      • Utilisez l'espace réservé fourni comme référence
      • Définissez des critères clairs et précis décrivant ce qui constitue un bon résultat
    • Seuil : définir la note minimale (0-1) requise pour réussir l'évaluation
      • Les notes supérieures ou égales à ce seuil sont considérées comme « réussies »
      • Les notes ci-dessous sont considérées comme « insuffisantes »
  3. Enregistrer l'évaluateur

Votre évaluateur personnalisé est désormais disponible pour être utilisé dans les définitions d'évaluation.

Définir les évaluations

Créez des définitions d'évaluation qui précisent les traces à évaluer et les évaluateurs à utiliser.

Étape 1 : Accédez à l'onglet « Définitions d'évaluation »

Cliquez sur l'onglet « Définitions d'évaluation ».

Étape 2 : Créer une nouvelle définition d'évaluation

  1. Cliquez sur « Créer une définition »
  2. Sélectionnez les traces à analyser :
    • Utilisez le sélecteur de trace de l'interface utilisateur
    • Appliquer une plage de temps (par exemple, dernières 24 heures, derniers 7 jours, plage personnalisée) pour affiner la recherche des traces
    • Prévisualisez les tracés sélectionnés avant de continuer
  3. Sélectionner les évaluateurs :
    • Sélectionnez un évaluateur dans la liste des évaluateurs disponibles créée dans l'onglet « Évaluateurs »
    • Sélectionnez un ou plusieurs évaluateurs en fonction de vos besoins en matière d'évaluation
    • Chaque évaluateur s'exécute de manière indépendante sur les traces sélectionnées
  4. Veuillez fournir les détails de l'évaluation :
    • Nom : Donnez un nom explicite à votre évaluation
    • Description : Expliquez l'objectif et la portée de cette évaluation (facultatif)
  5. Enregistrer la définition de l'évaluation

Votre évaluation est désormais prête à être exécutée.

Étape 3 : Exécuter et consulter les résultats de l'évaluation

Suivez et analysez les résultats de vos cycles d'évaluation.

Effectuer une évaluation

  1. Dans l'onglet « Définitions des évaluations », consultez la liste des évaluations disponibles
  2. Cliquez sur le bouton « Lecture » situé sous la colonne « Actions » pour lancer l'évaluation
  3. Le processus d'évaluation démarre et s'exécute en arrière-plan

Affichage des résultats dans l'onglet « Cycles d'évaluation »

Accédez à l'onglet « Exécutions d'évaluation » (vue par défaut) pour voir :

Résumé du niveau d'exécution :

  • Heure de début de l'exécution : moment où l'évaluation a commencé
  • Nom de l'évaluation : nom de la définition de l'évaluation
  • Évaluateurs : liste des évaluateurs utilisés lors de cette exécution
  • Nombre de traces : nombre total de traces évaluées
  • Durée : temps nécessaire pour mener à bien l'évaluation
  • État de l'exécution : COMPLETED (tous les évaluateurs ont terminé avec succès), FAILED (au moins un évaluateur a échoué) ou IN-PROGRESS (les évaluateurs sont toujours en cours d'exécution)

Détails au niveau de l'évaluateur :

Pour chaque évaluateur de la série, voir :

  • Nom de l'évaluateur : nom de l'indicateur (identique au nom de l'évaluateur)
  • Note : note moyenne de l'ensemble des traces évaluées
  • Taux de réussite : pourcentage des traces ayant franchi le seuil
  • Durée : temps consacré par cet évaluateur
  • Nombre de traces réussies/échouées : nombre de traces qui ont réussi par rapport à celles qui ont échoué
  • Statut : PENDING, IN-PROGRESS, COMPLETED, INCOMPLETE, PASSED, FAILED, ou UNDEFINED

Meilleures pratiques

1. Commencez par utiliser des évaluateurs prêts à l'emploi

Commencez par les critères d'évaluation standard (précision, pertinence, exhaustivité, cohérence logique, clarté) afin d'établir des indicateurs de référence avant de créer des critères d'évaluation personnalisés.

2. Définir des seuils appropriés

  • Commencez par des seuils modérés (par exemple, 0.5 ) et adapter en fonction des résultats
  • Selon les cas d'utilisation, des seuils différents peuvent être nécessaires
  • Suivez les taux de réussite et adaptez les seuils en fonction de vos normes de qualité

3. Regrouper les évaluateurs pour une évaluation exhaustive

Vous pouvez sélectionner plusieurs évaluateurs pour une même évaluation afin d'analyser simultanément différents aspects de la qualité. Chaque évaluateur fonctionne de manière indépendante et attribue sa propre note ainsi qu'un résultat « admis » ou « refusé ». Par exemple :

  • Exactitude et exhaustivité des systèmes de questions-réponses factuels
  • Pertinence et clarté pour les chatbots d'assistance client
  • Les cinq évaluateurs prêts à l'emploi destinés aux systèmes de production critiques

4. Évaluer des échantillons représentatifs

  • Sélectionnez les traces qui reflètent les interactions typiques des utilisateurs
  • Utilisez des filtres temporels pour analyser les données de production récentes

5. Directives pour les évaluateurs personnalisées

Lors de la création d'évaluateurs personnalisés :

  • Rédigez des critères d'évaluation clairs et précis
  • Suivez le texte de remplacement figurant dans la description de l'évaluateur
  • Testez avec des données d'exemple avant la mise en production
  • Décrivez l'objectif et le comportement attendu

Traitement des incidents

L'exécution de l'évaluation ne démarre pas

  • Vérifiez la configuration de la passerelle AI : assurez-vous que les identifiants d' WatsonX s sont valides et que la passerelle est activée
  • Vérifier la sélection des traces et des évaluateurs : les évaluations ne peuvent être créées que si des traces et des évaluateurs sont sélectionnés

Faibles taux de réussite

  • Vérifiez les paramètres de seuil : le seuil est peut-être trop élevé pour votre cas d'utilisation
  • Analyser les traces ayant échoué : rechercher des tendances expliquant pourquoi les traces échouent
  • Vérifier la pertinence des critères d'évaluation : assurez-vous que ces critères correspondent bien à vos besoins réels

Exécutions d'évaluation lentes

  • Réduire le nombre d'échantillons : analyser des lots plus petits pour obtenir des résultats plus rapides
  • Réduire le nombre d'évaluateurs : recourir à moins d'évaluateurs pour accélérer le processus d'évaluation

Résultats manquants

  • Attendre la fin du processus : les évaluations s'exécutent de manière asynchrone; vérifier l'état
  • Vérifier les messages d'erreur : consultez le champ « Erreurs » dans la réponse relative à l'état d'exécution

Récapitulatif

La fonctionnalité d'évaluation de l'IA de Instana offre un cadre performant pour évaluer et surveiller la qualité de vos applications d'IA générative. En combinant des évaluateurs prédéfinis, des critères d'évaluation personnalisés et des fonctionnalités d'évaluation automatisée de l'IA générative, vous pouvez :

  • Garantir une qualité constante des résultats générés par les modèles LLM
  • Identifier et traiter les problèmes de qualité de manière proactive
  • Prendre des décisions fondées sur les données concernant le choix et la configuration des modèles

Commencez par configurer votre passerelle IA, en créant des évaluateurs qui répondent à vos normes de qualité, en définissant des évaluations pour vos traces critiques et en surveillant les résultats afin de garantir la qualité de vos applications d'IA générative.