Évaluation de l'IA dans « Instana »

Évaluez la qualité de vos applications d'IA générative (IA gén.) en effectuant des évaluations selon les critères que vous définissez.

Les évaluations de l'IA générative (IA gen) permettent de mesurer la qualité de vos systèmes d'IA. À partir de critères que vous définissez, tels que la précision ou la pertinence, un grand modèle de langage (LLM) agit comme un évaluateur automatisé de votre IA Ces scores vous permettent d'identifier les problèmes, de suivre les améliorations dans le temps et de vérifier que votre IA fonctionne efficacement

La fonctionnalité d'évaluation de l'IA d' Instana offre un cadre permettant d'évaluer et de surveiller la qualité de vos applications d'IA générative à grande échelle. En combinant des évaluateurs prédéfinis, des critères d'évaluation personnalisés, la sélection de traces par filtrage, des contrôles d'échantillonnage et des fonctionnalités d'exploration en profondeur, vous pouvez :

  • Automatiser le contrôle qualité : définissez une seule fois les critères de filtrage et évaluez en continu les nouvelles traces à mesure qu'elles arrivent.
  • Maîtriser les coûts d'évaluation : recourir à l'échantillonnage pour trouver un juste équilibre entre la fiabilité statistique et les frais liés à l'évaluation par les juges LLM.
  • Garantir une qualité constante : surveiller les résultats des LLM de production, tous services, modèles et périodes confondus.
  • Identifier les causes profondes : passer des scores globaux aux traces individuelles et analyser les résultats.
  • Prenez des décisions fondées sur les données : utilisez les résultats détaillés des évaluations pour optimiser les invites, les modèles et les configurations.

Pour vous lancer dans l'évaluation de l'IA :

  1. Dans AI Gateway, configurez et activez une passerelle pour la capacité d'évaluation de l'IA générative.
  2. Créez des évaluateurs afin de sélectionner des indicateurs et de définir les critères permettant de les évaluer. Créez ensuite des définitions d'évaluation qui incluent les traces que vous souhaitez évaluer et précisent les évaluateurs à utiliser.
  3. Vérifiez vos scores pour déterminer si vous devez ajuster vos critères d'évaluation. Les scores sont générés par un modèle d'IA qui évalue les résultats de votre modèle en fonction de vos critères prédéfinis et sont fournis uniquement à titre indicatif.

Qu'est-ce que l'évaluation de l'IA?

L'évaluation de l'IA est une approche systématique visant à évaluer la qualité, la précision et la fiabilité des résultats générés par les modèles LLM. Alors que les entreprises déploient de plus en plus d'applications basées sur des modèles de langage à grande échelle (LLM), il est essentiel de mesurer et de surveiller leurs performances afin de s'assurer qu'elles répondent aux exigences métier et aux normes de qualité.

L'évaluation de l'IA comprend généralement :

  • Évaluation de la qualité : mesure de la précision, de la pertinence et de l'exhaustivité des réponses fournies par le modèle
  • Contrôle de cohérence : garantir la cohérence logique et la clarté des résultats
  • Suivi des performances : suivi des indicateurs d'évaluation pour identifier les problèmes

Comment « Instana » facilite l'évaluation de l'IA

La plateforme d'observabilité de l'IA générative d' Instana fournit un cadre d'évaluation des modèles de langage à grande échelle (LLM). Vous pouvez :

  • Définir des évaluateurs personnalisés : créez des critères d'évaluation adaptés à vos cas d'utilisation spécifiques.
  • Tirez parti des évaluateurs prêts à l'emploi : utilisez dès le départ des indicateurs d'évaluation conformes aux normes du secteur.
  • Sélection dynamique des traces : utilisez des critères de filtrage pour sélectionner automatiquement des cohortes de traces à évaluer.
  • Suivi des résultats : suivez les taux de réussite et d'échec, les notes et les résultats détaillés des évaluations grâce à des fonctionnalités d'exploration approfondie.
  • Évaluation de l'IA générative : utilisez des modèles d'IA avancés pour évaluer objectivement les résultats de vos modèles de langage à grande échelle (LLM).

Le système d'évaluation s'intègre à la collecte de traces de l' Instana. Vous pouvez analyser des données de production réelles, définir des cohortes de traces à l'aide de filtres, maîtriser les coûts d'analyse grâce à l'échantillonnage, et passer des scores agrégés aux traces individuelles pour évaluer les résultats.

Prérequis

Pour utiliser la fonctionnalité d'évaluation d' GenAI, votre environnement doit répondre aux conditions préalables suivantes.

Droits

Pour configurer et exécuter des évaluations, dans la section « Observabilité de l'IA générative », sélectionnez « Créer, configurer, supprimer et exécuter des évaluations d'IA générative (gen AI) ». Lorsque vous cochez cette case, la fonctionnalité d'observabilité d'Access gen AI est automatiquement activée.

Pour plus d'informations sur les autorisations, consultez la section « Gestion des accès des utilisateurs ».

Indicateurs de fonction

La fonctionnalité d'évaluation « GenAI » utilise les indicateurs de fonctionnalité suivants :

  • feature.genai.analytics.enabled
  • feature.ai.gateway.enabled
  • feature.gen.ai.evaluation.enabled

L'indicateur feature.ai.gateway.enabled est activé par défaut. Vous devez activer d'autres indicateurs de fonctionnalité pour pouvoir utiliser les capacités d'évaluation par IA.

Pour configurer les indicateurs de fonctionnalités sur Standard Edition, consultez l'évaluation GenAI.

Pour configurer les indicateurs de fonctionnalité dans l'édition personnalisée, consultez.

Configuration de la passerelle IA

Pour utiliser l'évalu GenAI, vous devez configurer une passerelle IA afin qu'elle prenne en charge la fonctionnalité d'évalu GenAI. Vous pouvez configurer la passerelle à l'aide de vos propres identifiants, sélectionner les modèles que vous souhaitez utiliser et personnaliser la configuration de ces modèles. Pour plus d'informations, consultez la section « Configuration des connexions IA ».

Création d'un évaluateur

Définissez les critères d'évaluation utilisés par Instana pour évaluer les résultats de votre modèle LLM par rapport à vos critères prédéfinis. Vous pouvez utiliser des modèles de métriques d'évaluation comme point de départ ou définir des évaluateurs entièrement personnalisés.

À propos des évaluateurs

Instana propose des modèles de indicateurs d'évaluation pour les critères de qualité courants. Ces modèles sont fournis à titre indicatif uniquement — modifiez-les afin de définir des critères adaptés à vos besoins spécifiques avant de les utiliser en production :

  • Précision : évalue si le résultat répond aux critères de justesse que vous avez définis.
  • Pertinence : évalue si le résultat répond aux critères de pertinence que vous avez définis par rapport à la requête saisie.
  • Exhaustivité : évalue si le résultat répond aux critères que vous avez définis pour traiter intégralement la requête.
  • Cohérence : évalue si le résultat répond aux critères que vous avez définis en matière de cohérence logique.
  • Clarté : évalue si le résultat répond aux critères que vous avez définis en matière de clarté et de compréhensibilité.
Remarque :
Les critères présentés ici sont fournis à titre indicatif uniquement. Il vous incombe exclusivement de définir vos propres critères, adaptés à vos besoins spécifiques, avant de les utiliser en production.

Pour répondre à des besoins spécifiques, vous pouvez créer un évaluateur entièrement personnalisé, avec vos propres critères et un seuil de réussite.

Procédure

  1. Dans l'interface utilisateur d' Instana, sélectionnez « Observabilité d' GenAI ».
  2. Cliquez sur l'onglet « Évaluations ».
  3. Cliquez sur l'onglet « Évaluateurs » pour afficher et créer des évaluateurs.
  4. Pour utiliser un modèle d'indicateur d'évaluation, sélectionnez-le dans la liste et adaptez les critères à vos besoins.
  5. Pour créer un évaluateur personnalisé :
    1. Cliquez sur « Créer un évaluateur ».
    2. Saisissez une valeur dans le champ « Nom ».
    3. Dans le champ « Critères d'évaluation », définissez les critères d'évaluation. Les critères présentés ici ne sont donnés qu'à titre d'exemple. C'est à vous seul que revient la responsabilité de définir vos propres critères.
    4. Dans le champ « Seuil de réussite », définissez un seuil pour la note. Un score est considéré comme réussi s'il est supérieur ou égal au seuil spécifié. Les scores sont générés par un modèle d’IA qui évalue la sortie de votre modèle au regard de vos critères prédéfinis. Les scores sont des indicateurs approximatifs et sont fournis à titre informatif uniquement.
    5. Enregistrer l'évaluateur.

Résultats

Votre évaluateur est désormais disponible parmi les options proposées lorsque vous créez une définition d'évaluation.

Création d'une définition d'évaluation

Créez une définition d'évaluation qui précise le périmètre des traces à évaluer, les évaluateurs à appliquer, ainsi que les détails de l'évaluation, tels que le nom et la description.

À propos de la sélection de traces à l'aide de filtres

Les définitions d'évaluation utilisent des critères de filtrage pour sélectionner de manière dynamique des cohortes de traces. Lors de l'exécution de l'évaluation, le système sélectionne automatiquement les traces correspondantes, ce qui permet :

  • Surveillance continue : définir une seule fois, évaluer à chaque fois que de nouvelles traces arrivent.
  • Analyse de cohortes : évaluer des segments d'utilisateurs spécifiques ou des configurations de modèles.

Avant de commencer

Assurez-vous d'avoir créé au moins un évaluateur. Voir la section « Création d'un évaluateur ».

Procédure

  1. Cliquez sur l'onglet « Évaluations ».
  2. Cliquez sur « Créer une définition d'évaluation ».
  3. À l'étape « Définir la portée », filtrez les traces que vous souhaitez évaluer :
    • Service : Trier par nom de service.
    • Modèle : filtrer par modèle LLM utilisé.
    • Plage horaire : indiquez la plage horaire pour la sélection des traces (par exemple, dernière heure, dernières 24 heures, plage personnalisée).

    Vous pouvez, si vous le souhaitez, définir un pourcentage d'échantillonnage afin de limiter le nombre de courbes analysées. L'échantillonnage est effectué de manière aléatoire sur l'ensemble des traces filtrées, ce qui garantit une couverture représentative tout en maîtrisant les coûts d'évaluation.

  4. À l'étape « Sélectionner les évaluateurs », sélectionnez un ou plusieurs évaluateurs dans la liste. Chaque évaluateur s'exécute de manière indépendante sur les traces échantillonnées.
  5. À l'étape « Définir les détails », saisissez une valeur dans le champ « Nom » et, si vous le souhaitez, saisissez une valeur dans le champ « Description ».
  6. Enregistrez la définition de l'évaluation.

Résultats

Votre définition d'évaluation est enregistrée et prête à être exécutée. À chaque exécution, le système sélectionne automatiquement les traces qui correspondent à vos critères de filtrage et applique l'échantillonnage configuré.

Lancer une évaluation et consulter les résultats

Exécutez une définition d'évaluation enregistrée et utilisez l'onglet « Évaluations » pour suivre l'état d'exécution, consulter les notes et accéder aux résultats détaillés de chaque trace.

Avant de commencer

Assurez-vous d'avoir créé une définition d'évaluation. Voir la section « Création d'une définition d'évaluation ».

Procédure

  1. Cliquez sur l'onglet « Évaluations ».
  2. Recherchez la définition d'évaluation que vous souhaitez exécuter.
  3. Cliquez sur le bouton « Exécuter » dans la colonne « Actions ». Le processus d'évaluation démarre et s'exécute en arrière-plan.
  4. Consultez les résultats de l'exécution directement dans l'onglet « Évaluations ».

Résultats

L'onglet Évaluations affiche un récapitulatif pour chaque exécution terminée ou en cours. Pour chaque évaluateur participant à la session, les informations suivantes sont disponibles :

  • Évaluateur : Nom de l'évaluateur.
  • Note (moyenne) : note moyenne calculée sur l'ensemble des traces évaluées.
  • Seuil : note minimale requise pour réussir une évaluation, exprimée sous la forme d'une valeur telle que ≥ 0.50.
  • Taux de réussite : pourcentage des traces ayant dépassé le seuil.
  • Durée : temps consacré par cet évaluateur.
  • Traces analysées : nombre de traces évaluées par rapport à l'échantillon total.

Analyse approfondie des résultats

Pour examiner les résultats de chaque trace, cliquez sur n'importe quelle ligne d'évaluateur afin d'afficher la liste des traces échantillonnées qui ont été évaluées, ainsi que les notes attribuées à chaque trace, leur statut (réussite/échec) et le raisonnement fourni par le juge IA.

L'exploration en profondeur permet de :

  • Analyse des causes profondes : déterminer pourquoi certaines traces ont échoué.
  • Détection de schémas : identifier les problèmes récurrents dans les traces ayant échoué.
  • Amélioration de la qualité : utiliser les commentaires des juges pour affiner les consignes ou les modèles.
  • Validation : vérifier que les évaluateurs fonctionnent comme prévu.

Meilleures pratiques

Suivez ces recommandations pour concevoir des évaluations efficaces, maîtriser les coûts et garantir la haute qualité des applications d'IA générique.

Commencez par consulter des modèles de indicateurs d'évaluation

Les indicateurs d'évaluation standard (précision, pertinence, exhaustivité, cohérence, clarté) sont fournis à titre d'exemples et ne sont destinés qu'à des fins d'illustration. Modifiez-les en fonction de vos critères spécifiques avant de les utiliser en production. Utilisez-les comme point de départ pour comprendre le cadre d'évaluation avant de créer des évaluateurs personnalisés adaptés à vos besoins.

Concevoir des critères de filtrage efficaces

  • Commencez par un champ d'application large, puis affinez votre recherche : commencez par appliquer des filtres liés au niveau de service, puis ajoutez des contraintes liées au modèle ou à la période.
  • Utilisez des cohortes pertinentes : définissez des filtres qui reflètent des segments d'utilisateurs réels ou des scénarios de déploiement.
  • Combinez les filtres de manière stratégique : utilisez plusieurs critères de filtrage pour isoler des scénarios spécifiques (par exemple, « service de production, modèle d' gpt-4, dernières 24 heures »).

Optimiser l'échantillonnage en fonction du coût et du niveau de confiance

  • Scénarios à fort volume : utilisez un échantillonnage de 10 à 25 % pour les services générant des milliers de traces par jour.
  • Scénarios à volume moyen : utilisez un échantillonnage à 50 % pour les volumes de traces modérés.
  • Scénarios à faible volume ou critiques : utilisez un échantillonnage à 100 % lorsque le nombre de traces est faible ou que la qualité est essentielle à la mission.
  • Suivi et ajustement : examiner les coûts d'évaluation et ajuster les taux d'échantillonnage en fonction du budget et des exigences en matière de niveau de confiance.
  • Validité statistique : veillez à ce que la taille de l'échantillon soit suffisamment importante pour obtenir des résultats significatifs.

Définir des seuils appropriés

  • Commencez par des seuils modérés (par exemple, 0.5 ) et ajustez-les en fonction des résultats.
  • Selon les cas d'utilisation, les seuils peuvent varier.
  • Suivez les taux de réussite et adaptez les seuils en fonction de vos normes de qualité.

Réunir les évaluateurs pour une évaluation exhaustive

Vous pouvez sélectionner plusieurs évaluateurs pour une même évaluation afin d'évaluer simultanément différents aspects de la qualité. Chaque évaluateur fonctionne de manière indépendante et attribue sa propre note ainsi qu’un résultat « admis » ou « refusé ». Par exemple :

  • Précision et exhaustivité des systèmes de questions-réponses factuels
  • Pertinence et clarté pour les chatbots d'assistance client
  • Les cinq modèles de indicateurs d'évaluation (adaptés à vos critères) pour les systèmes de production critiques

Utiliser les fonctionnalités d'exploration

  • Analyser les échecs : lorsque les taux de réussite baissent, examinez en détail chaque trace pour identifier les causes profondes.
  • Vérification du bon fonctionnement des évaluateurs : examiner les résultats des évaluations afin de s'assurer que les évaluateurs fonctionnent comme prévu.
  • Itérer sur les prompts : utilisez les retours d'évaluation pour affiner vos prompts destinés aux modèles de langage de grande envergure (LLM) et en améliorer la qualité.

Activer la surveillance en continu

  • Définir des évaluations réutilisables : créer des définitions d'évaluation avec des filtres qui capturent automatiquement les nouvelles traces.
  • Planifiez des exécutions régulières : effectuez périodiquement des évaluations afin de suivre l'évolution de la qualité au fil du temps.

Directives à l'intention des évaluateurs personnalisés

Lorsque vous créez des évaluateurs personnalisés :

  • Rédigez des critères d'évaluation clairs et précis.
  • Suivez les instructions figurant dans la description de l'évaluateur.
  • Testez le système avec des données d'exemple avant de l'utiliser en production.
  • Décrivez l'objectif et le comportement attendu.

Dépannage de l'évaluation de l'IA

Diagnostiquer et résoudre les problèmes courants liés aux exécutions d'évaluation de l'IA, à la sélection des traces et à la navigation par exploration en profondeur.

Le cycle d'évaluation ne démarre pas

  • Vérifiez la configuration de la passerelle AI : assurez-vous que les identifiants d' watsonx t valides et que la passerelle est activée.
  • Vérifier les critères de filtrage : s'assurer que les filtres sont correctement configurés et qu'ils correspondent aux traces existantes.
  • Vérifier la sélection des évaluateurs : les évaluations nécessitent la sélection d'au moins un évaluateur.
  • Vérifier la plage horaire : assurez-vous que la plage horaire contient des traces correspondant à vos critères de filtrage.

Aucune trace ne correspond aux critères de filtrage

  • Élargir les filtres : supprimer certaines contraintes de filtrage afin de capturer davantage de traces.
  • Vérifier les noms des services : assurez-vous que les noms des services correspondent exactement (en tenant compte de la casse).
  • Vérifier la plage horaire : élargissez la plage horaire pour inclure davantage de courbes.

Faibles taux de réussite

  • Vérifiez les paramètres de seuil : il se peut que le seuil soit trop élevé pour votre cas d'utilisation.
  • Analyser en détail les traces présentant des anomalies : cliquez sur chaque trace pour comprendre les causes des anomalies.
  • Examiner les résultats de l'évaluation : passer en revue le raisonnement fourni par le modèle d'évaluation de l'IA.
  • Vérifier les critères d'évaluation : assurez-vous que ces critères correspondent bien à vos besoins réels.
  • Vérifiez s'il existe des problèmes liés à la qualité des données : les traces ayant échoué peuvent indiquer des problèmes au niveau des invites de saisie ou des réponses du modèle.

Exécutions d'évaluation lentes

  • Réduire le pourcentage d'échantillonnage : un pourcentage d'échantillonnage plus faible réduit le nombre de traces évaluées.
  • Réduire le nombre d'évaluateurs : faire appel à moins d'évaluateurs pour accélérer le processus d'évaluation.
  • Fenêtre temporelle réduite : évaluez des périodes plus courtes afin de réduire le volume des traces.
  • Optimiser les filtres : utilisez des filtres plus précis pour réduire l'ensemble des traces correspondantes.

Coûts d'évaluation élevés

  • Réduire le pourcentage d'échantillonnage : diminuez le taux d'échantillonnage afin d'évaluer moins de traces.
  • Affiner les critères de filtrage : utilisez des filtres plus précis pour réduire la taille de la cohorte de traces.
  • Réduire le nombre d'évaluateurs : utiliser moins d'évaluateurs par évaluation.
  • Optimiser les créneaux horaires : envisager des périodes plus courtes ou une fréquence moindre.

Résultats manquants ou exploration incomplète

  • Attendez la fin du processus : les évaluations s'exécutent de manière asynchrone; vérifiez leur état avant d'approfondir votre analyse.
  • Vérifier les messages d'erreur : vérifiez si l'exécution a généré des erreurs.
  • Vérifier la persistance des traces : s'assurer que les traces sont toujours disponibles dans le système (qu'elles n'ont pas été supprimées).
  • Vérifiez vos droits d'accès : assurez-vous que vous disposez des droits nécessaires pour consulter les détails de la trace.

Limitation de responsabilité

Remarque :
Les scores sont générés par un modèle d’IA qui évalue la sortie de votre modèle au regard de vos critères prédéfinis. Les scores sont des indicateurs approximatifs et sont fournis à titre informatif uniquement. Les critères présentés ici ne sont donnés qu'à titre d'exemple. Il vous incombe exclusivement de définir vos propres critères afin de vous assurer que les notes reflètent bien vos exigences spécifiques.