Surveillance des LLM

Vous pouvez surveiller les métriques et les traces LLM dans l'interface utilisateur d' Instana.

Métriques LLM

Pour consulter les métriques LLM, cliquez sur « GenAI Observability > LLM metrics ».

Les indicateurs du LLM, ainsi que leur coût, leur latence et d'autres détails relatifs aux performances, s'affichent dans l'onglet « Indicateurs du LLM ».

Paramètre Description
Coût des intrants Le coût lié à l'envoi de jetons d'entrée, c'est-à-dire la requête ou la question adressée aux modèles d'apprentissage profond (LLM).
Coût de production Le coût engendré par les jetons générés par les LLM en réponse à l'entrée.
Coût total Coût total des jetons générés par les LLM en réponse à l'entrée. Le coût est la somme du coût des intrants et du coût des extrants.
Modèles Le nombre de modèles LLM utilisés au cours de la période considérée. Cette valeur reflète la diversité des modèles linguistiques utilisés.
Services GenAI Le nombre de fournisseurs de services d'IA générative ou de points de terminaison utilisés. Chaque modèle peut être hébergé par un service différent, ce qui reflète les variations potentielles en termes de performances et de prix.
Appels LLM (total) Le nombre de fois où les grands modèles de langage (LLM) ont été sollicités, c'est-à-dire le nombre d'interactions de type « invite-réponse » qui ont eu lieu. Cet indicateur montre le niveau d'activité global des modèles.
Utilisation des jetons Utilisation du jeton au fil du temps. Vous pouvez filtrer l'utilisation par modèle LLM ou par service afin de comprendre les habitudes de consommation individuelles ou collectives.
Coût Évolution des coûts au fil du temps pour les modèles LLM. Vous pouvez filtrer les données d'utilisation par modèle LLM ou par service afin d'analyser la rentabilité.
Appels LLM Le nombre d'appels LLM au fil du temps. Vous pouvez consulter la fréquence des invocations de modèles par modèle LLM ou service afin d'identifier les périodes d'utilisation maximale.
Latence LLM La latence des appels LLM au fil du temps. Cet indicateur mesure le temps de réponse de chaque modèle, indiquant ainsi la rapidité avec laquelle les modèles génèrent des résultats.
Nom du modèle Le modèle LLM utilisé.
Jetons d'entrée Le nombre de jetons dans les invites ou les requêtes envoyées au LLM.
Jetons de sortie Le nombre de jetons générés par le LLM en tant que réponses.
Nombre total de jetons La somme des jetons d'entrée et des jetons de sortie, représentant le nombre total de jetons pour chaque interaction.
Coût total Dépenses totales pour les jetons générés par les LLM.
Temps de latence (moyenne) Temps de réponse moyen du LLM pour tous les appels.
Nombre d'appels Le nombre total de fois où le LLM a été appelé ou invoqué.

Traces LLM

Pour afficher les traces LLM, cliquez sur « Observabilité de l'IA générative » > « Traces ».

Les traces du modèle LLM, y compris les invites d'entrée et les réponses générées, s'affichent dans l'onglet « Traces ».

Paramètre Description
ID de la trace Un identifiant unique attribué à chaque trace ou interaction avec le système d'IA générative. Cela s'avère utile pour suivre et déboguer des requêtes spécifiques.
Service d'IA générative Le service d'IA générative utilisé pour traiter la requête.
Invite de saisie La question ou la commande soumise au modèle d'IA.
Réponse de la sortie La réponse générée par le modèle d'IA en réponse à la requête saisie.
Nombre total de jetons Nombre total de jetons utilisés dans l'interaction, y compris les entrées et les sorties.
Durée Le temps nécessaire au modèle d'IA pour générer la réponse, mesuré en millisecondes. Cette valeur permet d'évaluer les performances et la latence.
Statut Indique si l'interaction a été réussie. Une coche verte indique que la réponse a été générée avec succès, sans erreur.

Vue des tâches LLM dans les détails de la trace

Lorsque vous consultez une trace contenant des appels LLM, vous pouvez accéder à des informations détaillées sur les interactions LLM via la vue « Tâches LLM ». Cette vue offre un aperçu complet des opérations d'IA générative au sein des traces de votre application.

Accéder à la vue « Tâches LLM »

Pour accéder à la vue « Tâches LLM » :

  1. Accédez à GenAI observability > Traces.
  2. Cliquez sur une trace contenant des appels LLM.
  3. Dans la vue des détails de la trace, repérez un intervalle d'appel LLM et cliquez dessus. La vue des tâches du LLM affiche des informations détaillées sur l'interaction LLM sélectionnée.
    Remarque :
    Une trace récemment enregistrée apparaît sur la page « Traces », mais la vue des tâches du LLM peut mettre jusqu'à une minute après cela pour générer et afficher les données.

Informations sur la vue des tâches LLM

La vue « Tâches LLM » fournit les informations suivantes :

Tableau 1. Paramètres de la vue des tâches LLM
Paramètre Description
Nom du modèle Le modèle LLM spécifique utilisé pour l'interaction, par exemple, gpt-4 ou claude-3-opus.
Invite de saisie La requête complète envoyée au modèle de langage de grande capacité (LLM), y compris les messages système et le contexte.
Réponse de la sortie La réponse complète générée par le modèle de langage (LLM).
Jetons d'entrée Le nombre de caractères dans la ligne de commande.
Jetons de sortie Le nombre de jetons dans la réponse générée.
Nombre total de jetons La somme des jetons d'entrée et de sortie.
Coût des intrants Le coût lié au traitement des jetons d'entrée.
Coût de production Le coût lié à la génération des jetons de sortie.
Coût total Le coût total de l'interaction avec le LLM, qui correspond à la somme des coûts d'entrée et de sortie.
Durée Le temps nécessaire au LLM pour traiter la requête et générer la réponse.
Température La température d'échantillonnage utilisée pour l'appel du LLM, qui contrôle le caractère aléatoire de la sortie.
Nombre maximal de jetons Le nombre maximal de jetons autorisés dans la réponse.
Top P Le paramètre d'échantillonnage du noyau utilisé pour contrôler la diversité de sortie.
Pénalité de fréquence La pénalité appliquée pour réduire la répétition des jetons dans la sortie.
Pénalité de présence La pénalité a été appliquée pour inciter le modèle à aborder de nouveaux sujets.
Figure 1. Vue des tâches LLM dans l' Instana
Vue des tâches LLM

Avantages de la vue « Tâches » de LLM

La vue « Tâches » de LLM vous aide à :

  • Déboguez les interactions avec les modèles de langage (LLM) en examinant les invites et les réponses exactes afin d'identifier les problèmes ou les comportements inattendus.
  • Optimisez les coûts en analysant l'utilisation des jetons et les coûts associés à chaque appel au modèle de langage (LLM) afin d'identifier les possibilités d'optimisation.
  • Surveillez les performances en suivant la latence et les temps de réponse des opérations LLM au sein des traces de votre application.
  • Comprenez le comportement du modèle en examinant les paramètres utilisés pour chaque appel au LLM afin de comprendre comment ils influencent le résultat.
  • Consultez les interactions LLM dans le contexte de la trace complète de l'application, y compris les appels en amont et en aval.

Aperçu du parcours LLM

Utilisez la vue « Trajectoire » pour examiner chaque étape d'un appel d'agent ou de LLM. Lorsque vous ouvrez une trace contenant des appels d'agent ou de LLM, vous pouvez accéder à la vue « Trajectoire » pour examiner la trace d'exécution complète, qui inclut chaque invite, chaque appel d'outil et chaque réponse du modèle.

La vue présente chaque tâche d'agent sous la forme d'une entrée numérotée. Vous pouvez utiliser la liste avec fonction de recherche pour accéder à n'importe quelle tâche, et le panneau de détails de la tâche pour consulter l'ensemble du contexte de cette tâche.

Accéder à la vue du parcours LLM

Pour accéder à la vue « Trajectoire », procédez comme suit :

  1. Dans le menu de navigation de l'interface utilisateur d' Instana, sélectionnez « GenAI observability > Traces ».
  2. Cliquez sur une trace contenant des appels LLM.
  3. Dans la barre de navigation, cliquez sur l'onglet « Trajectoire ». L'affichage passe de la vue « Hiérarchie des tâches » à la vue « Trajectoire ».

Une trace récemment enregistrée s'affiche. Toutefois, la vue « Trajectoire » peut mettre jusqu’à une minute pour générer et afficher les données correspondantes. {: note}

Afficher les informations sur le parcours LLM

La vue « Parcours LLM » fournit les informations suivantes :

Tableau 2. Paramètres d'affichage de la trajectoire LLM
Paramètre Description
Nom de la tâche Nom de la tâche de l'agent qui contient l'étape d'annotation.
Nom de la sous-tâche Nom de l'appel partiel LLM spécifique au sein de l'étape d'annotation.
Heure de début La date et l'heure de lancement de l'appel à projets partiel LLM.
Heure de fin La date et l'heure de clôture de l'appel à candidatures partiel pour le LLM.
Durée Durée totale d'exécution de l'appel secondaire du LLM, en millisecondes.
Jetons d'entrée Nombre de tokens contenus dans la requête d'entrée que le modèle reçoit pour cet appel partiel du LLM.
Jetons de sortie Le nombre de tokens contenus dans la réponse générée par le modèle pour cet appel partiel du LLM.
Nombre total de jetons Le total cumulé des jetons d'entrée et de sortie pour le sous-appel LLM.
Message utilisateur La requête que l'utilisateur envoie au modèle de langage de grande capacité (LLM). La vue affiche ce contenu sous forme de texte brut, au format « JSON » ou au format Markdown, selon le type de contenu.
Réponse de l'assistant La réponse complète générée par le modèle pour cet appel partiel du LLM.
Nom de l'appel d'outil Le nom de l'outil auquel l'assistant fait appel au cours de son tour de parole.
Arguments d'appel de l'outil Les arguments que l'assistant transmet à l'outil, affichés sous la forme d'un extrait de code « JSON » mis en forme.
Réponse de l'outil Le résultat renvoyé par l'outil après l'appel de l'assistant.
Entrée La charge utile d'entrée complète de l'appel partiel du LLM. Vous pouvez afficher cette charge utile en mode « Formatted » (liste clé-valeur) ou en mode « JSON » ( JSON brutes).
Sortie La charge utile complète de la sous-appel du LLM. Vous pouvez afficher cette charge utile en mode « Formatted » (liste clé-valeur) ou en mode « JSON » ( JSON brutes).
Appels LLM Nombre d'appels au modèle LLM effectués par la tâche.
Appels d'outils Le nombre d'appels d'outils effectués par la tâche.
Sous-tâche Le nombre de sous-tâches enfants au sein de la tâche.
Figure 2. Affichage du parcours LLM dans l' Instana
Affichage du parcours LLM dans l' Instana

Avantages de la vue « Parcours LLM »

La vue « Trajectoire LLM » vous offre une visibilité détaillée sur chaque étape de l'exécution d'un agent. Utilisez cette vue pour :

  • Débogage de l'exécution d'un agent : suivez la séquence exacte des invites, des appels d'outils et des réponses du modèle afin d'identifier à quel moment un agent s'est écarté du comportement attendu ou a produit un résultat erroné.
  • Analyser les interactions entre les outils : examinez les arguments transmis à chaque outil ainsi que les réponses renvoyées par chacun d'entre eux, afin d'identifier les défaillances des outils ou les paramètres utilisés de manière incorrecte lors de l'exécution d'un agent.
  • Surveiller l'utilisation des tokens à chaque étape : suivre le nombre de tokens entrants et sortants à chaque sous-appel du LLM afin d'identifier les étapes présentant la plus forte consommation de tokens dans le chemin d'exécution de l'agent.
  • Analyser la chronologie des tâches : examiner l'heure de début, l'heure de fin et la durée de chaque tâche et de chaque sous-appel LLM afin d'identifier les goulots d'étranglement liés à la latence tout au long du parcours de l'agent.
  • Comprendre le raisonnement de l'agent : passez en revue l'intégralité de la séquence de messages, notamment les messages de l'utilisateur, les réponses de l'assistant et les résultats des outils, afin de comprendre comment le modèle a raisonné à chaque étape de la tâche.
  • Suivre le contexte de l'agent : visualiser chaque étape d'annotation au sein de la hiérarchie complète des tâches, y compris les entrées et les sorties de la tâche parente, ainsi que les métriques agrégées par la vue, telles que le nombre d'appels au LLM, le nombre d'appels aux outils et le nombre total de tokens.