Surveillance des LLM
Vous pouvez surveiller les métriques et les traces LLM dans l'interface utilisateur d' Instana.
Métriques LLM
Pour consulter les métriques LLM, cliquez sur « ».
Les indicateurs du LLM, ainsi que leur coût, leur latence et d'autres détails relatifs aux performances, s'affichent dans l'onglet « Indicateurs du LLM ».
| Paramètre | Description |
|---|---|
| Coût des intrants | Le coût lié à l'envoi de jetons d'entrée, c'est-à-dire la requête ou la question adressée aux modèles d'apprentissage profond (LLM). |
| Coût de production | Le coût engendré par les jetons générés par les LLM en réponse à l'entrée. |
| Coût total | Coût total des jetons générés par les LLM en réponse à l'entrée. Le coût est la somme du coût des intrants et du coût des extrants. |
| Modèles | Le nombre de modèles LLM utilisés au cours de la période considérée. Cette valeur reflète la diversité des modèles linguistiques utilisés. |
| Services GenAI | Le nombre de fournisseurs de services d'IA générative ou de points de terminaison utilisés. Chaque modèle peut être hébergé par un service différent, ce qui reflète les variations potentielles en termes de performances et de prix. |
| Appels LLM (total) | Le nombre de fois où les grands modèles de langage (LLM) ont été sollicités, c'est-à-dire le nombre d'interactions de type « invite-réponse » qui ont eu lieu. Cet indicateur montre le niveau d'activité global des modèles. |
| Utilisation des jetons | Utilisation du jeton au fil du temps. Vous pouvez filtrer l'utilisation par modèle LLM ou par service afin de comprendre les habitudes de consommation individuelles ou collectives. |
| Coût | Évolution des coûts au fil du temps pour les modèles LLM. Vous pouvez filtrer les données d'utilisation par modèle LLM ou par service afin d'analyser la rentabilité. |
| Appels LLM | Le nombre d'appels LLM au fil du temps. Vous pouvez consulter la fréquence des invocations de modèles par modèle LLM ou service afin d'identifier les périodes d'utilisation maximale. |
| Latence LLM | La latence des appels LLM au fil du temps. Cet indicateur mesure le temps de réponse de chaque modèle, indiquant ainsi la rapidité avec laquelle les modèles génèrent des résultats. |
| Nom du modèle | Le modèle LLM utilisé. |
| Jetons d'entrée | Le nombre de jetons dans les invites ou les requêtes envoyées au LLM. |
| Jetons de sortie | Le nombre de jetons générés par le LLM en tant que réponses. |
| Nombre total de jetons | La somme des jetons d'entrée et des jetons de sortie, représentant le nombre total de jetons pour chaque interaction. |
| Coût total | Dépenses totales pour les jetons générés par les LLM. |
| Temps de latence (moyenne) | Temps de réponse moyen du LLM pour tous les appels. |
| Nombre d'appels | Le nombre total de fois où le LLM a été appelé ou invoqué. |
Traces LLM
Pour afficher les traces LLM, cliquez sur « ».
Les traces du modèle LLM, y compris les invites d'entrée et les réponses générées, s'affichent dans l'onglet « Traces ».
| Paramètre | Description |
|---|---|
| ID de la trace | Un identifiant unique attribué à chaque trace ou interaction avec le système d'IA générative. Cela s'avère utile pour suivre et déboguer des requêtes spécifiques. |
| Service d'IA générative | Le service d'IA générative utilisé pour traiter la requête. |
| Invite de saisie | La question ou la commande soumise au modèle d'IA. |
| Réponse de la sortie | La réponse générée par le modèle d'IA en réponse à la requête saisie. |
| Nombre total de jetons | Nombre total de jetons utilisés dans l'interaction, y compris les entrées et les sorties. |
| Durée | Le temps nécessaire au modèle d'IA pour générer la réponse, mesuré en millisecondes. Cette valeur permet d'évaluer les performances et la latence. |
| Statut | Indique si l'interaction a été réussie. Une coche verte indique que la réponse a été générée avec succès, sans erreur. |
Vue des tâches LLM dans les détails de la trace
Lorsque vous consultez une trace contenant des appels LLM, vous pouvez accéder à des informations détaillées sur les interactions LLM via la vue « Tâches LLM ». Cette vue offre un aperçu complet des opérations d'IA générative au sein des traces de votre application.
Accéder à la vue « Tâches LLM »
Pour accéder à la vue « Tâches LLM » :
- Accédez à .
- Cliquez sur une trace contenant des appels LLM.
- Dans la vue des détails de la trace, repérez un intervalle d'appel LLM et cliquez dessus. La vue des tâches du LLM affiche des informations détaillées sur l'interaction LLM sélectionnée.Remarque :Une trace récemment enregistrée apparaît sur la page « Traces », mais la vue des tâches du LLM peut mettre jusqu'à une minute après cela pour générer et afficher les données.
Informations sur la vue des tâches LLM
La vue « Tâches LLM » fournit les informations suivantes :
| Paramètre | Description |
|---|---|
| Nom du modèle | Le modèle LLM spécifique utilisé pour l'interaction, par exemple, gpt-4 ou claude-3-opus. |
| Invite de saisie | La requête complète envoyée au modèle de langage de grande capacité (LLM), y compris les messages système et le contexte. |
| Réponse de la sortie | La réponse complète générée par le modèle de langage (LLM). |
| Jetons d'entrée | Le nombre de caractères dans la ligne de commande. |
| Jetons de sortie | Le nombre de jetons dans la réponse générée. |
| Nombre total de jetons | La somme des jetons d'entrée et de sortie. |
| Coût des intrants | Le coût lié au traitement des jetons d'entrée. |
| Coût de production | Le coût lié à la génération des jetons de sortie. |
| Coût total | Le coût total de l'interaction avec le LLM, qui correspond à la somme des coûts d'entrée et de sortie. |
| Durée | Le temps nécessaire au LLM pour traiter la requête et générer la réponse. |
| Température | La température d'échantillonnage utilisée pour l'appel du LLM, qui contrôle le caractère aléatoire de la sortie. |
| Nombre maximal de jetons | Le nombre maximal de jetons autorisés dans la réponse. |
| Top P | Le paramètre d'échantillonnage du noyau utilisé pour contrôler la diversité de sortie. |
| Pénalité de fréquence | La pénalité appliquée pour réduire la répétition des jetons dans la sortie. |
| Pénalité de présence | La pénalité a été appliquée pour inciter le modèle à aborder de nouveaux sujets. |

Avantages de la vue « Tâches » de LLM
La vue « Tâches » de LLM vous aide à :
- Déboguez les interactions avec les modèles de langage (LLM) en examinant les invites et les réponses exactes afin d'identifier les problèmes ou les comportements inattendus.
- Optimisez les coûts en analysant l'utilisation des jetons et les coûts associés à chaque appel au modèle de langage (LLM) afin d'identifier les possibilités d'optimisation.
- Surveillez les performances en suivant la latence et les temps de réponse des opérations LLM au sein des traces de votre application.
- Comprenez le comportement du modèle en examinant les paramètres utilisés pour chaque appel au LLM afin de comprendre comment ils influencent le résultat.
- Consultez les interactions LLM dans le contexte de la trace complète de l'application, y compris les appels en amont et en aval.
Aperçu du parcours LLM
Utilisez la vue « Trajectoire » pour examiner chaque étape d'un appel d'agent ou de LLM. Lorsque vous ouvrez une trace contenant des appels d'agent ou de LLM, vous pouvez accéder à la vue « Trajectoire » pour examiner la trace d'exécution complète, qui inclut chaque invite, chaque appel d'outil et chaque réponse du modèle.
La vue présente chaque tâche d'agent sous la forme d'une entrée numérotée. Vous pouvez utiliser la liste avec fonction de recherche pour accéder à n'importe quelle tâche, et le panneau de détails de la tâche pour consulter l'ensemble du contexte de cette tâche.
Accéder à la vue du parcours LLM
Pour accéder à la vue « Trajectoire », procédez comme suit :
- Dans le menu de navigation de l'interface utilisateur d' Instana, sélectionnez « ».
- Cliquez sur une trace contenant des appels LLM.
- Dans la barre de navigation, cliquez sur l'onglet « Trajectoire ». L'affichage passe de la vue « Hiérarchie des tâches » à la vue « Trajectoire ».
Une trace récemment enregistrée s'affiche. Toutefois, la vue « Trajectoire » peut mettre jusqu’à une minute pour générer et afficher les données correspondantes. {: note}
Afficher les informations sur le parcours LLM
La vue « Parcours LLM » fournit les informations suivantes :
| Paramètre | Description |
|---|---|
| Nom de la tâche | Nom de la tâche de l'agent qui contient l'étape d'annotation. |
| Nom de la sous-tâche | Nom de l'appel partiel LLM spécifique au sein de l'étape d'annotation. |
| Heure de début | La date et l'heure de lancement de l'appel à projets partiel LLM. |
| Heure de fin | La date et l'heure de clôture de l'appel à candidatures partiel pour le LLM. |
| Durée | Durée totale d'exécution de l'appel secondaire du LLM, en millisecondes. |
| Jetons d'entrée | Nombre de tokens contenus dans la requête d'entrée que le modèle reçoit pour cet appel partiel du LLM. |
| Jetons de sortie | Le nombre de tokens contenus dans la réponse générée par le modèle pour cet appel partiel du LLM. |
| Nombre total de jetons | Le total cumulé des jetons d'entrée et de sortie pour le sous-appel LLM. |
| Message utilisateur | La requête que l'utilisateur envoie au modèle de langage de grande capacité (LLM). La vue affiche ce contenu sous forme de texte brut, au format « JSON » ou au format Markdown, selon le type de contenu. |
| Réponse de l'assistant | La réponse complète générée par le modèle pour cet appel partiel du LLM. |
| Nom de l'appel d'outil | Le nom de l'outil auquel l'assistant fait appel au cours de son tour de parole. |
| Arguments d'appel de l'outil | Les arguments que l'assistant transmet à l'outil, affichés sous la forme d'un extrait de code « JSON » mis en forme. |
| Réponse de l'outil | Le résultat renvoyé par l'outil après l'appel de l'assistant. |
| Entrée | La charge utile d'entrée complète de l'appel partiel du LLM. Vous pouvez afficher cette charge utile en mode « Formatted » (liste clé-valeur) ou en mode « JSON » ( JSON brutes). |
| Sortie | La charge utile complète de la sous-appel du LLM. Vous pouvez afficher cette charge utile en mode « Formatted » (liste clé-valeur) ou en mode « JSON » ( JSON brutes). |
| Appels LLM | Nombre d'appels au modèle LLM effectués par la tâche. |
| Appels d'outils | Le nombre d'appels d'outils effectués par la tâche. |
| Sous-tâche | Le nombre de sous-tâches enfants au sein de la tâche. |

Avantages de la vue « Parcours LLM »
La vue « Trajectoire LLM » vous offre une visibilité détaillée sur chaque étape de l'exécution d'un agent. Utilisez cette vue pour :
- Débogage de l'exécution d'un agent : suivez la séquence exacte des invites, des appels d'outils et des réponses du modèle afin d'identifier à quel moment un agent s'est écarté du comportement attendu ou a produit un résultat erroné.
- Analyser les interactions entre les outils : examinez les arguments transmis à chaque outil ainsi que les réponses renvoyées par chacun d'entre eux, afin d'identifier les défaillances des outils ou les paramètres utilisés de manière incorrecte lors de l'exécution d'un agent.
- Surveiller l'utilisation des tokens à chaque étape : suivre le nombre de tokens entrants et sortants à chaque sous-appel du LLM afin d'identifier les étapes présentant la plus forte consommation de tokens dans le chemin d'exécution de l'agent.
- Analyser la chronologie des tâches : examiner l'heure de début, l'heure de fin et la durée de chaque tâche et de chaque sous-appel LLM afin d'identifier les goulots d'étranglement liés à la latence tout au long du parcours de l'agent.
- Comprendre le raisonnement de l'agent : passez en revue l'intégralité de la séquence de messages, notamment les messages de l'utilisateur, les réponses de l'assistant et les résultats des outils, afin de comprendre comment le modèle a raisonné à chaque étape de la tâche.
- Suivre le contexte de l'agent : visualiser chaque étape d'annotation au sein de la hiérarchie complète des tâches, y compris les entrées et les sorties de la tâche parente, ainsi que les métriques agrégées par la vue, telles que le nombre d'appels au LLM, le nombre d'appels aux outils et le nombre total de tokens.