Illustration numérique d’une femme tenant un iPad avec des icônes de tableaux de bord devant et derrière elle.

Présentation de VAKRA : benchmark de référence pour évaluer les capacités d’appel d’outils multi-sauts et multi-sources des agents IA

Découvrez comment VAKRA peut évaluer le comportement des agents de bout en bout, lorsque les tâches en plusieurs étapes concernent diverses sources de données et nécessitent le respect des directives d’utilisation des outils.

VAKRA (eValuating API and Knowledge Retrieval Agents using multi-hop, multi-source dialogues) est un outil de référence exécutable conçu pour évaluer la capacité des agents IA à raisonner de bout en bout dans des environnements de type entreprise. 

Au lieu de tester des compétences isolées, VAKRA mesure le raisonnement compositionnel à travers les API et les documents, en utilisant des traces d’exécution complètes pour évaluer si les agents peuvent exécuter de manière fiable des workflows en plusieurs étapes, et non seulement des étapes individuelles.

VAKRA fournit un environnement exécutable dans lequel les agents interagissent avec plus de 8 000 API hébergées localement et adossées à des bases de données réelles couvrant 62 domaines, ainsi que des collections de documents alignées sur ces domaines. Les tâches peuvent nécessiter des chaînes de raisonnement en 3 à 7 étapes combinant interaction structurée avec des API et recherche non structurée, sous des contraintes d’utilisation d’outils en langage naturel.

  • Des outils hébergés localement et adossés à des bases de données garantissent des réponses déterministes et vérifiables lors de l’évaluation.
  • La récupération de documents est assurée via des index spécifiques aux domaines, permettant un ancrage intersources et une extraction efficace.
  • La vérification au niveau des trajectoires rejoue les traces complètes des agents sur des outils en conditions réelles, en prenant en charge plusieurs chemins d’exécution valides, ce qui est essentiel pour les workflows d’entreprise.

Le raisonnement multi-sauts et multi-sources est essentiel

Les environnements d’entreprise ne ressemblent pas à des interactions de type questions-réponses en un seul tour ni à des appels de fonction ponctuels. Les workflows dans des domaines tels que le support client, la business intelligence et la conformité exigent des agents qu’ils enchaînent les décisions, réconcilient des schémas incompatibles et respectent des politiques d’utilisation des outils exprimées en langage naturel. Les défaillances surviennent non seulement lors de l’invocation des outils, mais aussi dans le raisonnement médié par le langage entre les outils, notamment la désambiguïsation des entités, l’ancrage intersources et l’alignement des paramètres ou des schémas.

Prenons l’exemple d’une réclamation pour retard de commande dans un contexte de commerce électronique. Pour la résoudre, un agent doit connecter correctement les informations entre les systèmes, en reliant les dossiers clients, en interprétant la documentation des transporteurs, en alignant les identifiants entre les API logistiques et en appliquant des politiques exprimées en langage naturel. Chaque décision dépend de celle qui la précède, ce qui nécessite un raisonnement soutenu entre les outils, les sources de données et les contraintes.

VAKRA est conçu pour mettre en évidence précisément où le raisonnement en plusieurs étapes réussit ou échoue, afin de refléter les réalités auxquelles les agents sont confrontés dans les environnements de production.

Cas d’utilisation : trois niveaux de complexité croissante

Inspiré par des scénarios tels que l’exemple de la plainte pour retard de commande mentionné plus haut, VAKRA organise les tâches en trois niveaux :

  1. Divers styles d’interaction avec les API : les agents doivent s’adapter à différentes abstractions d’interface, allant des API de type business intelligence qui exposent des interfaces de fonctions compositionnelles ou étendues (nécessitant une planification et une sélection d’outils minutieuses) aux points de terminaison alignés sur les requêtes, qui encapsulent le calcul mais nécessitent toujours une interprétation précise des requêtes et une paramétrisation correcte.
  2. Raisonnement multi-sauts sur des API structurées : les tâches nécessitent de 3 à 7 appels d’API dépendants, où les résultats des étapes précédentes doivent être correctement interprétés, transformés et réutilisés pour paramétrer les actions suivantes.
  3. Raisonnement multi-sauts et multi-sources avec des politiques d’utilisation des outils : les tâches nécessitent un raisonnement multi-sauts sur des documents non structurés et des API structurées, où les agents doivent décider quand effectuer une récupération, comment ancrer les informations récupérées dans les appels d’outils en aval et respecter des politiques d’utilisation des outils exprimées en langage naturel.

Conçu pour une évaluation exécutable et vérifiable

VAKRA fonctionne dans un environnement auto-hébergé : les API adossées à des bases de données persistantes et à des index de recherche sont exposées via une interface standard, et les agents ne peuvent interagir qu’à travers ces outils. L’évaluation rejoue les trajectoires complètes pour vérifier chaque étape intermédiaire, et pas seulement les réponses finales, ce qui permet d’identifier précisément où le raisonnement échoue : désambiguïsation des entités, correspondance intersources ou interprétation des politiques.

VAKRA est conçu pour trois utilisateurs différents :

  • Chercheurs étudiant le raisonnement agentique, la planification multi-outils et l’ancrage
  • Équipes de développement et d’ingénierie évaluant des modèles de fondation pour des workflows d’agents en production
  • Dirigeants à la recherche de benchmarks reflétant la complexité des environnements d’entreprise, et non de cas simplifiés

Démarrage et disponibilité

VAKRA est disponible publiquement dès aujourd’hui. Le code source, les spécifications des tâches et l’infrastructure d’évaluation sont disponibles en open source sur GitHub, incluant tout le nécessaire pour reproduire les résultats et exécuter de nouveaux agents de bout en bout, notamment :

  • Environnements d’API exécutables hébergés localement et adossés à des bases de données réelles
  • Collections de documents propres à un domaine pour le raisonnement augmenté par la récupération
  • Un moteur d’évaluation autonome qui rejoue et vérifie les trajectoires complètes des agents
  • Scripts pour l’évaluation comparative des nouveaux modèles dans le cadre de tâches API uniquement, multi-sauts et multi-sources

Nous lançons également un espace Hugging Face qui hébergera le classement public VAKRA. Nous invitons les chercheurs, les praticiens et les développeurs à soumettre leurs résultats et à contribuer par leurs retours et extensions.

Découvrir sur GitHub

Ankita Rajaram Naik

Research Data Scientist

Auteurs supplémentaires :

Remerciements

Les auteurs remercient leurs collègues des équipes de recherche et d’ingénierie pour leurs précieux commentaires, leurs discussions et leur soutien lors de l’élaboration de cette référence.

Nous remercions particulièrement nos stagiaires, Raavi Gupta et Abhinav Jain, pour leurs efforts en matière de génération et de développement de critères de référence. Nous saluons également Chulaka Gunasekara, Hamid Adebayo, Harold Ship, Himanshu Gupta, Huaiyu Zhu, Jaydeep Sen, Renuka Sindhgatta, Sameep Mehta, Sara Rosenthal et Segev Shlomov pour leurs contributions et leurs informations.