VAKRA : un benchmark pour évaluer le raisonnement multi-étapes des agents sur APIs et recherche documentaire
IBM Research publie un benchmark de plus de 8 000 APIs exécutables pour tester les agents LLM sur des scénarios d'entreprise réalistes.
arXiv cs.AI · cs.LG · cs.CL·Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo·12 août 2026

Image · Source originale
VAKRA évalue les agents sur trois niveaux de difficulté croissante : interactions API simples, raisonnement multi-étapes sur APIs structurées, et raisonnement multi-sources sous contraintes de politique en langage naturel. Même le meilleur modèle plafonne à 70,4% sur les tâches simples et chute à 50-51% sur les APIs compositionnelles, avec des échecs sévères (2,4%) sur les requêtes sans réponse. L'analyse montre que les échecs viennent surtout de la désambiguïsation d'entités et du raisonnement inter-sources, pas de l'invocation d'outils elle-même.