DolphinBench : cartographier la frontière de Pareto de la mémoire des agents IA
Un nouveau benchmark évalue la mémoire des agents via l'accomplissement de tâches réelles, en intégrant coût et latence, pas seulement la précision.
arXiv cs.AI · cs.LG · cs.CL·Soumil Rathi, Deshraj Yadav, Taranjeet Singh·21 septembre 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark avec protocole vérifiable et code/données disponibles, évaluant la mémoire via l'accomplissement de tâches et les compromis coût/latence.

Image · Source originale
DolphinBench propose trois personas de travail avec environ 500 000 tokens d'historique chacun, et teste 200 tâches par persona en vérifiant que l'agent réussit avec l'historique pertinent et échoue sans lui. Contrairement aux benchmarks classiques de question-réponse, il exige le report du coût et de la latence en plus de la précision, permettant une évaluation holistique des systèmes de mémoire d'agents.