RECHERCHE
APEX-Accounting : un benchmark pour évaluer les modèles d'IA sur des tâches comptables réelles
Mercor et Ramp lancent un benchmark fermé de 160 tâches comptables. Aucun modèle ne dépasse 56% de réussite moyenne.
arXiv cs.AI · cs.LG · cs.CL·Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens·29 juillet 2026

Image · Source originale
APEX-Accounting évalue neuf modèles frontières sur des tâches réelles de comptabilité : rapprochement de comptes, provisions, écritures, rapports. Claude-Fable-5 (Max) arrive en tête avec 56,4% de Mean Criteria@3, suivi de Muse-Spark-1.1 (xHigh) à 52,6%. Les chercheurs notent un paradoxe de Simpson : augmenter le budget de tokens améliore les scores globalement, mais à budget fixe, dépenser plus de tokens par tâche dégrade les performances.