RECHERCHE
OmegaUse-OfficeVal : benchmark d'agents LLM pour tâches bureautiques
Un nouveau benchmark évalue les agents LLM sur des workflows bureautiques longs avec des indicateurs économiques.
arXiv cs.AI · cs.LG · cs.CL·Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao·29 juillet 2026

Image · Source originale
OmegaUse-OfficeVal est un benchmark composé de 100 tâches bureautiques complexes, évaluant les agents LLM selon des signaux économiques comme le temps de travail humain. Les tests montrent que si les modèles sont plus rapides et moins coûteux que les humains, ils n'atteignent pas encore la qualité des livrables humains. Le code et le dataset sont en open-source.