RECHERCHE
Orca-Bench : évalue la préparation des agents LLM
Un nouveau benchmark mesure la capacité des modèles d'IA à gérer des tâches opérationnelles d'oncall.
Hacker News (filtré IA)·@yruzin·31 juillet 2026

Image · Source originale
Orca-Bench est un benchmark conçu pour évaluer l'aptitude des agents de langage à réaliser des tâches d'oncall. L'étude analyse la performance des LLM sur des scénarios réels de maintenance et de débogage.