RECHERCHE
SWE-rebench : 13 modèles et 4 agents évalués sur des tâches réelles en Go, Java, Python, Rust et TS
Un benchmark compare modèles et frameworks d'agents sur des tâches d'ingénierie logicielle multi-langages, avec des résultats mis à jour régulièrement.
Hacker News (filtré IA)·@ibragim_bad·31 juillet 2026

Image · Source originale
SWE-rebench évalue 13 modèles de langage et 4 agents sur des tâches de développement logiciel réelles couvrant Go, Java, Python, Rust et TypeScript. Le projet vise à fournir une comparaison actualisée des performances sur des cas d'usage concrets, au-delà des benchmarks classiques centrés sur Python.