Terminal-Bench-Science : un benchmark pour évaluer les agents IA sur des workflows de recherche scientifique
Un nouveau benchmark teste les agents IA en ligne de commande sur des tâches réelles de recherche scientifique, au-delà du simple codage.
Hacker News (filtré IA)·@matt_d·28 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark scientifique avec protocole détaillé, 70 tâches réelles et résultats vérifiables (Opus 5 à 30%).

Image · Source originale
Terminal-Bench-Science propose une suite d'évaluation destinée à mesurer les capacités des agents IA à réaliser des workflows de recherche scientifique dans un environnement terminal. L'initiative vise à combler un manque de benchmarks spécifiques à ce domaine, distincts des tests classiques de génération de code.