LongHarness Bench : évaluer les harnais de LLM sur le raisonnement long-contexte
Un nouveau benchmark révèle que l'efficacité, pas seulement la précision, distingue vraiment les harnais pour LLM en contexte long.
arXiv cs.AI · cs.LG · cs.CL·Quang Hieu Pham, Thuy Duong Nguyen, Jocelyn Qiaochu Chen, Xi Ye·29 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark académique sans code ni adoption confirmée, portée limitée à la recherche évaluative.

Image · Source originale
Les auteurs introduisent LongHarness Bench, un benchmark testant à la fois précision et efficacité des harnais de LLM sur des tâches de raisonnement long-contexte nécessitant recherche lexicale, matching sémantique et stratégies adaptatives. Malgré des combinaisons modèle-harnais avancées, le meilleur score n'atteint que 68% de précision macro-moyenne. Le résultat clé : un même modèle peut afficher des efficacités très différentes selon le harnais utilisé.