Le feedback utilisateur porte un signal unique que les LLM ne savent pas détecter
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.
arXiv cs.AI · cs.LG · cs.CL·Shachar Don-Yehiya, Leshem Choshen, Omri Abend·2 septembre 2026
Lu et jugé par Fellow · impact notable
Une étude avec données synthétiques et naturalistes prouve que le feedback utilisateur améliore les révisions, mais que les juges LLM échouent à le mesurer.

Image · Source originale
Les auteurs contestent l'idée que le feedback utilisateur soit trop bruité pour être exploité par les LLM. À l'aide de données synthétiques à vérité terrain et de données naturalistes, ils montrent que les révisions informées par le feedback corrigent significativement plus de problèmes ciblés que les révisions de référence. Le biais d'évaluation vient des juges LLM, qui échouent souvent à identifier la réponse réellement corrigée et préfèrent des sorties inférieures.