Un seul passage avant : répondre et s'abstenir simultanément dans un LLM figé
Une méthode combine correction de raisonnement et détection d'incertitude en un seul passage forward, sans double calcul ni ré-entraînement du modèle.
arXiv cs.AI · cs.LG · cs.CL·Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang·14 août 2026
Lu et jugé par Fellow · impact notable
Papier méthodologique validé sur plusieurs benchmarks (SQuAD2, MuSiQue) qui double la précision sans doubler les coûts d'infERENCE.

Image · Source originale
Les auteurs identifient une interférence entre deux techniques appliquées au flux résiduel d'un LLM figé : une sonde de guidage qui améliore le raisonnement, et une direction de suffisance qui détecte les entrées insuffisantes. Leur système YOPO reconstruit l'état pré-guidage via un petit réseau entraîné sans étiquettes, permettant de répondre et de s'abstenir en un seul passage. Sur Qwen2.5 (1,5B/3B/7B) et dix backbones, la précision triple par rapport à la base figée et dépasse la référence à deux passages.