onPanda : un outil d'annotation efficace pour l'alignement on-policy des LLM et agents
Une correction token par token pour guider précisément les réponses des modèles, avec 52% de temps d'annotation en moins.
arXiv cs.AI · cs.LG · cs.CL·Lei Yang, Mengyin Liu, Jia Wang, Hangyu Guo·21 septembre 2026
Lu et jugé par Fellow · impact léger
Outil d'annotation utile mais étude contrôlée limitée, sans adoption ni disponibilité large démontrée.

Image · Source originale
onPanda est un outil interactif d'annotation qui permet de corriger les réponses de LLM au niveau du token : l'annotateur localise le premier token inapproprié, le remplace ou le réécrit, puis le modèle poursuit la génération à partir du préfixe corrigé. Cette boucle localiser-corriger-continuer préserve la distribution du modèle et facilite la création de données SFT et de préférence on-policy. Les auteurs publient également Panda-CVL, un dataset annoté avec cet outil, ainsi qu'un benchmark associé.