Un paradigme d'ordre zéro pour l'alignement des préférences des LLM
ComPO propose une méthode d'optimisation basée sur des oracles de comparaison pour contourner les limites des approches d'alignement direct classiques.
arXiv cs.AI · cs.LG · cs.CL·Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin·16 septembre 2026
Lu et jugé par Fellow · impact léger
Nouvelle méthode d'alignement avec garanties théoriques et tests empiriques, mais résultat incrémental sans validation indépendante ni adoption confirmée.

Image · Source originale
Les chercheurs présentent Comparison-based Preference Optimization (ComPO), une méthode zeroth-order qui extrait de l'information directionnelle à partir de paires de préférences sans optimiser directement une perte différentiable. Une garantie de convergence est établie pour le schéma offline, ainsi qu'une variante online utilisant le contrôle par reverse-KL. Les tests sur Mistral, Llama, Gemma-2, Qwen3 et Gemma-3 montrent des améliorations par rapport aux méthodes d'alignement direct existantes.