Pilotage minimalement invasif des modèles de langage
Une nouvelle méthode ajuste le comportement d'un LLM figé sans toucher à ses paramètres, en limitant la distorsion de la distribution de sortie.
arXiv cs.AI · cs.LG · cs.CL·Taha Entesari, Jingyu Zhang, Daniel Khashabi, Mahyar Fazlyab·24 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode vérifiée sur modèles 1B-14B obtenant 6/7 meilleures récompenses tout en préservant cohérence et diversité, offrant une alternative effective au fine-tuning.

Image · Source originale
MISVO optimise des vecteurs de steering appliqués aux états cachés finaux d'un modèle de langage gelé, en pénalisant les interventions via la géométrie KL locale. La méthode dérive une décomposition exacte du gradient KL et utilise un substitut de Fisher pour optimiser des interventions position-spécifiques sans mise à jour des paramètres. Sur des modèles de 1B à 14B paramètres, MISVO obtient la meilleure récompense moyenne dans six configurations sur sept, avec une diversité et cohérence proches de Best-of-N.