Distillation on-policy pour le raisonnement en très basse quantification
Une méthode de distillation on-policy corrige les biais d'exposition amplifiés par la quantification sub-3-bit, restaurant la performance des modèles sur les tâches de raisonnement long.
arXiv cs.AI · cs.LG · cs.CL·Yuanteng Chen, Zhilei Liu, Peisong Wang, Yuantian Shao·22 septembre 2026
Lu et jugé par Fellow · impact notable
Résultats chiffrés reproductibles sur benchmarks standards (MATH-500, HumanEval) pour la quantification sub-3-bit, mais non validés indépendamment.

Image · Source originale
La distillation aware de la quantification (QAD) pallie la dégradation des modèles sub-3-bit sur les questions-réponses courtes, mais échoue sur le raisonnement mathématique et code. Les auteurs identifient un biais d'exposition amplifié par la quantification et proposent une distillation on-policy (OPD). Le modèle quantifié génère ses propres trajectoires et reçoit un retour d'un modèle professeur en pleine précision. OPD fait passer la rétention de performance BF16 de 35% à 70% sur MATH-500 et de 66% à 91% sur HumanEval, offrant une solution complète pour la quantification sub-3-bit.