Toutes les news taguées avec ce sujet.
Un nouveau cadre transfère le raisonnement logique de modèles textuels vers des modèles audio via un alignement on-policy.
Des informations suggèrent que le modèle K3 de Moonshot a été élaboré en distillant Fable, un LLM concurrent.
Analyse de l'essor des modèles chinois, de la distillation et des enjeux géopolitiques pour l'écosystème open-source.
TREK combine distillation et GRPO pour débloquer les prompts difficiles que le modèle étudiant ne sait pas résoudre seul.
Une méthode transfère le signal RLVR d'un petit modèle vers un plus grand, sans relancer le RL coûteux sur la cible.
Une nouvelle méthode amplifie les biais furtifs des LLM en concentrant les divergences de distribution dans un adaptateur KV-cache, les rendant détectables.
Des chercheurs montrent que la génération de paires QA synthétiques pour le fine-tuning introduit des biais structurels et des vulnérabilités d'injection souvent ignorés.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.
Un nouveau paradigme de distillation pour LLM et VLM qui contourne l'illusion de privilège en routant dynamiquement la supervision token par token.
Un framework de distillation unifie génération texte-image, édition locale et globale dans un seul modèle sans dégradation mutuelle des capacités.
Anthropic affirme qu'Alibaba aurait contourné ses conditions d'utilisation pour extraire des capacités de son modèle Claude à des fins non autorisées.