Toutes les news taguées avec ce sujet.
Un framework transforme des cas cliniques en jeux interactifs structurés via une architecture à double moteur.
Vingt-six modèles ASR en licence Apache-2.0 couvrent 27 langues africaines, avec des taux d'erreur mots comparables aux baselines monolingues.
Une nouvelle solution permet de simplifier et d'accélérer le fine-tuning du modèle Nemotron 3 Nano via Prime Intellect Lab.
Un nouveau benchmark et corpus d'instruction en cinghalais-anglais pour corriger le biais occidental de l'alignement des valeurs des LLM.
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
Deux nouveaux adaptateurs inspirés de Mamba ajoutent une mémoire dynamique au LoRA, avec des gains mesurables sur le raisonnement multi-sauts.
Un framework task-aware et budget-aware qui optimise le fine-tuning des LLM en sélectionnant 1% à 10% des données.
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
Un nouveau benchmark et une métrique VLM permettent de conditionner la similarité visuelle selon un aspect précis (forme, couleur, etc.).
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Un leaderboard open source mesure la rapidité des différentes méthodes de fine-tuning LoRA sur des tâches standardisées.
Hugging Face intègre NVIDIA NeMo Automodel à Diffusers pour accélérer l'entraînement distribué.
NVIDIA montre comment des agents de codage automatisés accélèrent l'adaptation de modèles de raisonnement visuel pour la production vidéo.
Une approche basée sur LoRA fusionne progressivement plusieurs modalités pour la reconnaissance d'actions en formation médicale.
Un développeur détaille un projet où un agent, lui-même entraîné par renforcement, orchestre l'entraînement RL d'autres modèles à faible coût.
Un framework de reinforcement learning affine les politiques robotiques pré-entraînées pour les tâches de manipulation industrielle à contact précis.
Les paramètres jugés critiques dans les LLMs ne sont pas pour autant les meilleurs cibles d'entraînement — une étude remet en question le concept de Super Weights.
Une méthode de régularisation sans état qui améliore la compressibilité des réseaux de neurones avec moins de 1 % de surcoût à l'entraînement.
Un framework open-source qui transforme la génération vidéo en mécanisme de raisonnement séquentiel, alternatif au Chain-of-Thought textuel.
NVIDIA détaille comment combler les lacunes des datasets financiers déséquilibrés grâce à la génération de données synthétiques via NeMo.
Des chercheurs montrent que les LLM comprennent les dialectes anglais mais peinent à les produire, et publient un benchmark contrôlé pour y remédier.
Une méthode de feedback adaptatif ajuste dynamiquement la longueur du préfixe de solution fourni au modèle, doublant la précision de GRPO sur les problèmes mathématiques difficiles.
Un système de production génère des commentaires stratégiques F1 multilingues en garantissant la fidélité factuelle via un vérificateur de claims intégré à l'architecture.
Un framework hybride combinant raisonnement différentiable sur graphes et génération LLM pour améliorer le QA multi-sauts sur knowledge graphs.
Un framework léger en deux étapes corrige la dérive des timestamps dans les modèles ASR autoregressifs sur les longues plages non-vocales, sans dégrader les autres capacités.
Hugging Face publie une mise à jour majeure de sa bibliothèque robotique open-source LeRobot, avec de nouveaux outils d'évaluation et d'amélioration des politiques.
PAW compile des spécifications en langage naturel en adaptateurs légers exécutables localement, rivalisant avec un LLM 32B avec 50× moins de mémoire.
Une étude montre qu'affiner un seul layer d'un Transformer via RL atteint des performances comparables à l'entraînement complet de tous les paramètres.
Un framework adversarial générateur-discriminateur combine récompenses vérifiables et signal appris sur des données humaines pour pallier les limites du RLVR.
Un framework entraîne les LLM à gérer leur mémoire comme une compétence à part entière, multipliant par 2 à 4 les performances sur des tâches longues.