Le mixage de données améliore le raisonnement multilingue
Tiny Aya L2-Thinker prouve qu'un mélange data-centric optimisé généralise le raisonnement L2 à 60 langues sans supervision extensive.
arXiv cs.AI · cs.LG · cs.CL·Mehrnaz Mofakhami, Ananya Sahu, Alejandro R. Salamanca, Daniel D'souza·9 septembre 2026
Lu et jugé par Fellow · impact notable
Résultats vérifiables (93% sur 60 langues, poids et données publiés) mais échelle modeste (3,35B), pas d'évaluation indépendante.

Image · Source originale
Cette étude explore comment la composition des données en SFT optimise le raisonnement en langue L2. Le modèle Tiny Aya L2-Thinker (3,35B) atteint un taux de raisonnement L2 supérieur à 93 % sur 60 langues. Les résultats montrent que la couverture linguistique large et un backbone de raisonnement en anglais suffisent pour transférer cette compétence sans supervision dans chaque langue cible.