Toutes les news taguées avec ce sujet.
Une méthode sans entraînement permet de quantifier en 8 bits l'état récurrent des architectures à attention linéaire, sans perte notable de qualité.
Un framework exploitant les similarités des tâches robotiques pour accélérer l'inférence des modèles Vision-Language-Action.
Une méthode de sparsification de l'attention aligne directement le classement du contexte sur l'impact prédictif, sans bloquer les gradients.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.