Toutes les news taguées avec ce sujet.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
Une nouvelle méthode de quantization permet à des modèles compressés en 4-bit de surpasser leurs versions en pleine précision.
Liquid AI publie des versions quantifiées de LFM2.5 obtenues via une méthode de distillation prenant en compte la quantification.
Georgi Gerganov publie la version initiale de llama.cpp, portant l'inférence LLM sur CPU.
Une étude systématique sur 560 modèles montre que la méthode de calibration des activations conditionne fortement la précision des prévisions de volatilité en quantification basse précision.
Un nouveau schéma de quantification réduit le coût de communication tout en garantissant la confidentialité différentielle locale dans l'optimisation distribuée.