Toutes les news taguées avec ce sujet.
Une démo Hugging Face fait tourner un modèle quantifié en 1 bit dans le navigateur grâce à WebGPU, sans serveur ni backend.
Un article technique explore comment entraîner des modèles en RL avec le format de quantification NVFP4 sans sacrifier la stabilité de l'entraînement.
OrbitQuant propose une quantification post-entraînement agnostique aux données pour les DiTs, atteignant l'état de l'art jusqu'en W2A4 sur FLUX.1, Wan 2.1 et CogVideoX.