Toutes les news taguées avec ce sujet.
Hugging Face publie la troisième partie de sa série sur le profilage PyTorch, focalisée sur les mécanismes d'attention et leur analyse de performance.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
Des chercheurs identifient pourquoi certaines méthodes de linéarisation préservent mieux la qualité des LLMs, avec des résultats probants jusqu'à 32B paramètres.
Une nouvelle architecture d'attention combinant filtrage spectral et convolution de graphes surpasse l'attention linéaire classique pour le débruitage.