Toutes les news taguées avec ce sujet.
Un framework robuste qui personnalise les modèles de recherche par région au niveau des gradients, évitant l'effondrement des transformers.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.
L'acteur américain Peter Cullen, célèbre pour avoir doublé Optimus Prime dans la franchise Transformers, s'est éteint à l'âge de 85 ans.
Une nouvelle borne mathématique définit l'erreur minimale atteignable par le fine-tuning LoRA en fonction du rang.
Une exploration pédagogique des mécanismes fondamentaux derrière les grands modèles de langage.
Un modèle BERT entraîné sur 75 millions de patients combine encodage des résultats de laboratoire et attributions interprétables via Integrated Gradients.
Une thèse théorique propose un second paramètre linguistique, la phase, absent des transformers actuels et clé pour comprendre allusion, ironie et citation.
Une étude explore comment faire porter au texte généré une preuve vérifiable de l'état interne du modèle qui l'a produit.
Une revue méthodologique évalue les techniques CAM pour CNNs, Transformers et modèles de fondation.
Une analogie exacte de la règle de Born pour l'attention softmax sur le simplexe probabiliste.
L'architecture actuelle des LLMs atteint ses limites. Plusieurs acteurs proposent des approches radicales pour réduire les coûts et améliorer le raisonnement.
Une étude montre que les modèles entraînés avec l'optimiseur Muon apprennent plus vite mais perdent leur généralisation après le grokking.