Toutes les news taguées avec ce sujet.
Une plate-forme 'end-to-end' dédiée à l'entraînement et à l'inférence de modèles à poids ouverts.
Une architecture MoE hétérogène réduit les coûts d'entraînement sans perte de performance.
Kent Beck compare l'entraînement des LLM à la pâtisserie pour rendre le processus plus intuitif et accessible.
Un billet technique distingue l'optimalité théorique du compute (à la Chinchilla) des contraintes réelles d'un cluster de calcul.