Toutes les news taguées avec ce sujet.
Dan Luu passe au crible les pratiques de test des agents de codage IA et interroge la fiabilité des benchmarks LLM actuels.
Un nouveau consortium allemand publie Soofi S, un modèle open de 30 milliards de paramètres qui surpasse les benchmarks en anglais et en allemand.
Une étude évalue la capacité des grands modèles de langage à analyser et comprendre en profondeur les papiers scientifiques en architecture informatique.
Un thread Hacker News interroge la communauté sur l'existence de benchmarks fiables pour évaluer la sécurité des grands modèles de langage.
Ethan Mollick documente l'accélération des capacités des grands modèles d'IA, désormais capables d'exécuter seuls des semaines de travail d'ingénierie.
Une analyse critique des pratiques de benchmarking dans l'industrie des bases de données, entre biais méthodologiques et marketing trompeur.