Toutes les news taguées avec ce sujet.
Les modèles vision-langage s'améliorent vite, mais leurs benchmarks stagnent : SABRE automatise la création de tests difficiles et révèle des lacunes majeures.