Last Translation Benchmark : un test évolutif pour piéger les modèles de traduction automatique
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
arXiv cs.AI · cs.LG · cs.CL·Vilém Zouhar, Niyati Bafna, Mukund Choudhary, Maike Züfle·3 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark collaboratif proposé, sans résultats de test sur des modèles ni classement encore publiés dans l'extrait disponible.

Image · Source originale
Face à la saturation des benchmarks classiques et aux limites des métriques automatiques et de l'évaluation humaine, des chercheurs proposent le Last Translation Benchmark. Ce jeu de données évolutif compile des exemples textuels, visuels, audio et vidéo rédigés par des humains et revus par des pairs, accompagnés de règles de vérification précises pour chaque cas d'échec. La première version, LTBv1, intègre les contributions validées avant septembre 2026, avec des mises à jour continues prévues.