Toutes les news taguées avec ce sujet.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Les métriques classiques comme ROUGE échouent à capturer l'utilité réelle pour l'utilisateur. Une étude introduit l'évaluation par persona.