Toutes les news taguées avec ce sujet.
Une étude montre que les LLM-juges ne détectent que partiellement les étapes de raisonnement réellement décisives pour la réponse finale.
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.
Un framework retrieval-grounded génère des scénarios de dialogue réalistes pour étudier les dynamiques d'abus.
Un framework sans référence utilise des LLM comme juges pour évaluer la consistance et la complexité des benchmarks d'agents.