Toutes les news taguées avec ce sujet.
Un nouveau benchmark cherche à contourner la contamination des données pour évaluer plus honnêtement les capacités de recherche des IA.
Une analyse pointe la contamination des données d'entraînement par les réponses des benchmarks, faussant l'évaluation réelle des performances des LLM.