QuranicMMLU : un benchmark cognitif pour évaluer l'IA générative sur la langue coranique
Un nouveau benchmark de 980 questions révèle un écart marqué entre précision en QCM et qualité des réponses ouvertes chez les LLM sur l'arabe coranique.
arXiv cs.AI · cs.LG · cs.CL·Rawan El Ghali, Umm Kulsoom, Anas Madkoor, Dima Faris Alsaudi·18 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark de niche (arabe coranique) avec dataset et méthodologie vérifiables, mais portée d'usage limitée.

Image · Source originale
QuranicMMLU propose une taxonomie en cinq piliers (phonologie, morphologie, syntaxe, sémantique, pragmatique) et 31 sous-catégories pour évaluer finement les compétences linguistiques des LLM sur le Coran. Sur 980 questions révisées manuellement, un modèle spécialisé islamique arrive en tête parmi 12 systèmes testés. Les scores moyens atteignent 84% en QCM contre seulement 60% en réponses ouvertes, montrant que le format à choix multiples masque des lacunes réelles.