Un benchmark pour évaluer les LLM sur la revue de documents normatifs chinois GB/T
GB/T-Bench teste la capacité des LLM à détecter des erreurs structurelles et normatives dans des standards nationaux chinois, un exercice jusqu'ici réservé aux experts humains.
arXiv cs.AI · cs.LG · cs.CL·Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin·6 août 2026

Image · Source originale
Les chercheurs présentent GB/T-Bench, premier benchmark pour la revue structurée de documents normatifs nationaux (standards GB/T chinois), avec une taxonomie de 25 types d'erreurs diagnosticables. Un mécanisme de génération de contre-exemples produit 7 306 instances d'erreurs à partir de 488 documents. Ils proposent aussi GB/T-Reviewer, un framework multi-agents combinant inspection globale et diagnostic ciblé.