RECHERCHE
GAMUT : évaluer la complétude factuelle par méta-rubriques
Un nouveau cadre et benchmark pour mesurer la complétude factuelle des générations longues via des méta-rubriques à deux niveaux.
arXiv cs.AI · cs.LG · cs.CL·Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon·21 juillet 2026

Image · Source originale
Ce papier introduit GAMUT, un benchmark pour évaluer la complétude factuelle des générations longues, un aspect souvent négligé au profit de la seule précision. Le framework repose sur des méta-rubriques à deux niveaux structurant le contenu attendu, compilées ensuite en checklists binaires. Testé sur 14 modèles frontière et open-weights avec des données textuelles et d'imagerie wearable, il révèle des lacunes de couverture significatives.