RECHERCHE
CRAFT : regrouper les rubriques d'évaluation pour diagnostiquer les faiblesses des LLM et cibler le fine-tuning
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
arXiv cs.AI · cs.LG · cs.CL·Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei·17 juillet 2026

Image · Source originale
CRAFT extrait de chaque couple prompt-rubrique une description de capacité, les regroupe en arbre hiérarchique, puis évalue le modèle à chaque nœud pour identifier les capacités faibles. Ces diagnostics orientent ensuite la génération de données de fine-tuning supervisé ciblées. Testée sur quatre modèles open source, deux domaines professionnels (finance, juridique) et 13 benchmarks, la méthode surpasse le clustering au niveau prompt (EvalTree) et la génération aléatoire non ciblée.