De la confusion à la clarté : récupération et injection de connaissances sensibles à la confusion pour la classification de texte
Un framework identifie les paires d'étiquettes que les LLM confondent et génère des règles ciblées pour les départager, sans fine-tuning.
arXiv cs.AI · cs.LG · cs.CL·Manish Gupta, Chaitanya Giri, Jayasimha Talur·1 septembre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche académique avec protocole expérimental et gains chiffrés, sans produit disponible.

Image · Source originale
Face à des taxonomies comportant de nombreuses étiquettes sémantiquement proches, les LLM peinent à distinguer les candidats retenus par récupération top-K. Le framework proposé repère les paires d'étiquettes confondues, élargit l'ensemble de candidats et génère des règles de différenciation sans fine-tuning. Sur trois benchmarks (WOS, Flipkart, LEDGAR), le gain atteint 10 points de Macro F1, et les règles se transfèrent à des modèles plus petits (2B-20B) avec jusqu'à 11,5 points d'amélioration.