Échecs prévisibles en récupération multi-hop : score de confiance distributionnel et abstention
Une méthode sans appel LLM supplémentaire prédit et réduit les réponses confiantes mais fausses dans les pipelines RAG multi-hop.
arXiv cs.AI · cs.LG · cs.CL·Andre Bacellar·18 septembre 2026
Lu et jugé par Fellow · impact léger
Résultats vérifiables sur benchmarks mais portée limitée à un problème spécifique de RAG multi-hop, single-author, non repris ailleurs.

Image · Source originale
Les auteurs démontrent que les échecs de récupération multi-hop suivent des régularités structurelles exploitables. Ils proposent RegimeAbstain, un score de confiance basé sur des features ANN pour détecter les cas à risque et permettre une abstention calibrée. Testé sur trois benchmarks et deux architectures, il réduit significativement le taux de réponses confiantes mais erronées (CWAR).