BackTrend : un benchmark pour la prédiction rétrospective de signaux faibles scientifiques
Un nouveau benchmark évalue la capacité des LLM et systèmes RAG à identifier les précurseurs ignorés de domaines scientifiques matures, révélant de sévères lacunes.
arXiv cs.AI · cs.LG · cs.CL·Xiao Zhou, Yilun Zhao, Owen Jiang, Tiansheng Hu·21 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark académique (25 sujets, 66 signaux) accepté à EMNLP 2026 Findings, portée limitée à l'évaluation de systèmes existants.

Image · Source originale
BackTrend propose un benchmark rétrospective pour évaluer la prédiction de signaux faibles scientifiques, ces directions de recherche précoces et sous-estimées qui deviennent centrales. Le jeu de données couvre 25 sujets matures en IA avec 66 signaux faibles validés par des experts. L'évaluation de LLM de pointe, systèmes RAG et agents montre des résultats très faibles : le meilleur système n'atteint que 10,1 % en F1 et 18,5 % en couverture. Le renforcement par recherche web améliore modérément les résultats mais ne comble pas le fossé de performance.