Les LLM récupèrent-ils les données moléculaires par cœur ?
Une étude auditant 22 modèles frontières révèle un phénomène massif de mémorisation littérale sur les benchmarks de propriétés moléculaires.
arXiv cs.AI · cs.LG · cs.CL·Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich·4 septembre 2026
Lu et jugé par Fellow · impact notable
Audit méthodologique de 22 modèles révélant une contamination par mémorisation qui fausse les benchmarks moléculaires existants.

Image · Source originale
Ce papier audite 22 LLMs sur 12 benchmarks de régression moléculaire pour détecter la récupération verbatim de valeurs publiées. Ce phénomène est répandu mais spécifique aux datasets et amplifié par le raisonnement. La suppression de la retrieval réduit les écarts de performance entre modèles.