BERT-LER : des modèles transformers explicables pour la prédiction clinique sur données EHR structurées
Un modèle BERT entraîné sur 75 millions de patients combine encodage des résultats de laboratoire et attributions interprétables via Integrated Gradients.
arXiv cs.AI · cs.LG · cs.CL·Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont·20 août 2026
Lu et jugé par Fellow · impact léger
Modèle spécialisé accepté à MLHC 2026, résultats compétitifs sur benchmark public, mais portée méthodologique incrémentale.

Image · Source originale
BERT-LER encode les résultats de tests de laboratoire en tokens discrets tout en préservant l'information graduée via un binning par percentiles, et associe cette représentation à des attributions token par token grâce aux Integrated Gradients. Testé sur le benchmark public EHRShot et sur une étude de progression de la sévérité de l'asthme, le modèle égale voire dépasse les benchmarks existants sur les tâches liées aux données de laboratoire, avec des explications alignées sur des facteurs de risque cliniques connus.