BRIE : un benchmark évolutif pour la recherche d'information dans les dossiers de santé électroniques
Des cliniciens valident un framework capable de générer automatiquement des paires question-réponse à partir de dossiers médicaux, offrant une évaluation continue et robuste des LLMs cliniques.
arXiv cs.AI · cs.LG · cs.CL·Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani, Philip Chung·24 septembre 2026
Lu et jugé par Fellow · impact notable
Framework validé par 19 cliniciens générant un benchmark continu (BRIE) pour les LLMs cliniques, montrant des lacunes critiques des modèles état de l'art.

Image · Source originale
Les benchmarks actuels pour l'évaluation des LLMs cliniques sont coûteux à mettre à jour et deviennent vite obsolètes. Cette recherche propose un framework générant automatiquement des paires question-réponse à partir de notes EHR longitudinalles, validé par dix-neuf cliniciens pour créer BRIE. Les tests sur neuf LLMs montrent que les systèmes état de l'art omettent fréquemment des informations cliniques cruciales, surtout lors de la synthèse multi-documents. BRIE permet une évaluation robuste contre la fuite de données et s'actualise en continu.