RECHERCHE
ClinFusion : un MLLM centré vision pour la compréhension médicale globale
Un nouveau modèle multimodal médical unifie imagerie 2D/3D et surpasse GPT-5.2 et Gemini-3-Flash sur la plupart des benchmarks testés.
arXiv cs.AI · cs.LG · cs.CL·Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu·27 juillet 2026

Image · Source originale
ClinFusion propose un encodeur visuel en cascade capable de traiter conjointement des images médicales 2D et 3D natives, ainsi qu'un cadre d'évaluation ancré dans la pratique clinique (MedIF-Bench, évaluation par région d'intérêt). Le modèle établit un nouvel état de l'art sur 20 des 24 benchmarks médicaux multimodaux testés, devançant des modèles open-source comme Hulu-Med et Lingshu, ainsi que des modèles propriétaires comme GPT-5.2 et Gemini-3-Flash sur 13 des 16 comparaisons.