WearableQA : un benchmark pour évaluer le raisonnement santé sur données de wearables réelles
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
arXiv cs.AI · cs.LG · cs.CL·Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy·4 septembre 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark de 4 084 questions sur données réelles évaluant 14 LLM, comblant un manque de tests de raisonnement santé longitudinal.

Image · Source originale
WearableQA propose 4 084 questions à choix multiples construites à partir de séries temporelles de wearables, biomarqueurs sanguins et données démographiques de 200 utilisateurs réels. Il couvre 16 types de questions organisés selon deux axes : raisonnement sur les données vs interprétation physiologique, et signal unique vs multi-signaux. L'évaluation de 14 LLM montre des performances allant de 19,6% à 72,9%, loin d'être résolues.