CaliBench : les dynamiques stochastiques des modèles de monde vidéo sont-elles physiquement calibrées ?
Un nouveau benchmark révèle que les modèles vidéo génératifs concentrent leurs sorties sur peu d'issues au lieu de reproduire des distributions physiques réelles.
arXiv cs.AI · cs.LG · cs.CL·Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan·17 août 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark avec méthode et métrique publiées, testant des modèles industriels sur un défaut physique précis.

Image · Source originale
CaliBench évalue les modèles de monde vidéo sur des espaces d'issues discrets et physiquement interprétables (dés, cartes, roulette) dont la distribution de référence est connue exactement. Les chercheurs distinguent scorabilité et calibration, testées sur six modèles image-to-video dont WAN-2.7, Veo 3.1 et Runway Gen-4.5. Résultat : la plupart des combinaisons scène-modèle sont significativement mal calibrées, les modèles concentrant la probabilité sur peu d'issues.