Toutes les news taguées avec ce sujet.
Une optimisation d'inférence 35x plus rapide permet désormais le streaming vidéo génératif en temps réel et interactif.
GeoNeXt réutilise des modèles vidéo pré-entraînés pour estimer profondeur et normales de surface, avec bien moins de données que les approches concurrentes.
CLAP unifie les espaces d'action robots et humains pour générer des vidéos prédisant la physique en zero-shot.
Le filtrage de données accélère l'entraînement et booste les performances des modèles vidéo.
ReWorld sépare contrôle et mémoire pour un streaming vidéo temps réel sur de longs horizons.
Un nouveau benchmark révèle que les modèles vidéo génératifs concentrent leurs sorties sur peu d'issues au lieu de reproduire des distributions physiques réelles.
Le spécialiste des 'world models' pourrait être acquis pour un montant record.
Un nouveau framework transforme les vidéos en graphes de connaissances exploitables par des agents créatifs pour un raisonnement et un montage cinématographique.