Au-delà de l'essai-erreur : une optimisation agentique pour l'adhérence image-vers-vidéo
Un framework agentique combine LLM multimodal et optimisation bayésienne pour piloter la génération vidéo I2V sans essais aléatoires.
arXiv cs.AI · cs.LG · cs.CL·Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert·12 août 2026

Image · Source originale
Les modèles Image-to-Video en boîte noire souffrent d'instabilité et nécessitent des essais-erreurs coûteux. Le framework « Agentic Self-Improvement » optimise en deux étapes : un mLLM affine le prompt via des évaluations sémantiques (DSG, CMQ), puis une optimisation bayésienne ajuste seeds et CFG scale. Les vidéos générées sont préférées à 69% face aux méthodes de recherche non guidée.