Un cadre visuel pour l'auto-post-entrainement continu multimodal
Un nouveau framework VDA permet aux MLLMs d'apprendre continuellement sans supervision via l'analyse de la dépendance visuelle.
arXiv cs.AI · cs.LG · cs.CL·Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai·26 août 2026
Lu et jugé par Fellow · impact notable
Le papier propose une méthode algorithmique (VDA) validée expérimentalement pour résoudre l'oubli catastrophique en apprentissage continu non supervisé.

Image · Source originale
Ce papier introduit le MU-CPT, une tâche d'auto-post-entrainement continu pour MLLMs sur des données non labellisées. Le framework VDA (Visual Dependence-Aware) utilise la structure de dépendance visuelle pour prévenir l'oubli catastrophique et guider l'apprentissage de nouvelles tâches. Les expériences valident l'efficacité de cette approche pour maintenir stabilité et plasticité.