LeVJEPA : prétraining vidéo efficace sans heuristiques
LeVJEPA simplifie l'encodage vidéo self-supervisé en éliminant les asymétries architecturales complexes, offrant une meilleure efficacité calculatoire.
arXiv cs.AI · cs.LG · cs.CL·Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec·27 août 2026
Lu et jugé par Fellow · impact notable
Papier de recherche validé par arXiv avec gains mesurés (x20 d'efficacité) et avancée technique concrète sur l'encodage vidéo.

Image · Source originale
LeVJEPA est un encodeur vidéo entraîné sous l'objectif sans effondrement de LeJEPA, se passant d'EMA et de stop-gradient. Il utilise une perte d'invariance sur des vues globales et locales, régularisée par SIGReg. Cette approche réduit drastiquement les coûts de prétraining tout en surpassant V-JEPA 2 et en permettant l'usage d'attention bloc-causale sans perte de précision.