Rollplex : partage spatial de GPU entre phases pour le post-entraînement de modèles vision-langage
Un nouveau runtime accélère le RL post-training des VLM en chevauchant traitement de préfixe et décodage de rollout sur GPU.
arXiv cs.AI · cs.LG · cs.CL·Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao·14 août 2026
Lu et jugé par Fellow · impact léger
Optimisation technique d'un runtime pour accélérer le post-entraînement VLM sur GPU H800 avec gains mesurés (1,23x à 2,24x).

Image · Source originale
Rollplex est un runtime qui fusionne les phases de scoring de référence et d'entraînement en déplaçant le calcul du préfixe dans la fenêtre de décodage du rollout, exploitant le fait que ce calcul est indépendant de la réponse générée. Il introduit une gestion mémoire consciente des phases et un partage de poids adapté au parallélisme tensoriel pour éviter une duplication complète des poids de l'acteur. Testé sur 32 GPU H800 avec Qwen2.5-VL-32B, il obtient un gain de 1,23x.