SILSA : des latents en tranches glissantes pour préserver la topologie en génération 3D haute résolution
Un nouveau framework de génération 3D remplace les tokens voxels coûteux par des tranches glissantes compactes, réduisant drastiquement le coût tout en améliorant la fidélité topologique.
arXiv cs.AI · cs.LG · cs.CL·Tianjiao Yu, Xinzhuo Li, Yifan Shen, Ying Shen·1 octobre 2026
Lu et jugé par Fellow · impact léger
Avancée technique incrémentale en génération 3D, acceptée à NeurIPS 2026, mais portée limitée à un sous-domaine de recherche.

Image · Source originale
SILSA représente les formes 3D via des latents en tranches glissantes selon trois axes canoniques, au lieu de tokens voxels fragmentés. Un Slice VAE encode les surfaces et une supervision topologique aligne les diagrammes de persistance entre tranches voisines. Le framework améliore le PSNR de 8,7%, réduit l'erreur de Betti de 9,2% et utilise jusqu'à 98% de tokens en moins que les approches hiérarchiques.