PANORAMA : légendage panoptique ancré par sélection de masques
PANORAMA améliore l'ancrage pixel des légendes VLM via la sélection de masques conditionnels et un benchmark dédié.
arXiv cs.AI · cs.LG · cs.CL·Sara Pieri, Evangelos Kazakos, Shizhe Chen, Josef Sivic·16 septembre 2026
Lu et jugé par Fellow · impact léger
Publication d'une méthode de recherche (PANORAMA) et d'un benchmark (PanoCaps) pour l'ancrage d'images, sans implémentation commerciale.

Image · Source originale
PANORAMA est une approche de panoptic grounded captioning qui formule l'ancrage de phrases comme une sélection de propositions de masques conditionnelles. Le modèle couple génération de légendes et segmentation précise pour couvrir objets et arrière-plan. Les auteurs introduisent aussi PanoCaps, un benchmark et une métrique gPQ pour évaluer conjointement cohérence textuelle et masques.