RECHERCHE
Généralisation de domaine simple pour la détection de falsification d'images au niveau pixel dans les VLM modernes
Une méthode d'entraînement simple améliore la détection de retouches générées par ChatGPT, Gemini ou Qwen-Image, avec une robustesse accrue hors distribution.
arXiv cs.AI · cs.LG · cs.CL·Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat·20 juillet 2026

Image · Source originale
Les auteurs proposent un cadre d'entraînement combinant échantillonnage équilibré des minibatchs et injection tardive de données issues de nouveaux VLM générateurs d'images. Cette approche vise à détecter les falsifications au niveau pixel de manière robuste face à des modèles variés comme ChatGPT, Gemini ou Qwen-Image. Le framework surpasse largement l'état de l'art précédent, PIXAR, malgré sa simplicité conceptuelle.