Toutes les news taguées avec ce sujet.
Un nouveau modèle vision-langage de 3 milliards de paramètres, optimisé pour l'instruction et disponible en open-weights.
NVIDIA montre comment des agents de codage automatisés accélèrent l'adaptation de modèles de raisonnement visuel pour la production vidéo.
Des chercheurs de l'EPFL utilisent l'IA générative pour créer des stimuli visuels optimisés capables d'activer au maximum une zone précise du cerveau.
Un nouveau modèle Vision-Language-Action permet aux robots d'opérer depuis n'importe quel angle de caméra sans nécessiter de calibration extrinsèque préalable.
Un projet open-source qui donne aux LLMs la capacité d'analyser des vidéos en temps réel, sans dépendre d'API multimodales natives.
Deux régulariseurs de sparsité améliorent la monosémantique des SAEs Top-k sans dégradation de reconstruction, ouvrant la voie à une meilleure interprétabilité des modèles de vision.