Toutes les news taguées avec ce sujet.
Un nouveau Transformer multimodal et time-aware capable de modéliser et de prédire l'évolution clinique globale des patients.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
Hugging Face dévoile NeoMME, un encodeur efficace et nativement multimodal pour le multilingue.
Un test de vision par LLM pour identifier des champignons révèle les limites et les risques de ces modèles sur des tâches à enjeu réel.
DeepMind introduit des capacités de compréhension vidéo agentic dans Gemini pour une analyse poussée.
Un nouveau cadre d'apprentissage permet de transférer les modèles de résistance au gel des cépages vers des régions peu documentées.
Un nouveau modèle multimodal expérimental optimisé pour la vision rapide et le traitement dense.
DeepMind met à jour son modèle multimodal Flash avec de nouvelles options de personnalisation pour les développeurs.
Un nouveau benchmark et un moteur de raisonnement allient vidéo, pose et sEMG pour un coaching sportif expert.
Un nouveau framework VDA permet aux MLLMs d'apprendre continuellement sans supervision via l'analyse de la dépendance visuelle.
Un benchmark proposant 300 tâches procédurales et des récompenses vérifiables pour entraîner le raisonnement visuel par génération.
LAION publie 80 millions de vidéos annotées automatiquement, une ressource ouverte massive pour entraîner des modèles vidéo, audio et image.
L'utilisation de capteurs multimodaux et d'algorithmes multi-sorties améliore la prédiction des résultats cliniques post-opératoires.
161 tâches d'interprétation d'images scientifiques révèlent les limites des modèles vision-langage face aux workflows réels de biotech.
DeepSeek publie une API pour un nouveau modèle multimodal, DeepSeek-V4-Flash-Vision-Exp, optimisé pour la vitesse.
Un framework RL avec checklist alignée pour améliorer la qualité factuelle et l'accessibilité des interprétations de rapports médicaux.
NVIDIA propose d'utiliser son framework FLARE pour entraîner des VLMs sur des données distribuées sans centralisation.
Le modèle multimodal léger Kimi-VL-A3B débarque avec des poids ouverts.
Le modèle léger Kimi K1.5 et le multimodal Kimi K3 rejoignent le hub Hugging Face.
Un nouveau modèle multimodal de 397B paramètres combine raisonnement scientifique, usage d'outils et tâches longues via un pipeline d'entraînement unifié.
Un framework qui apprend à améliorer son propre harnais d'agent, testé sur la génération automatique de posters académiques.
Le nouveau LLM d'Elon Musk revendique des performances accrues et une intégration multimodale étendue.
MindTopo évalue la capacité des modèles multimodaux à comprendre et manipuler des relations spatiales complexes comme la connectivité.
SL2T, nouveau modèle de traduction langue des signes vers texte, alimente des fonctionnalités accessibles aux personnes sourdes et malentendantes.
Meta dévoile Muse Glimmer, un modèle multimodal et agentic conçu pour fonctionner localement en open source.
Knowable propose un tutorat IA intégrant la compréhension visuelle pour contextualiser l'apprentissage.
Moonshot AI dévoile Kimi K2.5, un modèle combinant capacités visuelles et agentiques dans un même système.
Une nouvelle méthode de post-entraînement corrige le déséquilibre texte-image dans les modèles multimodaux pour améliorer le raisonnement visuel.
Découvrez le fonctionnement du champ sémantique pour l'indexation et la recherche multimodales dans Elasticsearch.