Toutes les news taguées avec ce sujet.
Un nouveau dataset évalue la capacité des modèles vision-langage à raisonner sur des incidents routiers réels, au-delà de la simple reconnaissance d'objets.
CoMet propose une méthode d'estimation de l'incertitude dans les LLMs multimodaux en séparant ambiguïté contextuelle et multiplicité des réponses plausibles.