Toutes les news taguées avec ce sujet.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Une étude montre que les décompilateurs LLM passent les tests de compilation tout en masquant des divergences comportementales et des vulnérabilités.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
Une méthode en trois phases corrige le problème de gonflement des prompts des optimiseurs évolutionnaires comme GEPA, avec des gains de précision et des prompts plus courts.
Anthropic publie et documente les évolutions des system prompts de Claude, révélant de nouvelles restrictions sur le copyright et le style de réponse.
La startup espagnole revendique un nouveau modèle de 438 milliards de paramètres, présenté comme la référence européenne en IA générative.
Un framework identifie les paires d'étiquettes que les LLM confondent et génère des règles ciblées pour les départager, sans fine-tuning.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Un nouveau framework RAG identifie les tokens décisifs pendant la génération pour déclencher une récupération de contexte plus précise et efficace.
Deux nouvelles variantes de Claude 5.1 font leur apparition, sans détails précis sur leurs différences fonctionnelles.
Une preuve théorique fixe des bornes infranchissables à la capacité de tout LLM à déduire le sens d'un texte sans contexte extralinguistique.
Une étude publiée dans Nature Human Behaviour alerte sur l'homogénéisation des usages linguistiques induite par les grands modèles de langage.
Un système de mémoire persistante que l'agent LLM installe lui-même dans son environnement, sans base de données externe.
Une méthode symbolique légère filtre les réponses candidates générées par LLM sur des graphes de connaissances incomplets, sans passer par des requêtes exécutables.
Une étude montre que les LLM peuvent récupérer une information financière avec précision sans que celle-ci influence réellement leur jugement d'investissement.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
Un framework qui organise les prévisions multivariées autour de concepts lisibles générés par LLM, sans annotation manuelle coûteuse.
Un article explore le décalage entre la communication écrite d'Anthropic et le style caractéristique de son propre modèle, Claude.
Une étude teste les LLM sur la génération de passeports produits numériques (DPP) et d'analyses d'impact GDPR (DPIA), avec des résultats mitigés.
Une comparaison rigoureuse de sept politiques d'éviction de cache sémantique révèle que LFU domine, mais que le vrai problème est ailleurs.
Une étude méthodologique montre que plusieurs preuves d'auto-amélioration des LLM sont en réalité des artefacts de mesure, une fois comparées à un modèle témoin figé.
Un système à trois agents combine chatbot, traitement de données et prédiction pour anticiper les choix de mode de transport selon la météo.
Des chercheurs Intel montrent comment plusieurs PC IA modestes peuvent faire tourner ensemble un LLM 70B via du parallélisme pipeline optimisé.
Un article de synthèse examine comment l'IA transforme la recherche mathématique, entre outils de démonstration et nouveaux usages.
Une étude théorique propose un cadre formel pour décider quelles informations transmettre lors du passage d'une session à une autre dans les applications LLM.
Un nouveau framework injecte des directions de décodeur SAE dans un LLM pour produire directement des explications en langage naturel des features apprises.
Un framework combine RAG et LLM pour générer automatiquement des modèles diagnostiques hiérarchiques de systèmes complexes, testé sur un réacteur nucléaire.
Trois nouveaux modèles à prix variables, avec une fenêtre de contexte d'un million de tokens et de fortes ambitions agentiques.
Une nouvelle méthode détecte les prédictions confiantes mais fragiles des LLM en perturbant leurs mécanismes d'attention.
Face à la concentration des ressources et des modèles frontières chez les entreprises privées, les chercheurs universitaires en IA redéfinissent leur rôle.