Toutes les news taguées avec ce sujet.
Un nouveau testbed évalue les agents IA sur des tâches de développement logiciel interactives et évolutives, révélant un écart important avec les benchmarks classiques.
Une étude sur 49 développeurs montre que les LLM comme GitHub Copilot peinent à évaluer correctement les exigences HIPAA, malgré une satisfaction utilisateur élevée.