Toutes les news taguées avec ce sujet.
Analyse empirique de la capacité des agents IA à appliquer correctement les méthodes de vérification et de tests logiciels.
Un nouveau cadre d'évaluation exploite les traces d'exécution pour améliorer le benchmarking d'agents logiciels.
Une étude comparative révèle que les agents LLM peinent à reproduire les cycles de planification itératifs des experts en ML.
Un framework sans référence utilise des LLM comme juges pour évaluer la consistance et la complexité des benchmarks d'agents.