La dure leçon de l'appel d'outils : le code surpasse le JSON pour les agents LLM
Une étude compare le tool calling programmatique au JSON classique sur 14 modèles et montre une supériorité nette sur BFCL v4.
arXiv cs.AI · cs.LG · cs.CL·Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah·6 août 2026

Image · Source originale
Les chercheurs comparent l'appel d'outils programmatique (via scripts Python typés) au tool calling JSON natif sur le benchmark BFCL v4, avec 14 LLM testés. Le mode programmatique égale ou dépasse le JSON dans 11 modèles sur 14, avec un gain de 10,6% pour la famille GPT-5.6. Il reste aussi plus stable en cas de fan-out parallèle et de dégradation contextuelle.