Fuse : raisonnement social vérifiable pour assistants LLM
Un framework de simulation multi-agent valide le raisonnement social des LLM via des motifs cachés vérifiables.
arXiv cs.AI · cs.LG · cs.CL·Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish·15 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark/framework d'évaluation avec validation humaine, mais reste une contribution méthodologique incrémentale sans déploiement concret.

Image · Source originale
Fuse est un framework de simulation multi-agent évaluant le raisonnement social des LLM dans des contextes d'assistance. Il utilise un agent aux motifs cachés pour fournir une vérité terrain vérifiable, contournant le subjectivité des récits utilisateurs. Les tests sur 12 LLM montrent une sensibilité aux biais de formulation et une dépendance accrue aux détails par rapport aux humains.