Jeu log(N) sur Wikipedia : efficacité de la communication entre modèles frontières
Évaluation de l'efficacité communicative de six LLM dans un jeu de questions-réponses à asymétrie d'information.
arXiv cs.AI · cs.LG · cs.CL·Peter Potash·16 septembre 2026
Lu et jugé par Fellow · impact notable
Évaluation comparative rigoureuse et coûteuse de 6 modèles frontières via un protocole précis.

Image · Source originale
Cette étude évalue six modèles frontières via un jeu à deux agents sur des résumés Wikipedia. Un modèle doit identifier une cible en log2(N) questions binaires, mesurant sa capacité à communiquer avec lui-même. GLM-5.3, GPT-5.6 Sol, Grok 4.6 et Gemini 3.8 Flash dominent largement Claude Opus 5, dont les performances sont inférieures.