RECHERCHE
PyroDash : inférence collaborative token par token entre petits et grands modèles de langage
Un framework où un petit modèle décide lui-même quand solliciter un LLM, réduisant fortement les coûts d'inférence sans sacrifier la précision.
arXiv cs.AI · cs.LG · cs.CL·Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong·22 juillet 2026

Image · Source originale
PyroDash permet à un SLM d'émettre un token de contrôle pour déléguer une tâche à un LLM figé via un unique transfert, sans routeur externe ni accès aux logits du LLM. Entraîné en trois étapes avec Group Relative Policy Optimization, il équilibre précision et coût. Sur cinq benchmarks de raisonnement mathématique, il atteint jusqu'à 64,04% de précision moyenne tout en réduisant le coût jusqu'à 96%.