TokenCast : prédire la consommation de tokens des agents LLM en cours d'exécution
Un modèle de coût composable qui affine en temps réel l'estimation de tokens consommés par un agent LLM, sans appel supplémentaire au modèle.
arXiv cs.AI · cs.LG · cs.CL·Chaoqian Ouyang, Ling Yue, Libin Zheng, Huanghui Guo·28 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'estimation de coût pour agents LLM, gains mesurés mais portée limitée à un problème d'ingénierie spécifique.

Image · Source originale
TokenCast apprend une représentation de coût par segment d'exécution, capturant la consommation propre et la croissance de contexte induite pour les appels suivants. La composition de ces segments permet une estimation cumulative rafraîchie au fil de l'exécution, sans coût de calcul LLM additionnel. Sur 96 combinaisons testées (4 suites de tâches, 6 modèles d'agents), la méthode réduit l'erreur moyenne de 14,5% et économise 21,3% de tokens en contrôle de budget hors ligne.