TokenCast : prévoir la facture de tokens d'un agent pendant qu'il tourne
Sur la même tâche, deux exécutions d'un agentIA agentiqueModèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.Fiche du lexique peuvent consommer dix fois plus de tokens l'une que l'autre. Un papier propose de chiffrer la dépense en cours de route, sans appeler le modèle une fois de plus.
par gyom 29 septembre 2026 à 10:05 rubrique : IA Agentique
Le constat de départ est mesurable : un agent qui exécute la même tâche consomme, selon les exécutions, plus d'un ordre de grandeur de tokens en plus ou en moins. La raison tient au déroulé lui-même. L'agent choisit son étape suivante d'après ce que lui renvoient ses outils, et le fenêtre de contextecontexteQuantité de tokens qu'un modèle peut lire d'un seul coup, question et réponse comprises. Au-delà, il faut découper, résumer ou chercher ailleurs.Fiche du lexique grossit à chaque tour, donc chaque appel suivant relit tout ce qui précède.
TokenCast apprend une représentation de coût par segment d'exécution. Chaque segment enregistre sa propre consommation et la croissance de contexte qu'il provoque. En composant les segments adjacents, on obtient une estimation cumulative qui compte le fait que le contexte des segments antérieurs est relu par tous les appels suivants. La prévision se rafraîchit avec les observations, sans appel supplémentaire au modèle.
14,5 % d’erreur en moins, 32,8 ms par exécution
- 32,8 ms de temps de prédiction cumulé moyen par exécution sur SWE-bench Verified.
- 14,5 % d'erreur absolue moyenne en moins contre le meilleur comparateur, en moyenne sur 96 combinaisons testées, 4 suites de tâches et 6 modèles d'agent.
- 21,3 % de tokens en moins en moyenne qu'une politique à budget fixe, à taux d'achèvement comparable, en rejeu hors ligne.
Les auteurs publient le code sur GitHub. Pour qui paie des heures de calcul, l'intérêt est direct : savoir où en est la dépense pendant que la tâche tourne, au lieu de la découvrir à la fin.
Source primaire arXiv 2609.35760, TokenCast