Combien de tokens brûle vraiment un agent
Le même agentIA agentiqueModèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.Fiche du lexique, la même tâche, et une facture qui varie d'un facteur dix. Le papier TokenCast attaque le sujet par la mesure plutôt que par l'estimation à vue.
par gyom 29 septembre 2026 à 11:30 rubrique : IA Agentique
Un agent qui boucle sur des outils coûte cher pour une raison mécanique : chaque nouveau tour relit l'intégralité de ce qui précède. La dépense ne suit donc pas le nombre d'étapes linéairement, elle grandit avec le carré de la longueur du déroulé. C'est ce qui rend un devis de tokens établi avant exécution à peu près inutile.
Un coût par segment, révisé à chaque observation
L'idée de TokenCast est de découper l'exécution en segments et d'apprendre, pour chacun, deux choses : ce qu'il consomme lui-même, et de combien il fait grossir le fenêtre de contextecontexteQuantité de tokens qu'un modèle peut lire d'un seul coup, question et réponse comprises. Au-delà, il faut découper, résumer ou chercher ailleurs.Fiche du lexique pour la suite. Une fois qu'on sait cela, la dépense d'un segment dépend de ce qui a été dit avant lui, donc composer les segments donne une estimation cumulative, et non une somme de coûts indépendants.
L'estimation se révise à chaque observation nouvelle, sans rappeler le modèle. C'est le point qui distingue l'approche d'une prédiction faite une fois pour toutes : la facture est corrigée pendant la course, pas après l'arrivée.
21,3 % de tokens en moins qu’un budget fixe
- Sur SWE-bench Verified, le temps de prédiction cumulé moyen est de 32,8 ms par exécution.
- Sur 96 combinaisons évaluées, soit 4 suites de tâches croisées avec 6 modèles d'agent, l'erreur absolue moyenne baisse de 14,5 % en moyenne face au meilleur comparateur.
- En rejeu de contrôle de budget hors ligne, la politique guidée par TokenCast consomme 21,3 % de tokens en moins qu'une politique à budget fixe, à tracetrace d'exécutionJournal détaillé d'une exécution d'agent : appels, arguments, résultats, erreurs. C'est la pièce à conserver quand un agent échoue, et la seule façon de savoir ce qu'il a vraiment fait.Fiche du lexique d'achèvement comparable.
Le code est publié sur le dépôt GitHub de l'équipe. Auteurs : Chaoqian Ouyang, Ling Yue, Libin Zheng, Huanghui Guo, Shengxiang Xu, YiShu Wang, Ran Li, Jian Yin, Shaowu Pan et Shimin Di.
Sur une tour à une carte, le temps passe avant l’argent
Sur une tour avec une seule carte graphique, le temps de calcul est souvent la ressource rare avant l'argent. Savoir qu'une tâche va consommer quatre fois plus que prévu permet de l'arrêter au bon moment, ou de la découper différemment. La question rejoint celle du suivi de consommation, où l'on est souvent réduit à lire un compteur après coup.
Source primaire arXiv 2609.35760, TokenCast