L'agent dit avoir fini, la base de données dit le contraire
Un appel d'outiltool call · function callingRequête structurée qu'un modèle adresse à un programme extérieur : recherche, calcul, terminal, base de données. Le modèle ne fait pas l'action, il demande qu'elle soit faite, et lit ce qui revient.Fiche du lexique bien formé ne prouve rien. Sur 507 flux de travail métier exécutés vingt fois chacun, un banc signé Microsoft et Hugging Face note les agents sur l'état final qu'ils laissent dans la base, pas sur la phrase qu'ils rendent : sur 121 680 tentatives valides, 79 853 échouent aux contrôles exécutables, et les deux tiers de ces échecs se terminent proprement, sans erreur signalée.
par Gyom 4 octobre 2026 à 13:01 4 min de lecture rubrique : Vérifier et protéger
etiquettes : En entreprise
Un agentIA agentiqueModèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.Fiche du lexique qui écrit « votre demande est résolue » peut laisser un dossier ouvert. Le banc ThinkingBox, publié le 3 octobre par Microsoft et Hugging Face, part de ce constat : la réponse finale et les appels d'outils bien formés ne sont que des indices, seul l'état laissé derrière tranche. Chaque tâche démarre d'un backend propre, tourne vingt fois de suite dans une session d'outils isolée, puis un extracteur relève ce qui a réellement changé et des juges déterministes le comparent à l'état attendu.
Deux tiers des échecs ne signalent aucune erreur
Sur l'ablation de référence, 121 680 tentatives valides réparties sur douze modèles, 79 853 échouent aux contrôles exécutables. Leur trajectoire ne le laisse pas voir :
- 67,24 % se terminent proprement, appellent un outil qui modifie l'état et ne rapportent aucune erreur d'outil.
- 77,61 % portent une valeur de champ fausse.
- 43,30 % laissent un effet supplémentaire non voulu.
- 25,36 % oublient un effet requis.
Les catégories se recouvrent : un même échec peut cumuler une valeur fausse et un effet en trop. Un juge qui ne regarde que la forme des appels d'outils, ou que la phrase finale, laisse donc passer ces tentatives pour des réussites.
Un modèle qui réussit une fois sur vingt ne fait pas un agent fiable
Chaque tâche est rejouée vingt fois, et le banc publie trois nombres : pass@1, la part de toutes les tentatives réussies ; pass@20, les tâches résolues au moins une fois ; et le 20 sur 20 observé, les tâches réussies aux vingt exécutions. Claude Opus 5.5 mène le classement à 67,16 % en pass@1, et Kimi-K3 est le meilleur modèle à licence des poidspoids ouvertsConditions attachées aux fichiers de poids d'un modèle, distinctes de la licence du code qui les fait tourner. Des poids dits ouverts n'impliquent pas un logiciel libre : redistribution, usage commercial et entraînement dérivé varient d'un modèle à l'autre.Fiche du lexique à 57,37 %. L'écart entre réussir une fois et réussir à chaque fois est le sujet :
- Kimi-K3 résout 93,89 % des tâches au moins une fois, mais 13,41 % seulement à toutes les vingt tentatives.
- Claude Opus 5 résout moins de tâches au moins une fois, 79,09 %, mais en passe 47,53 % aux vingt tentatives.
- Claude Opus 5.5 gagne 0,66 point en pass@1 sur Claude Opus 5 et passe exactement le même nombre de tâches vingt fois sur vingt, 241.
Trois modèles seulement gardent la majeure partie de leur score en répétant : GPT-6 Astra retient 78 % de son taux d'un seul passage, Claude Opus 5.5 et Claude Opus 5 en retiennent 71 %, quand GLM-5.1, Kimi-K2.6 et DeepSeek-V4-Pro n'en gardent qu'environ 8 %. Le domaine pèse autant que le modèle : Claude Opus 4.6 marque 68,62 % en commerce de détail et 8,30 % en assurance automobile, et la moyenne du banc tombe à 59,52 % en détail contre 33,83 % en assurance automobile.
Le coût d'une tâche fiable va de 6,80 à 24,36 dollars
En tarifant l'usage relevé sur OpenRouter aux prix publics, le banc calcule deux choses : le coût par tentative réussie, et le coût par tâche fiable, c'est-à-dire la campagne de vingt passages divisée par les tâches réussies vingt fois sur vingt. Le moins cher pour obtenir une bonne réponse n'est donc pas le moins cher pour obtenir une réponse sur laquelle on peut compter :
- GPT-5.4 est le moins cher par tâche fiable à 6,80 dollars, mais sur 128 tâches seulement.
- GPT-6 Astra atteint 231 tâches à 7,45 dollars, et Claude Opus 5.5 le maximum du banc, 241 tâches, à 7,80 dollars.
- Claude Opus 5 passe les mêmes 241 tâches à 13,30 dollars l'unité.
- Le moins cher par réussite isolée, GPT-5.6 Sol à 0,127 dollar, coûte 9,76 dollars par tâche fiable, et Qwen3.8-27B ferme la liste à 24,36 dollars.
Quatre échecs sur cinq sont des outils mal repris, pas du raisonnement
Le banc attribue à chaque échec une signature de panne unique. La dominante n'est pas le raisonnement : manipulation des outils 79,9 % des échecs, mise à jour d'état fausse 10,3 %, demande client non résolue 7,0 %, aucune action modifiant l'état 2,9 %. Le schéma est net.
- L'agent va assez loin pour tenter le flux, puis ne se relève pas d'une erreur d'outil, d'une précondition non remplie ou d'une recherche vide.
- C'est un problème de reprise sur erreur avant d'être un problème de modèle, à traiter par le classement des erreurs d'outil et la réduction de la surface d'outils exposée.
Le banc est public, et l'état se vérifie avant de valider
ThinkingBox est disponible sur Hugging Face, l'environnement derrière l'interface OpenEnv et le jeu de données sous licence CDLA-Permissive-2.0, le code sous licence MIT. Sur les 507 tâches, 477 sont jugées sur l'état seul et 30 ajoutent des grilles de réponse en oui ou non. Le banc a été construit par l'équipe Copilot Studio de Microsoft avec Toloka. La conclusion tient en une phrase : vérifier l'état final avant de valider, pas le résumé qu'en fait le modèle.
Source primaire Microsoft et Hugging Face, banc ThinkingBox