IAGentic

Journal de veille sur l'usage appliqué de l'IA, chez soi et en entreprise : ce qu'on lui fait faire, ce qu'il faut pour commencer, ce que ça coûte et où ça casse.

benchmark

L'agent dit avoir fini, la base de données dit le contraire

Un appel d'outiltool call · function callingRequête structurée qu'un modèle adresse à un programme extérieur : recherche, calcul, terminal, base de données. Le modèle ne fait pas l'action, il demande qu'elle soit faite, et lit ce qui revient.Fiche du lexique bien formé ne prouve rien. Sur 507 flux de travail métier exécutés vingt fois chacun, un banc signé Microsoft et Hugging Face note les agents sur l'état final qu'ils laissent dans la base, pas sur la phrase qu'ils rendent : sur 121 680 tentatives valides, 79 853 échouent aux contrôles exécutables, et les deux tiers de ces échecs se terminent proprement, sans erreur signalée.

par Gyom 4 octobre 2026 à 13:01 4 min de lecture rubrique : Vérifier et protéger

etiquettes : En entreprise

Une haute armoire de tiroirs nus vue de face, traversée par de gros tuyaux nervurés, quelques tiroirs laissés ouverts et une bande transporteuse qui passe dessous, sur une trame d'imprimerie crème, magenta et moutarde.

Un agentIA agentiqueModèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.Fiche du lexique qui écrit « votre demande est résolue » peut laisser un dossier ouvert. Le banc ThinkingBox, publié le 3 octobre par Microsoft et Hugging Face, part de ce constat : la réponse finale et les appels d'outils bien formés ne sont que des indices, seul l'état laissé derrière tranche. Chaque tâche démarre d'un backend propre, tourne vingt fois de suite dans une session d'outils isolée, puis un extracteur relève ce qui a réellement changé et des juges déterministes le comparent à l'état attendu.

Deux tiers des échecs ne signalent aucune erreur

Sur l'ablation de référence, 121 680 tentatives valides réparties sur douze modèles, 79 853 échouent aux contrôles exécutables. Leur trajectoire ne le laisse pas voir :

Les catégories se recouvrent : un même échec peut cumuler une valeur fausse et un effet en trop. Un juge qui ne regarde que la forme des appels d'outils, ou que la phrase finale, laisse donc passer ces tentatives pour des réussites.

Un modèle qui réussit une fois sur vingt ne fait pas un agent fiable

Chaque tâche est rejouée vingt fois, et le banc publie trois nombres : pass@1, la part de toutes les tentatives réussies ; pass@20, les tâches résolues au moins une fois ; et le 20 sur 20 observé, les tâches réussies aux vingt exécutions. Claude Opus 5.5 mène le classement à 67,16 % en pass@1, et Kimi-K3 est le meilleur modèle à licence des poidspoids ouvertsConditions attachées aux fichiers de poids d'un modèle, distinctes de la licence du code qui les fait tourner. Des poids dits ouverts n'impliquent pas un logiciel libre : redistribution, usage commercial et entraînement dérivé varient d'un modèle à l'autre.Fiche du lexique à 57,37 %. L'écart entre réussir une fois et réussir à chaque fois est le sujet :

Trois modèles seulement gardent la majeure partie de leur score en répétant : GPT-6 Astra retient 78 % de son taux d'un seul passage, Claude Opus 5.5 et Claude Opus 5 en retiennent 71 %, quand GLM-5.1, Kimi-K2.6 et DeepSeek-V4-Pro n'en gardent qu'environ 8 %. Le domaine pèse autant que le modèle : Claude Opus 4.6 marque 68,62 % en commerce de détail et 8,30 % en assurance automobile, et la moyenne du banc tombe à 59,52 % en détail contre 33,83 % en assurance automobile.

Le coût d'une tâche fiable va de 6,80 à 24,36 dollars

En tarifant l'usage relevé sur OpenRouter aux prix publics, le banc calcule deux choses : le coût par tentative réussie, et le coût par tâche fiable, c'est-à-dire la campagne de vingt passages divisée par les tâches réussies vingt fois sur vingt. Le moins cher pour obtenir une bonne réponse n'est donc pas le moins cher pour obtenir une réponse sur laquelle on peut compter :

Quatre échecs sur cinq sont des outils mal repris, pas du raisonnement

Le banc attribue à chaque échec une signature de panne unique. La dominante n'est pas le raisonnement : manipulation des outils 79,9 % des échecs, mise à jour d'état fausse 10,3 %, demande client non résolue 7,0 %, aucune action modifiant l'état 2,9 %. Le schéma est net.

Le banc est public, et l'état se vérifie avant de valider

ThinkingBox est disponible sur Hugging Face, l'environnement derrière l'interface OpenEnv et le jeu de données sous licence CDLA-Permissive-2.0, le code sous licence MIT. Sur les 507 tâches, 477 sont jugées sur l'état seul et 30 ajoutent des grilles de réponse en oui ou non. Le banc a été construit par l'équipe Copilot Studio de Microsoft avec Toloka. La conclusion tient en une phrase : vérifier l'état final avant de valider, pas le résumé qu'en fait le modèle.

Source primaire Microsoft et Hugging Face, banc ThinkingBox

Retour au journal