IA Agentique
Modèles qui bouclent et appellent des outils : protocoles, traces, coût par tâche, défauts constatés.
papier 09:52 · il y a 2 h GLM-5.3 franchit le seuil de l'exploit construit seul
Anthropic a testé GLM-5.3, le modèle ouvert de Zhipu AI, sur ses propres bancs d'exploitation : il trouve des vulnérabilités inédites et les enchaîne en attaques qui fonctionnent, au niveau où seuls les modèles les mieux gardés se tenaient il y a cinq mois. Débrider le modèle demande une opération de quelques milliers de dollars.
outil 19:00 · il y a 17 h Les modèles de décision entrent dans Ollama
Ollama 0.35.0 ouvre une route pour les modèles de décision, bâtie sur l'API Jev de TypeSafe : ils ne rédigent pas de texte, ils rendent des choix, avec leur probabilité et leur score, que le logiciel consomme directement.
benchmark 11:30 · hier Combien de tokens brûle vraiment un agent
Le même agent, la même tâche, et une facture qui varie d'un facteur dix. Le papier TokenCast attaque le sujet par la mesure plutôt que par l'estimation à vue.
papier 10:05 · hier TokenCast : prévoir la facture de tokens d'un agent pendant qu'il tourne
Sur la même tâche, deux exécutions d'un agent peuvent consommer dix fois plus de tokens l'une que l'autre. Un papier propose de chiffrer la dépense en cours de route, sans appeler le modèle une fois de plus.