L'IA en direct
Des faits courts, relevés à la source et datés. Ceux qui tiennent en une ligne restent ici, ceux qui demandent du contexte passent dans le journal. Dernier relevé : 30 septembre 2026 à 07:18.
30 septembre 2026
-
Anthropic a testé GLM-5.3, le modèle ouvert de Zhipu AI, sur ses propres bancs d'exploitation : il trouve des vulnérabilités inédites et les enchaîne en attaques qui fonctionnent, au niveau où seuls les modèles les mieux gardés se tenaient il y a cinq mois. Débrider le modèle demande une opération de quelques milliers de dollars.
Lire la pièce : GLM-5.3 franchit le seuil de l'exploit construit seul Anthropic, Frontier Red Team, GLM-5.3 et la diffusion des capacités cyber -
Anthropic place GLM-5.3, le modèle de Zhipu AI, au niveau de son propre Claude Mythos Preview pour la construction d'exploits : le modèle va au bout d'un exploit complet dans 50 tentatives sur 410 sur ExploitBench, contre 56 sur 410, et provoque un détournement complet du flux de contrôle dans 4 % des essais contre 6 %, sur 100 tâches tirées au hasard du banc interne d'exploitation binaire, là où Claude Opus 4.6 et GLM-5.2 n'y arrivent dans aucun essai. Les garde-fous du modèle ouvert cèdent dans 64 % des cas avec un scénario de couverture, 92 % quand on préremplit ses jetons de raisonnement et 100 % avec une version débridée, cette dernière opération ayant demandé à l'équipe environ 2 200 heures de calcul et 4 400 dollars.
Anthropic, Frontier Red Team, GLM-5.3 et la diffusion des capacités cyber -
Un relevé publié sur r/LocalLLaMA fait tourner Qwen3.8-Flash-Next en GGUF ISTA-DASLab à environ 50 jetons par seconde en génération et 1 500 en pré-remplissage, sur un portable à une carte de 12 Go et 64 Go de mémoire vive. Le moteur employé, Strata, ne fonctionne pour l'instant que sur les cartes Nvidia, le support AMD restant expérimental.
r/LocalLLaMA, Qwen3.8-Flash-Next sur le moteur Strata -
vLLM sait désormais déporter les experts d'un mélange d'experts en mémoire vive, ce qui permet de faire tourner DeepSeek-V4-Flash-Vision-Exp sur quatre Radeon R9700, d'après un relevé de r/LocalLLaMA qui attribue le travail à tcclaviger : la recette tient dans un conteneur Podman qui laisse les cartes visibles et monte son cache vLLM sur disque.
r/LocalLLaMA, déport des experts en mémoire vive avec vLLM -
PolAgentBench mesure l'usage d'outils en polonais sur un banc déterministe de 67 tâches et une échelle d'arithmétique de 46 tâches, avec trois modèles notés à six précisions GGUF, de Q8_0 à Q2_K. Tous décrochent entre 3 et 2 bits, de 0,716 à 0,045 pour Bielik-11B-v3.0, de 0,463 à 0,149 pour sa version distillée de 7 milliards de paramètres et de 0,224 à 0,015 pour Llama-PLLuM-8B, avec p < 0,001 au test de McNemar dans les trois cas. Les façons d'échouer, elles, ne se reproduisent pas : à 2 bits, le modèle de 7 milliards échoue long, médiane de 9 100 jetons sur 4 étapes, quand le 11 milliards répond souvent dès la première étape par une réponse confabulée, 37 de ses 64 échecs.
arXiv 2609.32042, PolAgentBench -
mu-bench rassemble 4 270 énoncés d'appelants tirés de 250 appels téléphoniques à un agent bancaire, en anglais, espagnol, turc, vietnamien et mandarin, autour de ce que les appelants dictent, noms, adresses et codes de confirmation. Le taux d'erreur d'énoncé que propose le papier, jugé par un modèle, s'accorde avec des annotateurs humains à kappa 0,78 sur 1 847 transcriptions notées, contre 0,53 pour le taux d'erreur de mot exact sur texte normalisé ; sur les six fournisseurs comparés au tableau public, le meilleur atteint 11,9 % d'erreur et le mandarin est le plus difficile pour tous.
arXiv 2609.32082, mu-bench
29 septembre 2026
-
OpenAI annonce dots, décrit comme un assistant proactif capable de poursuivre un travail sur des projets complexes comme sur les tâches du quotidien, l'utilisateur restant aux commandes.
OpenAI, dots -
Multiverse Computing publie ProvenanceGuard, une couche de vérification posée après coup sur un agent MCP : elle ne se contente pas de chercher le fait dans les preuves relevées, elle vérifie qu'il vient bien de la source citée. Sur 361 affirmations jugées par des experts humains dans 40 réponses, elle en bloque 138 sur les 139 déclarées non valides, laisse passer une seule, et obtient un F1 de blocage de 0,802, contre 0,783 pour MiniCheck, 0,758 pour la fidélité de RAGAS, 0,662 pour AlignScore et 0,436 pour SummaC-ZS.
Hugging Face, ProvenanceGuard (Multiverse Computing) -
NVIDIA détaille TensorRT Model Connect, un projet open source d'implémentations de référence en C++ bâties sur TensorRT, pensé dès le départ pour des agents de code : travail découpé pour se répartir, changements isolés par famille de modèles pour que la panne reste locale, validation par preuves lisibles par un humain. La version du 29 juillet 2026 couvrait 128 familles de modèles testées sur GB300.
NVIDIA, blog développeurs, TensorRT Model Connect -
NVIDIA publie la version 3.3 de son plan VSS, pour la recherche et le résumé dans la vidéo : une compétence destinée aux agents de code compose le déploiement à partir d'une seule demande, sur des hôtes à deux RTX PRO 6000 Blackwell, et l'échantillonnage vidéo adaptatif allège le travail des modèles vision-langage. Sur une ligne d'embouteillage de démonstration, le déploiement sort en moins de 30 minutes ; l'échantillonnage adaptatif réduit de 17 % la latence de contextualisation des alertes, augmente de 46 % le nombre de flux vidéo traités en parallèle et résume une vidéo de 60 minutes avec 80 % de jetons d'entrée en moins.
NVIDIA, blog développeurs, VSS Blueprint 3.3 -
PostHog met en ligne Jeeves, un modèle de décision de 9 milliards de paramètres qui raisonne avant de trancher : bâti sur Qwen3.5-9B en LoRA avec une tête pointeur, entraîné par CISPO et servi derrière la même API que Jev. Le dépôt annonce 0,889 contre 0,822 pour Kev-9B et 0,857 pour Jev sur ses propres tests, et 0,935 contre 0,866 pour Jev sur les niveaux publics de JevBench, pour environ 0,3 seconde par requête sans raisonnement et 3,3 secondes en médiane avec, sur un H100.
PostHog, Jeeves -
Un lot de quantifications GSQ et RCO de Qwen3.8-Flash-Next est publié sur r/LocalLLaMA, avec une variante dont la moitié des experts a été retirée. Le modèle est un mélange d'experts creux de 176,9 milliards de paramètres, 512 experts routés par couche sur 48 couches et 354 Go en BF16 ; les quatre GGUF vont de 2,40 à 3,50 bits par poids, soit 66,4 à 83,6 Go, et la variante Coder élaguée pèse 58,4 Go dont 29,6 Go doivent rester en mémoire.
r/LocalLLaMA, quantifications GSQ et RCO de Qwen3.8-Flash-Next -
Un utilisateur de r/LocalLLaMA documente Qwen 3.8 27B en quantification IQ4_XS sur une seule carte AMD de 16 Go : 100 000 jetons de contexte, environ 30 jetons par seconde en décodage, cache KV en q8/q5 et llama.cpp compilé pour Vulkan.
r/LocalLLaMA, Qwen 3.8 27B sur 16 Go -
Ollama 0.35.0 ouvre une route pour les modèles de décision, bâtie sur l'API Jev de TypeSafe : ils ne rédigent pas de texte, ils rendent des choix, avec leur probabilité et leur score, que le logiciel consomme directement.
Lire la pièce : Les modèles de décision entrent dans Ollama ollama v0.35.0, notes de version -
OpenAI annonce GPT-6.1 Sol, présenté comme proche de son modèle Astra pour le code, l'usage de l'ordinateur et le travail professionnel, à un cinquième du prix des jetons d'entrée et de sortie d'Astra.
OpenAI, GPT-6.1 Sol -
Ollama 0.35.0 ouvre les modèles de décision, servis par une route /v1/systemone bâtie sur l'API Jev de TypeSafe : ils rendent des choix, des probabilités et des scores au lieu de texte, pour le tri de tickets, le routage de modèles ou la classification. Deux modèles au départ, Nimble de Bespoke Labs et Tev1 de Together AI.
ollama v0.35.0, notes de version -
ComfyUI passe en version 0.38.0.
ComfyUI v0.38.0, notes de version -
Ternary-Bonsai-2, modèle ternaire de 27 milliards de paramètres, dépasse 3,5 millions de téléchargements sur trente jours, pour une fiche mise en ligne le 16 septembre.
prism-ml/Ternary-Bonsai-2-27B-gguf -
Qwen3.8-27B cumule 7 millions de téléchargements et 16 500 mentions sur trente jours, dans le haut du catalogue Hugging Face.
Qwen/Qwen3.8-27B -
XingChen, déjà derrière TeleOCR, met en ligne Xing4.0-29B-A4B : 46 500 téléchargements sur trente jours.
XingChen-AGI/Xing4.0-29B-A4B -
Nvidia publie Nemotron-3-Diarization, un modèle de séparation des locuteurs, à 30 900 téléchargements sur trente jours.
nvidia/Nemotron-3-Diarization -
Edge0 met en ligne Audio8-ASR-Infinite, modèle de transcription audio, 23 700 téléchargements sur trente jours.
Edge0/Audio8-ASR-Infinite -
llama.cpp enchaîne les publications : version b11255 à 12h28, version b11256 à 13h06.
llama.cpp, versions -
Le même agent, la même tâche, et une facture qui varie d'un facteur dix. Le papier TokenCast attaque le sujet par la mesure plutôt que par l'estimation à vue.
Lire la pièce : Combien de tokens brûle vraiment un agent arXiv 2609.35760, TokenCast -
Sur la même tâche, deux exécutions d'un agent peuvent consommer dix fois plus de tokens l'une que l'autre. Un papier propose de chiffrer la dépense en cours de route, sans appeler le modèle une fois de plus.
Lire la pièce : TokenCast : prévoir la facture de tokens d'un agent pendant qu'il tourne arXiv 2609.35760, TokenCast -
Un modèle de lecture de documents bâti sur Qwen2.5-VL, en Apache 2.0, qui déclare le chinois et l'anglais.
Lire la pièce : TeleOCR : un OCR de 1,4 milliard de paramètres pour les documents denses Fiche du modèle TeleOCR, Hugging Face -
Le backend Vulkan arrête de reconstruire ses descripteurs quand les bindings ne changent pas entre deux appels.
Lire la pièce : llama.cpp b11247 : Vulkan réutilise ses descriptor sets Version b11247, dépôt ggml-org/llama.cpp
28 septembre 2026
-
Anthropic publie Claude Sonnet 5.5, annoncé plus de 30 % plus rapide et jusqu'à 30 % moins cher sur la plupart des tâches, au même tarif que Sonnet 5. Simon Willison relève le même défaut qu'Opus 5.5 : à effort de raisonnement maximal, le modèle a dépensé 128 000 jetons, pour 1,28 $, avant d'échouer à produire l'image demandée.
Simon Willison, Claude Sonnet 5.5 -
SemiAnalysis examine ce que l'attention creuse de GLM-5.3 change à l'occupation de la mémoire HBM, entre cache KV déporté, attention creuse et index partagé.
SemiAnalysis, GLM-5.3 et mémoire HBM -
NVIDIA publie OpenShell, qui ajoute des contrôles d'exécution aux agents pendant leur tâche : l'agent garde son objectif, écrit du code, appelle des outils, et la plateforme surveille ce qu'il fait.
NVIDIA, OpenShell -
Le blog de Hugging Face présente Holo4, un modèle d'usage général de l'ordinateur, porté par Hcompany.
Hugging Face, Holo4 -
Un papier arXiv propose AI Night-Scientist, un cadre d'agents qui apprend par renforcement quand et comment quitter les idées structurées pour atteindre des hypothèses moins prévisibles, là où un modèle seul reste homogène.
arXiv 2609.35706, AI Night-Scientist -
Papier soumis le 28 septembre : « How to Loop MoE: Flatten the Experts, Untie the Attention », qui propose de boucler un mélange d'experts en aplatissant les experts.
arXiv 2609.35751 -
Le titre d'un papier du 28 septembre annonce qu'une auto-introspection très simple améliore les modèles agentiques sans apprentissage par renforcement.
arXiv 2609.35741
22 septembre 2026
-
vLLM passe en version 0.30.0.
vllm, versions