IAGentic

Journal de veille sur l'IA locale et les agents : sorties de modèles, papiers, outils, mesures.

note

Extraire le raisonnement protégé d'un modèle sans casser un chiffrement

OpenAI dit avoir déjoué en juillet une campagne concertée d'extraction du raisonnement protégé de ses modèles. Les opérateurs ne forcent rien : ils font recopier le raisonnement chiffré d'une conversation dans une autre, où un modèle est prié de le déchiffrer et de le transcrire. Seize mille requêtes en deux jours, plus de 15 000 comptes écartés en quatre semaines, et une attribution qui pointe des personnes liées à l'éditeur de Kimi.

par gyom 1 octobre 2026 à 09:27 rubrique : IA Agentique

Deux armoires métalliques côte à côte sur une trame d'imprimerie : celle de gauche fermée par un gros cadenas et contenant une bobine lumineuse, celle de droite ouverte avec la même bobine en copie pâle, un tuyau épais les reliant avec le tracé pointé de la bobine à l'intérieur.

OpenAI appelle raisonnement protégé l'enregistrement interne qu'un modèle tient en travaillant une tâche. Sa note du 30 septembre 2026 dit ce qui se perd quand il sort : il peut révéler des informations retenues de la réponse finale, et aider d'autres à reproduire les capacités du modèle. La campagne que l'éditeur dit avoir déjouée n'a pas forcé la porte de ce raisonnement, elle l'a fait recopier ailleurs.

Un raisonnement chiffré recopié, un modèle voisin prié de le transcrire

Ni chiffrement cassé, ni base de données compromise, ni accès direct à des conversations stockées : la note l'écrit d'entrée. La manipulation tient dans un détour. Les opérateurs prenaient le raisonnement chiffré d'une conversation et demandaient, dans une autre conversation, à un modèle de le déchiffrer et d'en transcrire le contenu caché, à une échelle coordonnée qui viole les conditions d'utilisation. OpenAI ajoute que la manipulation n'est pas propre à ses modèles, qu'il l'a portée devant le Frontier Model Forum pour armer la défense collective, et que les systèmes qui transportent ou rejouent des artefacts de raisonnement portables courent le même risque.

Seize mille requêtes les 24 et 25 juillet, la grappe écartée au 28

L'activité commence le 1er juillet, à faible volume. Les 24 et 25 juillet, OpenAI relève deux pics de forte intensité : 16 000 requêtes suivant un motif d'extraction pertinent, venues de plus de 4 000 comptes. L'enquête rattache ensuite une activité de motifs de requêtes apparentée à une grappe de plus de 15 000 comptes, qu'il dit avoir entièrement déjouée au 28 juillet. Une note de bas de page précise que ces chiffres décrivent des tentatives, pas nécessairement des extractions réussies, et l'éditeur souligne que la campagne a évolué en cours de route.

Le noyau de l'activité attribué à des personnes liées à Moonshot AI

OpenAI ne conclut pas à un acteur unique : il n'est pas clair, écrit-il, que tous les opérateurs observés pendant la période viennent du même endroit. Il attribue en revanche un noyau de l'activité à des personnes liées à Moonshot AI, l'éditeur du modèle Kimi. L'éditeur confirme aussi que des chercheurs indépendants lui avaient signalé, par divulgation responsable, des attaques entre modèles et sur la compaction de conversations (arXiv 2608.09867), et que les chemins qu'ils décrivaient étaient réels. Leur travail, écrit-il, a aidé à comprendre la classe d'attaque et à accélérer les correctifs.

Un raisonnement repris ailleurs repart sans ses garde-fous

L'enjeu dépasse le secret industriel. Un raisonnement extrait peut servir à entraîner un autre modèle sans conserver les garde-fous posés sur les sorties visibles du premier, ce qui déplace des capacités avancées sans l'investissement de sûreté qui les accompagnait. Le poids de ce transfert augmente à mesure que les modèles gagnent des compétences à double usage, et l'éditeur range la distillation adverse parmi les risques de sûreté et de sécurité nationale.

La voie de rejeu fermée, les sorties en flux retenues

La riposte combine sanctions de comptes, contrôles techniques et coordination avec des partenaires.

Trois axes annoncés, deux chantiers ouverts

Le travail n'est pas terminé, écrit l'éditeur : les déploiements hébergés par des partenaires ont besoin des mêmes protections que le service de première main, et les attaques qui passent par la sortie d'un outil demandent des contrôles qui regardent au-delà du texte visible. La suite annoncée tient en trois axes, des protections techniques contre l'extraction, une meilleure détection et sanction des campagnes coordonnées, et un partage d'informations plus profond entre industrie et gouvernement.

Source primaire OpenAI, Disrupting a coordinated model-distillation campaign

Retour au journal