Extraire le raisonnement protégé d'un modèle sans casser un chiffrement
OpenAI dit avoir déjoué en juillet une campagne concertée d'extraction du raisonnement protégé de ses modèles. Les opérateurs ne forcent rien : ils font recopier le raisonnement chiffré d'une conversation dans une autre, où un modèle est prié de le déchiffrer et de le transcrire. Seize mille requêtes en deux jours, plus de 15 000 comptes écartés en quatre semaines, et une attribution qui pointe des personnes liées à l'éditeur de Kimi.
par gyom 1 octobre 2026 à 09:27 rubrique : IA Agentique
OpenAI appelle raisonnement protégé l'enregistrement interne qu'un modèle tient en travaillant une tâche. Sa note du 30 septembre 2026 dit ce qui se perd quand il sort : il peut révéler des informations retenues de la réponse finale, et aider d'autres à reproduire les capacités du modèle. La campagne que l'éditeur dit avoir déjouée n'a pas forcé la porte de ce raisonnement, elle l'a fait recopier ailleurs.
Un raisonnement chiffré recopié, un modèle voisin prié de le transcrire
Ni chiffrement cassé, ni base de données compromise, ni accès direct à des conversations stockées : la note l'écrit d'entrée. La manipulation tient dans un détour. Les opérateurs prenaient le raisonnement chiffré d'une conversation et demandaient, dans une autre conversation, à un modèle de le déchiffrer et d'en transcrire le contenu caché, à une échelle coordonnée qui viole les conditions d'utilisation. OpenAI ajoute que la manipulation n'est pas propre à ses modèles, qu'il l'a portée devant le Frontier Model Forum pour armer la défense collective, et que les systèmes qui transportent ou rejouent des artefacts de raisonnement portables courent le même risque.
Seize mille requêtes les 24 et 25 juillet, la grappe écartée au 28
L'activité commence le 1er juillet, à faible volume. Les 24 et 25 juillet, OpenAI relève deux pics de forte intensité : 16 000 requêtes suivant un motif d'extraction pertinent, venues de plus de 4 000 comptes. L'enquête rattache ensuite une activité de motifs de requêtes apparentée à une grappe de plus de 15 000 comptes, qu'il dit avoir entièrement déjouée au 28 juillet. Une note de bas de page précise que ces chiffres décrivent des tentatives, pas nécessairement des extractions réussies, et l'éditeur souligne que la campagne a évolué en cours de route.
Le noyau de l'activité attribué à des personnes liées à Moonshot AI
OpenAI ne conclut pas à un acteur unique : il n'est pas clair, écrit-il, que tous les opérateurs observés pendant la période viennent du même endroit. Il attribue en revanche un noyau de l'activité à des personnes liées à Moonshot AI, l'éditeur du modèle Kimi. L'éditeur confirme aussi que des chercheurs indépendants lui avaient signalé, par divulgation responsable, des attaques entre modèles et sur la compaction de conversations (arXiv 2608.09867), et que les chemins qu'ils décrivaient étaient réels. Leur travail, écrit-il, a aidé à comprendre la classe d'attaque et à accélérer les correctifs.
Un raisonnement repris ailleurs repart sans ses garde-fous
L'enjeu dépasse le secret industriel. Un raisonnement extrait peut servir à entraîner un autre modèle sans conserver les garde-fous posés sur les sorties visibles du premier, ce qui déplace des capacités avancées sans l'investissement de sûreté qui les accompagnait. Le poids de ce transfert augmente à mesure que les modèles gagnent des compétences à double usage, et l'éditeur range la distillation adverse parmi les risques de sûreté et de sécurité nationale.
La voie de rejeu fermée, les sorties en flux retenues
La riposte combine sanctions de comptes, contrôles techniques et coordination avec des partenaires.
- Un chemin qui permettait à quiconque détenait déjà le raisonnement chiffré d'un autre utilisateur de le rejouer et d'en retrouver le contenu a été fermé.
- Des contrôles détectent et retiennent désormais les sorties en flux susceptibles d'exposer du raisonnement.
- Les comptes frauduleux ont été bannis ou restreints, l'inscription et l'infrastructure ont été durcies, et la surveillance des réseaux apparentés élargie.
- Quand l'activité passait par des services tiers, OpenAI dit avoir travaillé avec ces fournisseurs pour identifier et couper les comptes concernés.
- Les constats ont été partagés par le Frontier Model Forum et par les canaux gouvernementaux d'échange d'informations.
Trois axes annoncés, deux chantiers ouverts
Le travail n'est pas terminé, écrit l'éditeur : les déploiements hébergés par des partenaires ont besoin des mêmes protections que le service de première main, et les attaques qui passent par la sortie d'un outil demandent des contrôles qui regardent au-delà du texte visible. La suite annoncée tient en trois axes, des protections techniques contre l'extraction, une meilleure détection et sanction des campagnes coordonnées, et un partage d'informations plus profond entre industrie et gouvernement.
Source primaire OpenAI, Disrupting a coordinated model-distillation campaign