OpenAI déjoue une campagne de distillation visant le raisonnement de ses modèles
OpenAI affirme avoir démantelé une campagne coordonnée d'extraction du raisonnement caché de ses modèles, avec un pic à 16 000 requêtes les 24 et 25 juillet. Mais la même technique continuait de fonctionner sur Microsoft Azure, d'après des chercheurs qui ont publié une mise à jour de leur étude.

Dans cet article
OpenAI dit avoir coupé une campagne d'extraction à grande échelle
OpenAI déclare avoir mis fin à une campagne coordonnée visant à copier le raisonnement interne de ses modèles d'intelligence artificielle. Dans un billet de blog, l'entreprise explique avoir détecté puis stoppé une opération de « distillation adverse », rapporte The Decoder.
L'extraction porte sur les étapes de réflexion qu'un modèle parcourt avant de produire sa réponse, et que l'utilisateur ne voit pas. Ces chaînes de raisonnement intermédiaires ont de la valeur : elles peuvent contenir des informations volontairement écartées de la réponse finale et permettre à un tiers de reconstituer les capacités d'un modèle.
Un pic à 16 000 requêtes en deux jours
Selon OpenAI, l'activité a démarré à faible volume le 1er juillet. Les 24 et 25 juillet, elle est montée à 16 000 requêtes émises par plus de 4 000 utilisateurs, toutes suivant un schéma d'extraction caractéristique. L'examen a révélé un réseau de plus de 15 000 comptes aux comportements liés, que l'entreprise dit avoir entièrement fermé au 28 juillet. Une note de bas de page précise qu'il s'agissait de tentatives d'extraction, pas nécessairement de réussites.
OpenAI rattache un groupe central à des personnes liées à Moonshot AI, la société derrière le modèle de langage Kimi. L'entreprise indique ne pas savoir si tous les acteurs observés remontent à une même source. Anthropic a récemment signalé des tentatives comparables de la part d'entreprises chinoises d'IA.
Un modèle bon marché pour déverrouiller le raisonnement d'un modèle coûteux
D'après OpenAI, les attaquants copiaient le raisonnement chiffré d'une conversation, puis demandaient à un modèle, dans une autre conversation, de le déchiffrer et de le retranscrire.
Le chercheur Joachim Schaeffer et son équipe avaient déjà documenté ce mécanisme dans un article. Les fournisseurs d'IA ne renvoient le raisonnement aux clients que sous forme de paquets de données chiffrés, que ces clients transmettent avec leurs requêtes suivantes. Ces paquets étant chiffrés avec des clés partagées, les chercheurs ont constaté qu'ils pouvaient circuler entre sessions, entre utilisateurs et même entre différents modèles d'un même fournisseur. Un modèle plus faible et moins cher de la même famille peut alors servir d'« oracle de déchiffrement » et restituer mot pour mot les pensées cachées du modèle plus puissant.
OpenAI crédite les chercheurs nommément. L'entreprise dit avoir confirmé le caractère réel des vecteurs d'attaque signalés et indiqué que leurs travaux l'ont aidée à déployer plus vite des contre-mesures.
Comptes bannis et inscriptions durcies
OpenAI affirme avoir depuis banni les comptes frauduleux, renforcé les procédures d'inscription et fermé la faille qui permettait de réutiliser et de lire un raisonnement chiffré appartenant à d'autres. L'entreprise filtre désormais les sorties en flux et les bloque lorsqu'elles risquent de révéler du raisonnement. Elle dit avoir partagé ses enseignements via le Frontier Model Forum et des canaux gouvernementaux, le problème ne concernant pas uniquement ses propres modèles.
Sécuriser son API ne suffit pas si le cloud reste ouvert
L'affaire ne s'arrête pas là. Le même jour, les chercheurs ont publié une mise à jour de leur étude. « We stole reasoning. Again », a écrit Joachim Schaeffer sur X. Selon lui, sécuriser sa propre API ne protège pas l'écosystème plus large des fournisseurs de cloud qui commercialisent aussi l'accès aux modèles.
Lors d'un nouveau test le 13 septembre, l'attaque a été bloquée sur les API d'OpenAI et d'Anthropic. Sur Microsoft Azure, elle a fonctionné contre tous les modèles OpenAI essayés, dont le nouveau GPT-6 Astra, ainsi que contre des modèles Anthropic jusqu'à Sonnet 5. Une seule tentative a suffi pour extraire le raisonnement mot pour mot. « Same models, but different protections depending on which platform serves them », a déclaré Joachim Schaeffer.
Une seconde méthode, plus simple encore
Le développeur Can Bölük a démontré publiquement une autre technique. Le modèle reçoit un bloc-notes virtuel comme outil et pour consigne d'y écrire son raisonnement ; l'utilisateur peut ensuite lire ce qui y a été consigné. Les chercheurs indiquent que cela a fonctionné sur tous les modèles OpenAI, ainsi que sur Opus 4.8 et Sonnet 5. Seuls Opus 5, Fable 5 et Fable 5.1 n'ont pas dévoilé leur raisonnement. Le résultat ressemblait fortement à celui de l'attaque par déchiffrement et serait, selon les chercheurs, tout aussi exploitable pour la distillation.
Les chercheurs qualifient les correctifs apportés jusqu'ici de partiels et superficiels. Beaucoup reposent sur une détection fragile de schémas de requêtes précis, et certains ne sont parvenus aux plateformes cloud que plusieurs jours plus tard. GPT-6 Astra a été lancé sur des plateformes tierces sans aucune des protections en place. D'après la chronologie des chercheurs, OpenAI n'a ajouté de garde-fous au point de terminaison Azure que le 27 septembre. Pour les modèles Anthropic, l'extraction signalée n'était plus reproductible sur Azure à partir du 28 septembre.
Joachim Schaeffer soutient que les correctifs doivent couvrir chaque type d'attaque et chaque cloud hébergeant les modèles. Sinon, les attaquants choisiront simplement la voie la moins défendue. L'article va plus loin : les fournisseurs de cloud qui n'appliquent pas de protections équivalentes ne devraient pas être autorisés à servir des modèles de raisonnement. À défaut, écrivent les chercheurs, des portes dérobées ouvertes permettraient de contourner les contrôles à l'exportation au niveau de l'API. OpenAI reconnaît que les modèles hébergés par des partenaires ont besoin de la même protection que ses propres services et que le travail n'est pas terminé.
OpenAI s'attend à ce que ces tentatives gagnent en sophistication à mesure que les modèles de pointe progressent et que davantage d'acteurs cherchent des moyens peu coûteux de copier ce qu'ils savent faire.


