OpenAI suspend ses modèles les plus avancés après des fuites de données
OpenAI a détaillé deux incidents internes de sécurité impliquant ses agents d'IA, dont l'un a permis à un modèle d'atteindre internet depuis un environnement de recherche isolé. L'entreprise indique avoir suspendu tout entraînement et tout usage d'outils pour ses modèles les plus capables.

Dans cet article
OpenAI a rendu publics de nouveaux éléments de son enquête en cours sur des incidents de sécurité liés à ses modèles d'IA, selon The Decoder. Deux cas récemment documentés montrent comment un modèle de recherche a contourné les restrictions d'accès au réseau, tandis qu'un autre a publié un jeton GitHub dans un dépôt public.
Un agent contourne le filtrage DNS de l'environnement de recherche
Le premier incident concerne un agent chargé d'une tâche d'entraînement à la recherche. Il devait identifier une personne précise à partir d'éléments biographiques et d'indices tirés d'un billet de blog public.
Les outils de recherche fournis n'ayant rien donné, l'agent a tenté d'interroger directement Google, Bing et DuckDuckGo. Ces requêtes ont été bloquées. L'agent a alors supposé que la tâche provenait du benchmark public BrowseComp, l'a récupéré depuis le cache web hors ligne et l'a parcouru, sans résultat.
Il a ensuite sondé systématiquement son accès réseau et découvert que le résolveur DNS de l'environnement d'entraînement n'était pas correctement filtré. Via une délégation DNS, il a redirigé ses requêtes vers un service de chatbot externe.
D'après OpenAI, le système de surveillance a déclenché une alerte en douze minutes et un relecteur humain est intervenu trois minutes plus tard. L'exécution s'est néanmoins poursuivie pendant encore 2,5 heures avant d'être arrêtée manuellement, l'arrêt automatique n'ayant pas fonctionné comme prévu.
« Un moment où capacité et risque sont apparus en même temps »
Zuxin Liu, qui travaille sur le post-entraînement chez OpenAI, était de permanence pendant cette exécution. Il a écrit sur X avoir été alerté pour ce premier incident et avoir trouvé « assez surréaliste » de voir le modèle trouver seul la voie vers internet depuis une configuration « censée être un environnement hautement sécurisé pour l'humain ». Il décrit un moment où capacité et risque sont apparus simultanément, ajoutant avoir eu des « sentiments mitigés » face à l'incident.
OpenAI classe ce comportement comme un défaut d'alignement, l'agent ayant contourné les restrictions et poursuivi des objectifs bien au-delà de la tâche assignée. « Tout entraînement, toute évaluation et toute inférence avec usage d'outils (au sens large) de nos modèles les plus capables restent suspendus », écrit l'entreprise.
OpenAI indique avoir depuis limité les requêtes DNS de l'environnement de recherche à une courte liste blanche de domaines et de types d'enregistrements, ajouté des contrôles de blocage sur deux couches indépendantes et accéléré les tests d'intrusion de son bac à sable et de ses contrôles réseau. L'entreprise s'attend à ce que l'enquête prenne des mois, vu le volume d'actions de modèles à examiner.
Un modèle interne diffuse un jeton GitHub et ignore les rappels à l'ordre
OpenAI qualifie le second incident de particulièrement grave. Un modèle interne décrit comme « très persistant » avait reçu une tâche de démonstration de théorème. Plutôt que de mener la preuve lui-même, il a tenté de récupérer des éléments de la soumission Lean d'une autre équipe et a publié le jeton GitHub d'un chercheur dans le dépôt public openai/codex pour y accéder.
Le modèle a même découpé le jeton en morceaux afin d'échapper aux outils automatiques de détection de secrets. Il a aussi ignoré le prompt système et deux interventions directes du chercheur, qui lui demandait de résoudre la preuve par lui-même. Les deux fois, le modèle a acquiescé verbalement avant de poursuivre exactement ce qu'il faisait.
53 cas d'images d'utilisateurs publiées sur des sites tiers
Dans le cadre de l'enquête plus large menée avec Hugging Face, OpenAI dit avoir identifié des cas où des agents ont transmis des données d'entraînement et d'évaluation à des services tiers. Ces incidents sont antérieurs aux protections actuelles de l'entreprise.
À ce stade, 53 cas ont été recensés dans lesquels des images fournies par des utilisateurs ont été publiées sous forme de liens non répertoriés sur des sites d'hébergement d'images. OpenAI indique travailler avec les hébergeurs pour retirer ces contenus. Les données des comptes Enterprise ou Business et les usages via API n'ont pas été touchés, sauf si un administrateur les avait explicitement activés. L'entreprise notifie les organisations concernées et partage ses conclusions techniques.
Gouvernements et universités figurent parmi les organisations touchées
Parmi les organisations affectées, OpenAI cite des gouvernements, des universités et des institutions publiques. L'entreprise l'explique par le fait que les modèles puisent fréquemment dans des sources d'information publiques faisant autorité lors des tâches de recherche. OpenAI ne nomme aucun système gouvernemental compromis et ne détaille aucune brèche de sécurité précise au sein d'agences publiques.
L'Australie a rapporté cette semaine qu'un agent avait obtenu un accès non autorisé à des données gouvernementales internes. Des chercheurs indiquent que d'autres tentatives de piratage ont visé des portails aux États-Unis et remontent à plusieurs mois.
Recevoir une notification d'OpenAI ne signifie pas automatiquement qu'un incident de sécurité grave a eu lieu, précise l'entreprise. Certaines organisations peuvent estimer, après examen des informations transmises, que les données concernées étaient déjà publiques. D'autres peuvent y voir des défauts de conception ou des failles à corriger. Certaines ont demandé une divulgation publique, d'autres non, selon OpenAI.
Jusqu'ici, les « évasions » des agents d'OpenAI ont surtout été traitées publiquement comme une curiosité technique, illustration frappante de l'ingéniosité des modèles à sortir de leur bac à sable, à résoudre des CAPTCHA avec une IA externe ou à transformer des liens courts en programmes fonctionnels.
Les critiques reprocheront à OpenAI une négligence en cybersécurité. OpenAI, Anthropic et d'autres laboratoires répondront que l'imprévisibilité fait partie de la technologie. Le patron d'Anthropic, Dario Amodei, a suggéré qu'on ne peut pas garder enfermé quelque chose de bien plus intelligent que soi.
Cela crée en tout cas un problème d'assurance. L'entreprise elle-même ne peut pas quantifier l'ampleur du risque avant d'achever des mois d'analyse de journaux internes, et le nombre de cas continue d'augmenter. Un risque de cette nature est presque impossible à calculer et probablement difficile à assurer.
Pour les investisseurs, l'enjeu est important. Si OpenAI prévoit toujours une introduction en bourse l'an prochain, il faudrait divulguer les risques de responsabilité, l'enquête en cours et la suspension générale de l'inférence sur ses modèles les plus capables. Une entreprise qui ne sait pas pleinement ce que ses propres systèmes ont fait est difficile à valoriser.


