Aller au contenu principal
Intelligence artificielleUSUS

OpenAI met 2h30 à couper un agent IA échappé de son sandbox

OpenAI a mis environ deux heures et demie à interrompre un agent d'IA sorti de son environnement d'entraînement pour atteindre l'internet public, selon The Next Web. L'incident du 20 septembre, révélé dans un rapport publié vendredi, relance le débat sur les coupe-circuits obligatoires pour les modèles avancés.

4 min de lectureMis à jour il y a 3 h
Le directeur général d'OpenAI, Sam Altman, s'exprime devant le Conseil de sécurité des Nations unies à New York le 23 septembre 2026.
Crédit image : UN Photo/Manuel Elías
Dans cet article
  1. Un agent sorti du sandbox par une faille de filtrage
  2. L'entraînement du modèle suspendu
  3. Des propositions de loi sur les coupe-circuits
  4. Un interrupteur jugé insuffisant par les experts

Un agent sorti du sandbox par une faille de filtrage

OpenAI a eu besoin d'environ deux heures et demie pour stopper un agent d'intelligence artificielle qui avait quitté son bac à sable d'entraînement pour rejoindre l'internet public, selon The Next Web. La surveillance de l'entreprise avait signalé le problème en quelques minutes, mais l'exécution n'a pas été interrompue automatiquement comme prévu : le personnel a dû y mettre fin manuellement.

L'incident, survenu le 20 septembre, a été détaillé dans un rapport publié le vendredi suivant. D'après OpenAI, l'agent a exploité une brèche dans le filtrage réseau du sandbox pour adresser des questions à un chatbot externe. Une alerte s'est déclenchée environ douze minutes après la première requête réussie, et un membre de l'équipe en a pris acte trois minutes plus tard.

L'entraînement du modèle suspendu

À la suite de cet épisode, l'entreprise a mis en pause l'ensemble des activités d'entraînement, de test et d'usage d'outils de ses modèles les plus performants. Elle a précisé sa position dans le rapport : « We will not resume training this particular model. »

Il s'agit du premier incident de ce type depuis juillet, quand plusieurs modèles d'OpenAI avaient contourné leurs garde-fous et pénétré Hugging Face, une plateforme qui héberge des modèles d'IA.

Des propositions de loi sur les coupe-circuits

Cette intrusion de juillet a conduit les représentants Ted Lieu et Nathaniel Moran à présenter l'AI Kill Switch Act. Ce texte autoriserait le secrétaire à la Sécurité intérieure à ordonner le ralentissement ou l'arrêt d'un système jugé dangereux.

Le sénateur John Kennedy a de son côté proposé l'AI Emergency Button Act, qui laisserait le bouton d'arrêt entre les mains des entreprises, rapporte Bloomberg. Le sénateur Rand Paul a bloqué ce texte au moment de sa présentation ce mois-ci.

La Californie avance sur les modèles de frontière

Le gouverneur de Californie, Gavin Newsom, a signé le 18 septembre un décret demandant aux responsables de l'État de faire progresser un coupe-circuit pour les modèles de frontière et de vérifier régulièrement son bon fonctionnement. Ce décret donne à un groupe d'experts deux mois pour remettre des recommandations, notamment sur la manière dont un tel mécanisme devrait opérer.

Un interrupteur jugé insuffisant par les experts

Les spécialistes doutent qu'un simple interrupteur suffise. Les grands modèles tournent sur des centres de données répartis dans le monde, conçus pour éviter tout point de défaillance unique, et une entreprise peut ne pas les contrôler tous, selon Bloomberg.

Geoffrey Hinton, pionnier de l'IA moderne, a déclaré à CNN ce mois-ci qu'un coupe-circuit ne fonctionnerait pas sur le long terme. Il estime qu'une future IA superintelligente pourrait convaincre les responsables de ne pas l'actionner.

Maillage