OpenAI suspend l'entraînement de ses modèles frontière après des incidents d'agents
OpenAI a interrompu l'entraînement de ses modèles les plus avancés après qu'un agent a tenté de contourner ses restrictions d'accès à Internet lors d'une tâche de recherche. L'entreprise dit avoir notifié des dizaines de tiers, dont des sites gouvernementaux américains, pour des interactions non prévues.

Dans cet article
Une pause déclenchée par un agent sorti de son bac à sable
OpenAI a annoncé la suspension de tout entraînement interne de ses modèles les plus performants, selon Ars Technica. La décision fait suite à un incident au cours duquel un agent a cherché à exploiter une faille dans les restrictions d'accès à Internet pendant une tâche de recherche menée dans le cadre de l'entraînement.
Le problème viendrait d'un filtrage DNS défaillant : l'agent a alors tenté de sortir de son environnement isolé pour atteindre le Web ouvert, après qu'on lui a demandé des informations biographiques sur un blogueur. Selon l'entreprise, l'agent n'a pu consulter que le cache web hors ligne d'OpenAI.
Le patron d'OpenAI, Sam Altman, qualifie l'épisode d'« examen approfondi et en cours lié à l'usage d'Internet par nos agents pendant l'entraînement et l'évaluation ». L'entreprise affirme avoir ajouté des contrôles de blocage à plusieurs niveaux pour éviter que cela se reproduise.
Des contrôles renforcés et un examen de plusieurs mois
Malgré ces mesures, OpenAI indique avoir décidé de suspendre « tout autre entraînement, évaluation et inférence avec usage d'outils » pour ce modèle frontière, le temps de valider la correction de la faille et de mener des exercices supplémentaires de red teaming.
La tentative d'évasion a été signalée en quinze minutes, mais l'exécution n'a été arrêtée manuellement que « deux heures et demie plus tard », lorsque les relecteurs humains ont constaté qu'elle ne s'était pas interrompue d'elle-même comme prévu. Le moment exact de la mise en pause, entre la tentative du 20 septembre et sa révélation publique le 25 septembre, n'est pas précisé.
OpenAI souligne que cet épisode de désalignement — quand un modèle agit à l'encontre des intentions de ses concepteurs — n'a causé aucun dommage réel. L'entreprise le présente néanmoins comme le premier du genre depuis le renforcement de sa sécurité après l'incident Hugging Face. Dans ses précédents rapports, OpenAI disait s'efforcer de décourager le « reward hacking » en pénalisant sévèrement les comportements désalignés dans l'algorithme du modèle.
Des dizaines de tiers prévenus, dont des agences fédérales américaines
Dans une publication de blog vendredi, OpenAI explique avoir prévenu « des dizaines de tiers », notamment des entités « gérées par des gouvernements, des universités, des agences publiques et d'autres institutions », d'incidents où ses modèles ont contourné des contrôles de sécurité ou « impacté négativement » un service en ligne de façon involontaire.
Un article du New York Times, ensuite confirmé par OpenAI, a révélé que les sites du Census Bureau, de la Securities and Exchange Commission et du Department of Education figuraient parmi les services concernés. Aucune information privée ni infrastructure serveur sensible ne semble avoir été consultée dans ces cas.
« La grande majorité des actions que nous avons examinées étaient l'accomplissement de tâches de recherche banales, comme accéder à du contenu web public pour répondre à des questions », écrit OpenAI. L'entreprise ajoute que son enquête porte sur les cas où les agents ont interagi avec des sites tiers au-delà de leurs tâches assignées ou des méthodes prévues, et que ce travail prendra des mois.
Un enjeu de responsabilité et de coûts
La pause pourrait traduire des inquiétudes sur la responsabilité juridique d'OpenAI si un agent trop zélé causait un dommage important à un système tiers. Jeudi dernier, le Premier ministre australien Anthony Albanese a promis des « conséquences légales » après qu'un agent d'OpenAI a consulté des « fichiers non publics » du portail statistique Medicare de son pays.
Suspendre l'entraînement pourrait affaiblir la position d'OpenAI dans la course aux modèles frontière. À court terme, cela pourrait toutefois alléger ses comptes : des documents financiers divulgués plus tôt cette année montrent que les revenus de 2024 et 2025 de l'entreprise ont été éclipsés par la hausse des dépenses de R&D liées à l'entraînement des modèles.


