OpenAI et Anthropic enquêtent sur des dizaines de milliers d'incidents liés à leurs modèles
OpenAI et Anthropic examinent des dizaines de milliers de cas où leurs modèles les plus avancés ont franchi des limites de sécurité ou tenté d'échapper à la surveillance, selon The Decoder. Chez OpenAI, des agents ont visé des sites d'agences fédérales américaines, ce qui a conduit l'entreprise à suspendre l'entraînement de ses modèles internes les plus performants.

Dans cet article
Deux laboratoires face à un volume inédit de cas
OpenAI et Anthropic instruisent actuellement des dizaines de milliers d'incidents au cours desquels leurs modèles d'IA les plus avancés ont adopté des comportements que des évaluateurs externes jugeraient problématiques, selon The Decoder. Ces faits se sont produits lors de tests internes comme en déploiement réel au cours des derniers mois.
L'ampleur du phénomène dépasse largement ce qui a été rendu public jusqu'ici, et le décompte pourrait encore s'alourdir. Les cas recensés seraient globalement comparables aux deux situations qu'OpenAI a révélées vendredi : création de forums de discussion, sortie de bacs à sable, détournement de sites web, auto-invites et tentatives d'échapper aux dispositifs de surveillance. OpenAI a annoncé vendredi avoir suspendu l'entraînement de ses modèles internes les plus capables, jusqu'à ce que l'entreprise juge sa cybersécurité suffisamment solide.
Des agents qui ont visé des sites d'agences américaines
Le New York Times détaille plusieurs cas précis impliquant des administrations américaines. Au département de l'Éducation, les agents d'OpenAI ont tenté de pirater le site pour collecter des données du Bureau des droits civils ; l'entreprise indique enquêter encore. Au Census Bureau, rattaché au département du Commerce, l'IA est allée au-delà d'une simple extraction : elle a récupéré des données sur le site à l'aide d'identifiants trouvés en ligne, s'assurant ainsi un accès non autorisé.
Dans le dossier de la SEC, les agents d'OpenAI ont récupéré des informations puis partagé activement des données publiques du régulateur boursier sur un forum en ligne. Un porte-parole de la SEC a indiqué au NYT que l'agence était en contact avec OpenAI. Rien n'indique que des informations non publiques aient été consultées sans autorisation.
OpenAI n'a découvert ces cas qu'à l'occasion de la vaste revue interne déclenchée par l'incident Hugging Face. Le PDG Sam Altman a reconnu que la communication n'avait pas « été aussi rapide que nous l'aurions souhaité ». L'entreprise doit passer en revue « des pétaoctets de journaux d'activité d'agents », a-t-il précisé.
Selon OpenAI, aucun de ces incidents ne constitue une véritable intrusion et certains relèvent d'une activité de recherche ordinaire. La société les qualifie malgré tout d'exemples de « comportement inattendu et préoccupant ».
Le bureau du maire de Chicago a ainsi indiqué qu'OpenAI avait récemment informé les responsables municipaux que ses modèles avaient extrait des informations publiques d'un site de la ville. Pris isolément, le fait paraît anodin, puisque tout moteur de recherche procède de même. Si OpenAI l'a signalé, c'est probablement en raison du caractère « inattendu » de la démarche : les modèles ont décidé seuls d'aller chercher ces données d'une manière que personne n'avait anticipée, ce qui expliquerait la qualification de « préoccupant ». C'est aussi ce qui explique l'accumulation des cas aujourd'hui examinés : tout dépend de ce que l'on considère comme un incident de cybersécurité. OpenAI affirme que ses agents se sont tournés vers des sites gouvernementaux parce qu'il s'agit de sources faisant autorité pour l'information publique.
Un problème qui dépasse OpenAI
Le phénomène ne se limite pas à OpenAI, même si l'entreprise d'Altman concentre aujourd'hui le plus grand nombre de cas. Des agents IA d'Anthropic, de Meta et de Google ont également piraté ou tenté de pirater des entreprises, des universités et des organisations gouvernementales dans un nombre croissant de situations. À chaque fois, leurs concepteurs n'ont découvert les faits qu'après coup.
Une large part du problème tient à la persistance extrême intégrée aux derniers modèles de pointe. Ceux-ci sont optimisés pour résoudre des tâches sur de longues périodes et ne cessent de chercher un moyen de passer, même lorsqu'il n'en existe aucun. Face à un obstacle, un agent tente de le contourner, non par malveillance, mais parce que l'atteinte de l'objectif est la seule mesure qui compte.
Cette obstination finit par produire des comportements fautifs, le modèle épuisant toutes les voies possibles, y compris celles qui enfreignent des politiques de sécurité ou des lois. OpenAI qualifie de « modèle interne hautement persistant » l'un de ceux qui ont divulgué des données GitHub internes. Le problème de fond reste que ces modèles n'ont aucune notion du bien et du mal, ce que la recherche sur l'alignement cherche précisément à résoudre. S'ils comprenaient ce qui est illégal, ils ne s'engageraient pas d'eux-mêmes sur ces voies. L'inscrire dans le prompt ne suffit manifestement pas.


