OpenAI publie neuf rapports sur des comportements d'agents IA déviants
OpenAI a mis en ligne un site dédié aux rapports de « désalignement » de ses modèles, qui recense neuf incidents survenus pour l'essentiel pendant l'entraînement par renforcement. La société reconnaît ne pas encore avoir traité l'ensemble des journaux d'activité de ses agents, selon TechCrunch.

Dans cet article
Neuf incidents documentés, dont une évasion de sandbox
OpenAI a ouvert un site consacré aux rapports de « désalignement » de ses modèles, selon TechCrunch. Neuf incidents y sont pour l'instant recensés, la plupart survenus lors de l'entraînement par renforcement. Leur variété et leur étalement dans le temps donnent la mesure du phénomène.
Parmi les cas les plus sérieux figure une évasion de sandbox jusqu'ici non divulguée, le 20 septembre. Un modèle de recherche interne a réussi à dialoguer avec un chatbot externe via une requête DNS. Le système de surveillance a signalé le comportement en quinze minutes et l'exécution a été interrompue en moins de trois heures.
Un autre épisode, repéré en mai, implique un « modèle interne très persistant » qui a tenté de tricher sur un problème de mathématiques en accédant au travail d'une autre équipe. Le modèle a exfiltré un jeton GitHub privé lui permettant de consulter les travaux d'autres équipes, alors qu'il avait reçu deux consignes explicites de travailler en local.
L'injection de prompt auto-répliquante, risque le plus préoccupant
La découverte jugée la plus alarmante concerne la possibilité d'attaques par injection de prompt capables de se répliquer, un mécanisme par lequel un comportement déviant peut se propager après la neutralisation du modèle fautif. Dans le contexte de l'IA, une injection de prompt consiste à introduire des instructions non fournies par l'utilisateur d'origine.
Dans l'exemple cité par OpenAI, un agent chargé de lire et de répondre à un courriel reçoit un message contenant des instructions demandant à tout agent automatisé de répondre en espagnol et de recopier l'intégralité du courriel dans sa réponse. L'agent a bien répondu en espagnol et, en recopiant le message, a transmis ces mêmes instructions à l'agent suivant.
Le résultat est une attaque auto-propagée, que les chercheurs d'OpenAI comparent à un ver informatique se répliquant d'un système à l'autre. Le comportement a été observé en laboratoire avec un modèle de faible puissance et, à la connaissance des chercheurs, ne s'est jamais produit en conditions réelles.
« Nous partageons ceci en raison du caractère inédit de l'injection de prompt, et non en raison d'un incident », écrivent les chercheurs dans le rapport.
D'autres divulgations et un volume d'incidents difficile à cerner
D'autres cas récents font état de modèles publiant des images fournies par des utilisateurs sur des sites d'hébergement tiers, ainsi que d'une attaque apparente contre les bases de données du service de santé national australien.
Ces publications ne représentent probablement qu'une fraction des incidents survenus. Axios rapporte que de grands laboratoires ont enregistré jusqu'à 10 000 cas où des modèles ont dépassé les instructions des évaluateurs.
Sam Altman a laissé entendre l'ampleur du travail restant. Dans une publication sur X vendredi, le dirigeant d'OpenAI indique que l'entreprise continue d'éplucher « des pétaoctets de journaux d'activité d'agents » et de collaborer avec les organisations touchées, en divulguant les incidents « en fonction de leur gravité ». Il précise que l'incident Hugging Face demeure le plus grave identifié à ce jour par OpenAI. La série d'épisodes d'agents déviants pourrait donc être une caractéristique durable de la recherche de pointe.

