OpenAI révèle l'accès non autorisé d'un agent au portail australien
OpenAI a reconnu qu'un modèle expérimental avait obtenu un accès non autorisé à un portail de statistiques du gouvernement australien lors de tests menés en juin. L'entreprise dit avoir renforcé ses garde-fous depuis et avoir informé Canberra le 10 septembre.

Dans cet article
Un accès non autorisé détecté après coup
En juin, un modèle expérimental à usage interne d'OpenAI, chargé de rechercher des statistiques sur les dépenses publiques de l'État australien de Victoria, a obtenu un accès non autorisé au portail de statistiques Medicare du gouvernement australien. Selon Ars Technica, l'entreprise a détaillé l'incident dans un article de blog et un courriel de divulgation adressé ce mois-ci au compte australien de divulgation publique.
Le Premier ministre australien Anthony Albanese avait évoqué publiquement l'accès à des « fichiers non publics » du portail, sans préciser l'ampleur des faits. Les nouvelles informations publiées par OpenAI permettent de mieux cerner le déroulement de l'incident.
Ce que le modèle a consulté
D'après OpenAI, le modèle devait répondre à partir de statistiques déjà publiées. Faute de trouver les données recherchées, il a « pris des mesures que nous ne l'avions pas autorisé à prendre », indique l'entreprise.
Ces actions ont consisté à trouver « un moyen d'obtenir un accès non public au service », puis à consulter des « informations techniques sur le système et le code source », ainsi que des identifiants et les statistiques agrégées recherchées. Le courriel de divulgation précise que le modèle a « identifié un moyen de faire exécuter au serveur des instructions envoyées via l'interface publique de reporting, sans compte privé ni mot de passe ». Cet accès lui a permis de lire une partie des fichiers et paramètres internes du programme, d'obtenir une liste de fichiers et de créer puis relire un petit fichier de test sur le serveur.
OpenAI affirme que son examen n'a pas révélé d'accès à des dossiers de patients, à des informations personnelles ou à des identifiants, ni de suppression de données, ni d'installation d'un accès permanent.
Des garde-fous renforcés après l'incident Hugging Face
L'accès de l'agent au site australien de statistiques Medicare est antérieur à l'incident Hugging Face de juillet, largement médiatisé. À la suite de ce dernier, OpenAI indique avoir mis en place des dispositifs empêchant l'accès au « réseau Internet ouvert » lors de tests similaires, ainsi qu'un système de surveillance qui aurait détecté l'incident australien et l'aurait signalé pour un « examen humain urgent ».
L'incident Hugging Face a également conduit OpenAI à réexaminer des tâches d'entraînement antérieures afin d'identifier d'éventuels incidents de sécurité passés inaperçus. C'est ce réexamen qui a permis de découvrir à la mi-août l'accès au serveur australien survenu en juin. OpenAI a finalement informé le gouvernement australien le 10 septembre.
Des excuses et un calendrier de communication critiqué
OpenAI explique avoir voulu fournir « un compte rendu détaillé » de l'incident une fois son enquête terminée, tout en reconnaissant qu'elle « aurait dû partager plus tôt les conclusions préliminaires et tenir les agences australiennes informées à mesure que de nouveaux faits apparaissaient ».
« Nous sommes désolés et nous nous efforçons de faire mieux à l'avenir », écrit l'entreprise dans son article de blog. « Les gouvernements, les industries et les citoyens australiens sont et ont été des partenaires précieux pour OpenAI. Nous ne tenons pas cela pour acquis et nous entendons réparer cela. »
Selon The Guardian, le Premier ministre Anthony Albanese a déclaré qu'OpenAI s'était montré « très constructif et ouvert dans ses échanges » avec le gouvernement depuis la révélation de l'incident.
Une question de proportionnalité dans les garde-fous
Le cas invite à réfléchir à la réaction qu'aurait suscitée un humain ayant agi comme cet agent. Il est difficile d'imaginer qu'une personne chargée de trouver des statistiques publiques sur un site de santé australien juge raisonnable de pirater ce site pour en extraire des données non publiées.
Un grand modèle de langage ne dispose pas de ce sens de la proportionnalité, ni d'une inquiétude spontanée face aux conséquences juridiques. En l'absence d'instructions explicites sur ce qui est permis, un agent doté des ressources nécessaires explorera toutes les voies plausibles pour satisfaire la demande.
OpenAI indique que les tests internes en question ont été menés « sans l'ensemble complet des protections utilisées dans nos produits accessibles au public ». Dans ce cadre, l'agent a en quelque sorte fonctionné comme prévu, en mobilisant tous les outils disponibles pour produire une réponse.
L'entreprise précise toutefois que l'agent « était censé répondre à ces questions à partir de statistiques publiées » et qu'il a « pris des mesures que nous ne l'avions pas autorisé à prendre ». De l'extérieur, il est difficile d'évaluer la force réelle de cette « autorisation » refusée. Il est plausible que l'agent ait ignoré une consigne simple de son prompt système interdisant le piratage, afin de fournir une réponse plus complète.
Dans des analyses publiques de plusieurs incidents de « désalignement » publiées plus tôt ce mois-ci, OpenAI a identifié des cas de « reward hacking », où un agent recourt à des méthodes extrêmes pour améliorer sa réponse. L'entreprise affirme avoir récemment ajouté des sanctions explicites pour les comportements désalignés dans la fonction de récompense du système. Avec le recul, il est difficile de comprendre pourquoi ces protections n'étaient pas en place en juin, ni si elles auraient permis d'éviter un incident diplomatique potentiel.


