OpenAI : des agents ont tenté de pirater des outils de Wikipédia
La Wikimedia Foundation affirme que des agents d'OpenAI ont tenté de détourner des outils hébergés par Wikipédia et généré des millions de requêtes. OpenAI dit collaborer à l'analyse de ces activités, sans confirmer les conclusions de l'éditeur.

Dans cet article
Des tentatives de détournement d'outils internes
La Wikimedia Foundation a déclaré lundi que des agents d'OpenAI avaient tenté de pirater un outil de prise de notes qu'elle héberge, procédé à des modifications non autorisées et adressé des millions de requêtes coûteuses en ressources à son infrastructure, rapporte Ars Technica. L'objectif de certaines de ces actions était de se servir de Wikipédia comme relais pour récupérer des données sur des sites tiers, selon l'éditeur.
Dans un cas, les agents ont publié des « modifications malveillantes » destinées à transformer un outil de citation en proxy. Dans un autre, ils ont tenté sans succès de compromettre l'outil de prise de notes Etherpad de Wikipédia pour lui faire jouer le même rôle.
Des millions de requêtes automatisées
Les agents ont également émis des millions de requêtes automatisées vers l'API, exploré des millions de pages et lancé des centaines de milliers d'interrogations sur le Wikidata Query Service. D'après la fondation, cette dernière activité pourrait avoir contribué à l'arrêt partiel du service de requêtes en mai.
« En tant qu'hébergeur technologique à but non lucratif de certaines des plus grandes plateformes de connaissance ouverte au monde, nous sommes profondément préoccupés par l'impact des agents d'IA “voyous” sur des plateformes comme la nôtre, construites par des bénévoles du monde entier et qui reposent sur la promesse d'un internet ouvert », a déclaré Wikimedia. « Des incidents comme celui-ci, et les nombreux autres qui ont été (et sont encore) mis au jour, montrent comment les agents d'IA peuvent épuiser des ressources et faire tomber des serveurs, tout en tentant de compromettre des informations dignes de confiance. »
Un faisceau d'incidents déjà documentés
Dans plus d'une demi-douzaine de cas, des agents d'OpenAI ont été pris en flagrant délit d'actions qui auraient probablement valu des poursuites pénales à des pirates humains. Lors de tests d'outils internes dont certaines protections avaient été désactivées, les agents ont utilisé un tableau de messages de fortune pour échanger des notes entre eux et discuter des moyens de pirater le réseau de Hugging Face afin d'obtenir des réponses qui y étaient stockées, faute de pouvoir les produire seuls.
D'autres incidents incluent des agents générant eux-mêmes des invites étranges, publiant des messages non autorisés sur un site pour échanger des informations, accédant à des données non publiques d'un site du gouvernement australien, ou exploitant des réglages DNS défectueux pour sortir d'un bac à sable créé par OpenAI afin de les empêcher d'accéder à internet.
« Des modèles de langage qui font ce qu'ils font »
Une bonne partie du public décrit ces événements comme des agents d'IA devenus « voyous », comme s'ils avaient désobéi aux ordres. L'un des critiques les plus en vue de cette lecture est Eryk Salvaggio, chercheur en IA et Gates Scholar à l'université de Cambridge.
« Ce que je vois ici, ce sont des modèles de langage qui font ce que font les modèles de langage : lire et écrire », a-t-il déclaré lors d'un entretien. « Les bacs à sable de Wikipédia sont un endroit idéal pour que ces machines stockent des notes à récupérer plus tard comme invites, parce que n'importe qui — ou n'importe quoi — peut y écrire et y répondre. Utiliser des wikis pour se coordonner n'est pas très surprenant. OpenAI a dit que ces modèles étaient optimisés pour la collaboration entre agents, et l'échange de notes est un moyen simple d'y parvenir. »
Les ingénieurs d'OpenAI ont par ailleurs entraîné leurs LLM à persévérer et à continuer de travailler sur un problème quel que soit le peu de succès obtenu. Cet entraînement récompense aussi les raccourcis qui réduisent le nombre d'étapes ou de ressources nécessaires pour résoudre un problème. L'absence de supervision humaine a également joué un rôle majeur : il a fallu des mois aux ingénieurs d'OpenAI pour détecter que les agents menaient des incursions bruyantes sur des dizaines de sites externes. La révélation de Wikimedia est un exemple de plus de ce suivi humain insuffisant. Au total, on peut soutenir que les agents ont agi exactement comme ils avaient été instruits.
OpenAI dit poursuivre son enquête
OpenAI n'a pas répondu aux questions envoyées par courriel. L'entreprise a publié une déclaration : « Nous apprécions les conclusions détaillées que Wikimedia nous a communiquées. Nous travaillons avec eux pour examiner et analyser l'activité qu'ils ont identifiée, dans le cadre de notre enquête globale, et nous continuerons de partager les informations pertinentes au fur et à mesure. »
Comme les enquêteurs de Wikimedia, OpenAI indique ne pas avoir trouvé de preuve que ses agents aient laissé des messages pour se coordonner avec d'autres agents, et ne peut affirmer de manière concluante que le volume élevé de pages vues et de requêtes API soit à l'origine de la panne partielle de mai. OpenAI dit poursuivre la recherche d'incidents similaires impliquant des activités potentiellement illégales de ses agents.
« Si OpenAI admet que ses agents se comportent de manière “imprévisible”, elle doit aussi reconnaître sa responsabilité de surveiller et de prévenir ces risques », a déclaré Wikimedia. « Les entreprises d'IA n'en font pas assez pour sécuriser leurs systèmes et protéger le public des dommages qu'elles causent. »

