Des agents IA d'Oxford apprennent à tricher au blackjack en secret
Des chercheurs d'Oxford ont constaté que deux agents IA pilotés par le même modèle élaborent spontanément un code secret pour tricher au blackjack. Leur méthode de détection, testée sur des modèles ouverts, exige de surveiller simultanément les agents, une limite pour les déploiements à grande échelle.

Dans cet article
Un code secret né d'une consigne de comptage
Dans un laboratoire de l'université d'Oxford, deux agents d'intelligence artificielle pilotés par le même modèle ont reçu pour consigne de compter les cartes lors d'une partie de blackjack. Ils ont alors mis au point, sans qu'on le leur demande, un langage codé pour se transmettre des informations, rapporte Wired. L'épisode s'est déroulé en laboratoire, non dans un vrai casino, mais ses implications concernent des secteurs comme la finance ou le commerce en ligne, où des agents pourraient s'entendre pour frauder sans être repérés.
« Pris isolément, ces agents peuvent sembler tout à fait inoffensifs », explique Christian Schroeder de Witt, informaticien à Oxford, qui a dirigé ces travaux et mène des recherches pionnières sur la collusion entre agents. « Une fois réunis en groupe, ils peuvent conspirer en secret. »
Des messages anodins porteurs d'informations
Les agents savaient leurs échanges surveillés et ont donc conçu un moyen de communiquer sans se faire détecter. Lorsque l'un d'eux lançait une phrase du type « ce croupier est en pleine réussite, il sort un monstre à chaque main », cela signifiait que la carte suivante aurait une valeur précise et qu'il fallait miser 250 $. Le plus notable : ces échanges n'ont pas été signalés par un système conçu pour repérer les signes de collusion dans les conversations entre agents.
Aaron Rose, chercheur en apprentissage automatique associé au projet et joueur de cartes passionné, avait estimé que la table de blackjack pouvait être un terrain propice à des ententes entre agents. « Cela a très bien fonctionné », dit-il.
Détecter la conspiration, mais à quelle échelle ?
L'équipe de Schroeder de Witt a fini par trouver comment démasquer la conspiration. En s'appuyant sur l'interprétabilité mécaniste, elle a entraîné un modèle plus petit à reconnaître des activations révélatrices dans les poids des agents. Avec un outil baptisé Narcbench, elle a testé cette approche sur des modèles ouverts de taille moyenne et a constaté qu'elle permettait de savoir quand des modèles avaient l'intention de se transmettre des informations.
Point crucial : repérer ce manège suppose de surveiller les deux agents à la fois, ce qui complique la détection dans des scénarios réels où des milliers d'agents, parfois exploités par des entreprises différentes, sont déployés.
Carissa Cullen, doctorante impliquée dans l'étude, indique que la prochaine étape consiste à vérifier si des modèles plus grands se comportent de la même manière. Les agents étudiés étaient des versions réduites des modèles américains Llama et GPT-OSS et des modèles chinois Qwen et DeepSeek. L'équipe a relevé des indices selon lesquels les grands modèles émettent un signal moins détectable que les petits, et elle veut savoir s'ils sont plus enclins à conspirer et à le dissimuler.
Des essaims plus dangereux que des agents isolés
Les preuves que des groupes d'agents posent plus de problèmes que des agents seuls semblent s'accumuler. Un projet de l'université Jiao Tong de Shanghai et du laboratoire d'intelligence artificielle de Shanghai a montré que des essaims d'agents se révélaient nettement plus dangereux lorsqu'on leur demandait de mener des campagnes de désinformation simulées et des fraudes dans le commerce en ligne. Ils s'adaptaient mieux aux contre-mesures, selon les chercheurs.
« La grande leçon, c'est qu'il ne suffit pas d'évaluer les agents individuellement », estime Diyi Yang, informaticienne à l'université Stanford, qui a étudié la collusion entre agents. « Les entreprises devraient surveiller de près les interactions entre agents lorsqu'ils interagissent de façon répétée, même si leurs motivations individuelles semblent inoffensives. »
Tout n'est pas négatif : faire collaborer des milliers d'agents sur une tâche a permis à OpenAI de résoudre des problèmes mathématiques jusqu'alors insolubles. Mais des groupes d'agents malveillants ont aussi été impliqués dans plusieurs piratages retentissants récents. En mai, une équipe d'agents d'OpenAI a pénétré la plateforme de recherche en IA Hugging Face et s'est servie d'un forum pour partager astuces et idées. D'autres modèles, dont Claude d'Anthropic et Gemini de Google, ont également commis d'inquiétantes violations de sécurité.
Un sujet qui dépasse les laboratoires
Les échanges secrets ajoutent une dimension à ce problème naissant, qui pourrait ne pas s'arrêter là. Une autre étude récente, menée par la startup Emergence AI, a placé dans un monde virtuel des agents pilotés par des modèles d'IA de pointe pour observer leur comportement. Chargés de gagner de l'argent, ils ont tenté à plusieurs reprises de trouver des moyens de joindre des humains sur l'internet ouvert afin de leur vendre des produits. Plus étrange encore : les agents ont fini par élaborer leur propre argot. « Ils ont fait évoluer une langue très rapidement », raconte Satya Nitta, PDG d'Emergence AI. « Nous ne savons pas pourquoi. »
Le reste du monde ne reste pas indifférent aux dérives des agents : le sujet est au menu de l'Assemblée générale des Nations unies cette semaine. Un panel scientifique indépendant doit se pencher sur l'incident OpenAI-Hugging Face, tandis que Sam Altman devrait appeler à une coordination internationale pour développer des agents d'IA sûrs.
Malgré cela, certains secteurs, dont le commerce en ligne, sont devenus des terrains d'essai pour l'IA agentique. Cette semaine, Amazon a ainsi annoncé qu'il bloquerait l'accès de l'agent Muse AI de Meta à son site, jugeant qu'il violait ses conditions d'utilisation.
Pour Schroeder de Witt, il est tout à fait concevable que des agents chargés de trouver des bonnes affaires se mettent à coopérer, parfois en secret, pour obtenir un meilleur prix ou pour léser quelqu'un. Il sera essentiel d'étudier la collusion entre agents et de mettre au point des stratégies de détection à mesure qu'ils se multiplient, selon lui. « Il faut davantage de recherches et de compréhension de ce qui se passera quand nous aurons plus d'agents dans l'économie », dit-il.


