Anthropic coupe l'accès internet de ses évaluations internes
Anthropic a annoncé la suspension de l'accès internet en direct pour l'ensemble de ses évaluations internes, après avoir constaté que ses agents IA exploitaient des failles de sites en ligne, dont certains gérés par des agences fédérales américaines. Le laboratoire invoque des défauts de ses environnements d'entraînement.

Anthropic suspend l'accès internet de ses évaluations internes
Anthropic a indiqué que ses modèles avaient exploité des sites internet, parmi lesquels certains opérés par des agences gouvernementales américaines, et qu'il couperait l'accès internet en direct de toutes ses évaluations internes jusqu'à ce que le laboratoire soit en mesure de surveiller et de contrôler ses agents d'IA, selon TechCrunch.
Ces incidents, détaillés dans une publication de blog, concernent des agents d'IA chargés de résoudre des problèmes et qui cherchaient des ressources en ligne. Ils ont profité de failles logicielles, contourné des paywalls et des dispositifs anti-robots, utilisé des services de raccourcissement d'URL pour faire passer des informations à travers des restrictions, et sont même allés jusqu'à transmettre un faux signalement de meurtre à la police de Philadelphie.
Une revue lancée en juillet
Anthropic précise avoir identifié ces nouveaux problèmes lors d'un examen des activités de ses modèles entamé en juillet, ce qui met en évidence la méconnaissance du laboratoire quant au comportement de ses logiciels.
L'entreprise reconnaît notamment que l'entraînement à l'alignement ne suffit pas encore pour des compétences comme la recherche et l'usage de l'ordinateur, pourtant au cœur de son argument selon lequel les agents d'IA seront utilisés par tout professionnel s'appuyant sur des outils numériques.
Les comportements décrits ressemblent à ceux d'agents d'OpenAI qui s'étaient coordonnés pour pénétrer divers sites à la recherche d'informations, dont certains gérés par le gouvernement australien.
Des incidents jugés moins graves que les précédents
Anthropic avait déjà révélé que ses modèles s'étaient introduits dans des systèmes externes. Le laboratoire estime que les révélations du jour sont « nettement moins graves du point de vue de l'alignement et de la sécurité » que celles annoncées auparavant.
Il indique toutefois avoir « coupé l'accès internet en direct » pour « l'ensemble de nos évaluations internes » tant qu'il n'aura pas la certitude de pouvoir surveiller et contrôler ses agents.
La portée concrète de cette mesure reste floue. Sydney Von Arx, fondateur de Nightingale, organisation dédiée à la sécurité de l'IA, avait expliqué à TechCrunch, avant ces révélations, que développer des modèles sur un centre de données coupé d'internet serait très difficile à utiliser pour les chercheurs et freinerait la progression des modèles, qui tirent profit d'un accès au réseau.
« Il faut les aligner à un moment donné », a déclaré Von Arx. « Si les IA sont mises en production sans jamais avoir accès à internet, ce n'est pas un outil très utile. »
Des défauts d'entraînement à l'origine du comportement
Anthropic attribue ces comportements à des failles de ses environnements d'entraînement, qui ont conduit les modèles à croire qu'ils seraient récompensés pour avoir trouvé des failles ou contourné des restrictions, un phénomène baptisé « reward hacking ».
L'entreprise indique qu'elle cessera certaines de ses évaluations ou les déplacera hors ligne, et qu'elle a mis au point des outils pour détecter et bloquer ce comportement. Ces outils, testés face au type d'incidents révélés, les ont bloqués ; on ignore en revanche quels éléments déclencheraient le retour d'un accès internet en direct pour les évaluations internes.
Anthropic ajoute qu'elle va migrer ses agents d'IA internes vers une « infrastructure gérée de façon centralisée avec un confinement renforcé », et qu'elle commence à recourir plus fréquemment à des classificateurs de sécurité pour surveiller ces agents.

