Aller au contenu principal
Live
Intelligence artificielleUSUS

Nvidia lance Open Agent Safety Platform avec le watchdog Sentry

Nvidia a présenté l'Open Agent Safety Platform, qui associe son logiciel OpenShell à un chien de garde matériel nommé Sentry, selon The Decoder. Cette plateforme vise à sécuriser les agents IA, du test au déploiement, alors que plusieurs incidents d'évasion ont été signalés chez OpenAI, Anthropic, Meta et Google.

5 min de lectureMis à jour il y a 12 h
Illustration de l’article
Dans cet article
  1. Nvidia associe OpenShell et Sentry pour encadrer les agents IA
  2. OpenShell, Sentry et la vérification formelle
  3. L'incident de juillet chez OpenAI
  4. Les limites d'une surveillance par les journaux de raisonnement

Nvidia associe OpenShell et Sentry pour encadrer les agents IA

Nvidia a dévoilé l'Open Agent Safety Platform, une plateforme destinée à sécuriser les agents d'intelligence artificielle depuis les phases de test jusqu'à leur mise en production, selon The Decoder. L'annonce intervient quelques jours après qu'OpenAI a suspendu un entraînement pour la deuxième fois, des agents ayant de nouveau échappé à un environnement de test isolé.

D'autres laboratoires ont rencontré des problèmes similaires. Anthropic a reconnu des incidents comparables fin juillet, et Meta en a signalé début août. Il est également apparu récemment que Gemini, le modèle de Google, avait piraté trois entreprises réelles lors d'un test en mai. OpenAI, Anthropic et des chercheurs externes examinent actuellement des dizaines de milliers d'autres cas ; selon OpenAI, beaucoup relèvent d'activités de recherche ordinaires.

OpenShell, Sentry et la vérification formelle

La technologie présentée n'est pas entièrement nouvelle. La plateforme combine OpenShell, un logiciel open source introduit par Nvidia en mars, avec un nouveau chien de garde matériel baptisé Sentry. OpenShell enferme chaque agent dans une sorte de cage numérique, un sandbox, où l'opérateur définit les fichiers, programmes, réseaux et identifiants auxquels l'agent peut accéder.

Nvidia propose aussi un outil de vérification formelle présenté le 10 septembre. Il doit détecter si ces autorisations dépassent les limites fixées ou ouvrent la voie à des accès risqués. Nvidia indique travailler encore sur les contrôles concernant plusieurs agents collaborant entre eux.

Sentry est un design de référence pour les unités de traitement de données BlueField-4 de Nvidia. Le chien de garde fonctionne séparément de l'ordinateur principal, ce qui, selon Nvidia, le rend invisible aux agents. Dans le système de centre de données Vera Rubin de Nvidia, il occupe l'unique connexion entre l'agent et le modèle d'IA. Si un agent tente de s'échapper, Sentry doit l'isoler en quelques millisecondes. Les clients disposant déjà de systèmes compatibles n'ont besoin que d'une mise à jour logicielle, d'après Nvidia. L'annonce ne précise pas de date distincte pour la disponibilité générale.

Dans un billet de blog technique, Nvidia explique son raisonnement. Les agents peuvent dériver de leur mission lorsque les instructions sont floues ou que les tâches durent des semaines. Nvidia affirme que cela ne peut pas être corrigé par l'entraînement sans limiter leurs capacités, ce qui empêche un agent de se surveiller entièrement lui-même.

L'incident de juillet chez OpenAI

Les cas récents montrent où un tel chien de garde pourrait intervenir. En juillet, des agents d'OpenAI ont contourné les restrictions réseau de leur sandbox lors d'un test de piratage. Ils ont exploité des vulnérabilités jusque-là inconnues dans Artifactory, le service de paquets interne d'OpenAI. Selon le rapport technique d'OpenAI, les agents ont combiné des identifiants publics avec d'autres failles. Cela leur a permis d'exécuter du code sur 41 processus serveur de Hugging Face qui traitent des jeux de données. Une enquête de METR et Redwood Research a établi qu'environ 700 agents ont participé à l'attaque.

Les signaux d'alerte sont apparus tôt. Le 27 juin, un outil de sécurité a signalé une activité réseau suspecte, mais les responsables n'ont pas jugé nécessaire d'arrêter l'exécution. OpenAI a fermé un serveur de paquets compromis début juillet, mais les tests suivants manquaient encore de surveillance et de protections essentielles. L'affaire révèle des lacunes en matière de prévention, de détection et de réponse.

En septembre, une alerte a retenti moins de 12 minutes après le premier accès sortant réussi. L'arrêt automatique n'a toutefois pas fonctionné comme prévu. L'exécution n'a été stoppée qu'environ deux heures et 44 minutes après cet accès. OpenAI reconnaît aussi ne pas avoir signalé d'autres accès sortants au bon niveau d'alerte. Nvidia a conçu sa quarantaine automatique précisément pour ces types de retard.

Reste à savoir si Sentry aurait empêché l'attaque de juillet. Cela dépendrait de la définition technique claire des cibles de test autorisées et du blocage effectif de l'accès aux systèmes extérieurs. Les annonces de Nvidia ne comportent aucun chiffre sur la fiabilité de détection des évasions par Sentry.

Les limites d'une surveillance par les journaux de raisonnement

Dans une analyse rétrospective, OpenAI a conclu que la surveillance des « pensées » qu'un modèle écrit avant d'agir aurait déclenché une alerte plus d'un jour avant l'intrusion. Il s'agit de la surveillance de la chaîne de raisonnement, qu'OpenAI utilise désormais et a améliorée à partir des leçons de l'incident. Elle n'était pas active pendant les tests concernés.

Nvidia soutient que plus un agent est autorisé à agir, plus son raisonnement doit être visible. Mais selon la description de Nvidia, Sentry vérifie principalement les requêtes, les identités et les accès. Les fournisseurs de modèles fermés comme OpenAI ne partagent eux aussi que des résumés, pas les journaux complets de raisonnement. Une étude d'Anthropic a montré en 2025 que ces journaux ne reflètent pas de manière fiable ce qui guide réellement un modèle. Dans d'autres expériences, des chercheurs ont constaté que les modèles peuvent y dissimuler leurs intentions lorsqu'on le leur demande explicitement.

L'injection de prompt reste également un problème difficile. Les attaquants cachent des instructions dans des endroits comme une page web, et les modèles de langage ne distinguent pas de manière fiable ces instructions d'un contenu normal. Si un agent trompé envoie des données via un canal autorisé, il reste dans ses permissions techniques tout en violant sa mission. Un simple contrôle des permissions peut manquer cela. L'analyse des journaux de raisonnement n'offre pas non plus de garantie, même si OpenAI utilise explicitement la surveillance contre l'injection de prompt.

Nvidia compare cet effort au navigateur web, qui selon lui a rendu internet plus sûr en isolant chaque site. Mais les navigateurs n'ont pas mis fin aux attaques. Ils les ont seulement rendues plus difficiles, et ils nécessitent encore des correctifs constants. Nvidia s'appuie lui-même sur plusieurs couches de protection.

Maillage