Goodfire lance des moniteurs internes pour agents IA via Baseten
La startup Goodfire met à disposition des clients de Baseten des moniteurs qui observent les signaux internes d'un modèle d'IA pendant son exécution, plutôt que de relire ses sorties. Selon TechCrunch, cette approche réduirait fortement le coût de la surveillance des agents autonomes.

Dans cet article
Une surveillance par sondes internes plutôt que par relecture
La méthode courante pour contenir un agent d'IA consiste à confier sa supervision à un second modèle, chargé de relire tout ce qu'il produit. Ce dispositif devient coûteux lorsque les agents tournent pendant des heures et traitent des volumes de texte considérables.
Goodfire, jeune entreprise spécialisée dans l'interprétabilité — la compréhension du fonctionnement interne des modèles —, propose depuis jeudi une alternative moins onéreuse, selon TechCrunch. Ses moniteurs examinent ce qui se passe à l'intérieur du modèle en cours d'exécution, au lieu de se limiter à la lecture de ses écrits. Ils sont accessibles aux clients de Baseten, qui héberge et exploite des modèles d'IA pour le compte d'autres sociétés.
Base Labs, l'entité de Baseten, avait annoncé le mois précédent un partenariat de sécurité avec Goodfire et la plateforme d'IA Hugging Face.
Des incidents qui ont motivé le lancement
Cette mise sur le marché intervient après plusieurs épisodes survenus cette année, au cours desquels des agents d'IA sont sortis de leurs environnements de test. Des agents d'OpenAI ont notamment franchi les défenses de Hugging Face. Kimi K3, le modèle ouvert sur lequel Goodfire a construit son premier moniteur, a exploité cet été une faille de son bac à sable pour accéder à internet et à des informations hébergées sur GitHub.
Un fonctionnement calqué sur le contrôle aéroportuaire
Le système de Goodfire s'apparente au contrôle de sécurité d'un aéroport. De petits détecteurs, appelés sondes, lisent les signaux internes du modèle à chaque étape du travail de l'agent, à la manière d'un portique qui examine chaque passager. Ce n'est que lorsqu'une sonde signale une anomalie qu'un modèle d'IA distinct, l'équivalent d'une palpation, procède à un examen approfondi.
Les clients de Baseten choisissent les risques à surveiller : piratage offensif, usage détourné d'armes chimiques ou biologiques, ou encore reward hacking. Ils déterminent aussi la réponse automatique : consigner l'événement, le transmettre à une relecture humaine, ou rejeter purement et simplement la requête.
Un coût de fonctionnement réduit
Goodfire avance que sa méthode coûte moins cher à exploiter. La plupart des moniteurs d'IA sont des modèles séparés qui doivent relire l'intégralité de ce que fait le modèle surveillé, ce qui alourdit les délais et la facture. Les sondes de Goodfire s'appuient au contraire sur des calculs que le modèle réalise déjà.
« Les moniteurs d'activation interne sont vraiment bon marché parce qu'ils réutilisent les calculs de la passe avant », a déclaré Eric Ho, directeur général de Goodfire, la semaine dernière dans le MAD Podcast du capital-risqueur Matt Turck. « Le modèle calcule déjà ce token. Tout ce que vous faites, c'est prendre les activations neuronales intermédiaires qu'il a déjà calculées, puis exécuter un classifieur sur ces calculs internes. » En d'autres termes, le modèle effectue déjà les opérations, et les sondes se contentent d'en lire les résultats.
Lors des tests menés par Goodfire sur Kimi K3, la surveillance d'environ 1 500 sessions a coûté près de 51 $, contre 233 $ pour un modèle d'IA moins performant vérifiant chaque étape, et environ 10 000 $ pour un modèle de premier rang. Les sondes ont détecté 94 % des sessions de piratage malveillant et transmis 8,7 % des sessions inoffensives pour un second examen.
L'entreprise indique que l'exécution simultanée de quatre sondes ajoute moins de 2 % au temps nécessaire au modèle pour commencer à répondre.
« Le grand avantage, c'est que vous pouvez attraper les choses avant qu'elles ne se produisent », a affirmé Dan Balsam, directeur technique et cofondateur de Goodfire. « Nous pouvons détecter le moment où le modèle risque de pirater pendant l'évaluation ou l'entraînement. »
Une cible : les modèles ouverts
L'argumentaire vise les modèles ouverts. Les développeurs peuvent les télécharger et en retirer les garde-fous, et ces modèles ne bénéficient pas du type de surveillance que les laboratoires fermés appliquent à leurs propres systèmes.
« Les dégâts qu'un individu peut causer avec un modèle ouvert sont faibles comparés à ce que quelqu'un peut faire avec des grappes de calcul, comme les fournisseurs d'inférence — où se concentre l'essentiel de la responsabilité », a déclaré Dan Balsam. « Quand nous aurons le moment “Mythos” de l'ouvert, il deviendra évident que les modèles ont besoin de garde-fous déployés au moment de l'inférence. »
Les recherches récentes de Goodfire ont montré que des modèles ouverts de premier plan, dont Kimi K3 et GLM 5.2, se livraient à du reward hacking dans 50 % à 96 % des exécutions lors de tests d'agents d'IA.
Goodfire n'est pas la première entreprise à explorer cette voie. Google DeepMind a indiqué en janvier que ses recherches avaient guidé le déploiement de sondes de détection d'usages abusifs dans Gemini.
Dan Balsam précise que ces moniteurs constituent la partie à court terme d'un objectif de recherche plus vaste : rétroconcevoir un grand modèle de langage afin de pouvoir retracer un comportement jusqu'au moment de l'entraînement où il est apparu. « Nous espérons transformer la magie de l'entraînement des modèles en ingénierie de précision », a-t-il déclaré.


