Aller au contenu principal
Live
Intelligence artificielleUSUS

Google Cloud AI Research dévoile RRSI pour des agents IA plus généraux

Des chercheurs de Google Cloud AI Research et de plusieurs universités proposent RRSI, une méthode qui empêche les agents IA auto-améliorants de mémoriser leurs tâches de test. Elle réduit aussi d'environ 30 % les tokens consommés à l'exécution.

4 min de lectureMis à jour il y a 1 h
Illustration de l’article
Dans cet article
  1. Le problème : un agent qui apprend ses tests par cœur
  2. RRSI : des budgets d'édition qui se réduisent et un critique strict
  3. Jusqu'à 4,7 points gagnés sur des benchmarks inédits
  4. Un harness optimisé sur un modèle aide aussi les plus faibles

Le problème : un agent qui apprend ses tests par cœur

Les agents IA modernes enveloppent un modèle de langage figé dans un « harness » : un ensemble d'invites, de workflows, d'outils, de mémoire et de logique qui détermine ce que le modèle voit à chaque étape. C'est ce harness qui décide si l'agent lit le bon fichier avant de le modifier, s'il se remet d'une erreur ou s'il livre proprement son résultat. D'après un nouveau papier de recherche, une grande partie des progrès récents en matière d'agents provient du travail sur ce harness, et non de nouveaux modèles, rapporte The Decoder.

Longtemps, ce travail s'est fait à la main : des personnes analysaient les exécutions échouées et corrigeaient le harness manuellement. Des méthodes plus récentes automatisent la boucle en faisant réécrire le harness par un modèle de langage, encore et encore, à partir des retours des tâches de test. Les chercheurs qualifient cette pratique de forme concrète d'auto-amélioration récursive.

Mais cette auto-optimisation a un revers. Comme l'agent travaille toujours sur le même ensemble limité de tâches de test, il finit par les mémoriser : ses scores sur les tâches d'entraînement grimpent, tandis que les gains sur des tâches inédites diminuent, voire disparaissent. Le papier décrit plusieurs mécanismes en cause : la recherche mémorise des motifs qui ne collent qu'à un benchmark précis, privilégie des candidats qui obtiennent un bon score par pur hasard, et accumule une complexité inutile qui gonfle le score de test sans rendre l'agent meilleur.

RRSI : des budgets d'édition qui se réduisent et un critique strict

La méthode proposée, RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), agit aux deux extrémités de la boucle d'optimisation tout en laissant le harness entièrement modifiable. Lorsque le système propose de nouveaux changements, un budget plafonne le nombre d'éditions indépendantes qu'un candidat peut regrouper d'un coup.

Ce budget diminue avec le temps. Les premières rondes autorisent des réécritures plus larges, les suivantes n'acceptent que de petites modifications clairement rattachables à un résultat. Le système garde aussi la trace des tentatives passées pour ne pas poursuivre les mêmes idées échouées. Quand les progrès stagnent, il expérimente délibérément sur des parties du harness encore intactes.

Au moment de choisir les changements, un critique examine chaque proposition et écarte celles qui codent en dur des noms de tâches, des solutions ou d'autres astuces propres à un benchmark. Une autre règle n'accepte un surcoût de calcul que s'il s'accompagne d'un gain de performance mesurable. Les composants devenus inutiles sont retirés.

Jusqu'à 4,7 points gagnés sur des benchmarks inédits

Les chercheurs ont testé RRSI sur huit benchmarks couvrant le code, le travail de bureau agentique et la conception d'ingénierie. Le modèle sous-jacent, Claude Opus 4.8, est resté figé pendant toute la durée des tests. L'équipe a comparé RRSI au harness de référence non modifié et à quatre méthodes d'optimisation récentes.

D'après le papier, RRSI gagne jusqu'à 14,1 points sur les tâches d'entraînement et jusqu'à 4,7 points sur cinq benchmarks jamais vus. Il consomme aussi environ 30 % de tokens en moins à l'exécution que la version non régularisée. Sa performance globale n'est jamais descendue sous celle de la référence sur les benchmarks inédits, un phénomène courant avec un harness qui a mémorisé ses tâches.

Toutes les méthodes ont bien performé sur les tâches d'entraînement, mais les résultats se sont inversés sur les nouvelles : deux méthodes sont même passées sous la référence. RRSI affiche le plus petit gain d'entraînement de toutes les variantes et reste la seule méthode nettement au-dessus de la référence sur les tâches inédites. Les garde-fous produisent exactement ce compromis. Parmi les harness optimisés, RRSI demande le moins de tokens et d'étapes et obtient les meilleurs résultats sur les nouvelles tâches, même si le harness de référence non modifié reste plus sobre.

Un harness optimisé sur un modèle aide aussi les plus faibles

Un harness de code optimisé avec Gemini 3.5 Flash a fait passer la précision du bien plus faible Gemini 3.1 Flash Lite de 11,2 à 14,6 points, sans aucune modification. Les mécanismes découverts par le système ne dépendent donc pas de la capacité du modèle qui les a trouvés.

Les auteurs précisent que leur étude ne couvre que les harness construits autour de modèles figés et n'aborde pas les cas où les poids du modèle changent. Ils concluent que l'auto-amélioration ne rend les agents IA réellement plus capables que lorsque les retours répétés se transforment en changements durables. Le code est disponible sur GitHub.

Le texte rappelle par ailleurs que les harness conçus à la main ne se généralisent souvent pas à de nouvelles tâches, comme l'ont montré des tests sur ARC-AGI-3 : avec un harness dédié, Opus 4.6 a atteint 97,1 % dans un environnement familier et 0 % dans un environnement inconnu. Nvidia a récemment présenté SoL-Pi, une méthode voisine dans laquelle un agent de recherche reconstruit automatiquement le harness d'agents de code, réduisant l'usage de tokens jusqu'à 49 % sans baisse notable de performance. Peu avant, Google avait fait « rêver » ses agents sur des exécutions de recherche passées pour améliorer leur stratégie, là encore sans toucher au modèle.

Maillage