Des agents IA toujours plus présents dans le développement de modèles, mais les humains décident
Une équipe de recherche de l'université Fudan a analysé plus de 700 journaux de tâches issus de 56 participants pour comprendre la répartition des décisions entre humains et agents IA. Les humains restent à l'origine de la quasi-totalité des choix finaux, même lorsque l'IA exécute l'essentiel du travail.

Dans cet article
Une étude de terrain sur la collaboration humain-IA
Une équipe de recherche associée à l'université Fudan, en Chine, a documenté la manière dont humains et agents d'intelligence artificielle ont collaboré à la construction d'un nouveau modèle d'IA, rapporte The Decoder. Les chercheurs ont exploité plus de 700 journaux de tâches produits par 56 participants, ainsi que les traces laissées par les agents utilisés. Leurs conclusions nuancent les attentes sur le degré d'autonomie réel des agents.
Le projet portait sur le développement d'un modèle de langage agentique baptisé Atria Dawn Preview. Il repose sur une architecture de mélange d'experts comptant 744 milliards de paramètres et vise des tâches de recherche et d'ingénierie.
Un pipeline adossé à des environnements d'exécution réels
Le modèle a été entraîné via un pipeline qui rattache chaque tâche à un environnement d'exécution concret. Le système appelle des outils, produit des résultats intermédiaires et les confronte à des signaux externes : tests, métriques ou éléments de preuve issus de sources. L'équipe indique que le modèle arrive en tête sur cinq des seize benchmarks évalués, notamment la recherche web et la cybersécurité, sans pour autant dominer l'ensemble de la comparaison.
L'IA a rendu possible un tiers des tâches réalisées
L'IA a été mobilisée dans 96,5 % des tâches examinées. Au fil du projet, les participants ont délégué une part croissante du travail aux agents : le rapport médian entre actions d'agents et interventions humaines est passé de 11 à 28,5 en quatre semaines. Les auteurs appellent toutefois à ne pas y voir un signe d'autonomie croissante. Chaque décision humaine a entraîné davantage d'étapes d'agents, ce qui ne signifie pas que les agents prenaient eux-mêmes plus de décisions.
Les participants ont aussi été interrogés sur leur capacité à accomplir leur part d'une tâche sans IA, à périmètre et qualité équivalents. Sur 455 tâches assistées par IA et menées à terme, 151 ont été jugées irréalisables sans IA, soit environ un tiers. Ces tâches concernent 27 des 56 participants : elles ne proviennent donc pas d'un petit noyau d'utilisateurs intensifs. Dans ces cas, l'IA n'a pas accéléré un travail existant, elle a rendu possible un travail qui n'aurait jamais été lancé.
« L'IA propose, l'humain sélectionne »
Pour les méthodes et les paramètres, le schéma le plus fréquent est celui où l'IA propose et l'humain sélectionne, à 55,4 %. Globalement, les humains ont pris 85,5 % des décisions relatives aux méthodes et aux paramètres, contre 9,2 % pour l'IA. Ils ont tranché en dernier ressort sur les objectifs et le périmètre dans 93,4 % des cas.
La part des propositions émanant de l'IA varie de 17 à 55 % selon le type de décision. Sa part dans les décisions finales reste à un chiffre. L'origine des options proposées diffère fortement d'un cas à l'autre, mais les humains ont systématiquement arrêté la plupart des choix finaux. Même parmi les 151 tâches jugées irréalisables sans IA, les humains ont fixé l'objectif dans 95,4 % des cas.
En cas de difficulté, l'humain apporte surtout de l'information
La même logique se retrouve lorsque le travail se grippe. Sur 588 tâches pour lesquelles une difficulté a été enregistrée, 76 % ont progressé grâce à une intervention humaine, et dans 23 % des cas l'agent a résolu le problème seul. L'aide humaine a presque toujours pris la forme d'un apport d'information : ajout de contexte ou clarification des exigences (35,2 %), ou diagnostic du problème et changement de méthode (34,7 %). Les humains ont rarement réalisé le travail eux-mêmes : les modifications partielles représentent 3,2 % des cas et les reprises complètes 0,7 %.
Quand une production de l'IA devait être révisée, l'IA a opéré elle-même les changements dans 75,4 % des cas après retour humain. Le goulot d'étranglement réside donc dans le jugement humain, non dans l'exécution.
Trois phases, et une quatrième hypothétique
L'équipe distingue trois phases dans le rôle de l'IA : objet de recherche, puis outil pour des tâches individuelles, et désormais partenaire de projet. Dans ce rôle actuel, l'IA rédige et ajuste des plans à l'intérieur d'objectifs fixés par les humains. Une quatrième phase, spéculative, relèverait de l'auto-amélioration récursive, où des modèles plus puissants en produiraient de plus puissants encore.
Les auteurs soulignent qu'un modèle peut progresser sur ses tâches d'entraînement sans devenir meilleur pour développer son successeur. La manière dont l'IA pourrait proposer des directions de recherche variées et évaluer leur valeur avant que les résultats soient disponibles reste une question ouverte.
Le risque d'une supervision réduite à une validation
Lorsque chaque décision repose sur une chaîne d'actions d'agents trop longue pour qu'un humain puisse la relire, la supervision devient difficile. Dans le pire des cas, les humains deviennent des relecteurs qui ne peuvent qu'avaliser ce qu'ils voient, écrivent les auteurs. Beaucoup de participants ont par ailleurs fait tourner les agents en mode autonome pour éviter d'interrompre de longues exécutions par des validations incessantes. Cette frontière a été tracée par commodité, et non par un choix délibéré sur le niveau d'autorité à accorder à l'IA.
L'étude s'inscrit dans un débat en cours sur l'auto-amélioration récursive. Anthropic juge possible plus tôt que prévu qu'une IA développe son propre successeur, et son directeur général Dario Amodei appelle de ce fait à imposer une limite de vitesse au secteur. Selon Anthropic, les humains ne prennent plus qu'un pourcentage à un chiffre des décisions relatives aux orientations de recherche dans l'entreprise. OpenAI utilise GPT-5.6 Sol sur l'ensemble de son cycle de développement, tandis que Google et DeepMind laissent des agents IA explorer des stratégies alternatives via des trajectoires de recherche enregistrées avec Dream-RSI, sans améliorer le modèle lui-même, seulement la stratégie de recherche.
Plus d'un millier de salariés de grandes entreprises d'IA ont récemment averti que leurs organisations pourraient être sur le point d'automatiser la recherche en IA. Une autre étude, menée par Princeton et l'UK AI Security Institute, aboutit à une conclusion plus proche des constats de l'équipe d'Atria : les modèles de pointe savent mener de l'ingénierie de recherche, mais échouent sur les arbitrages qui comptent vraiment.

