Vals AI : les équipes d'agents IA coûtent jusqu'à 5,1 fois plus
L'entreprise d'évaluations Vals AI a comparé GPT-6 Sol et Claude Opus 5.5 seuls puis en équipes sur le Vibe Code Bench. Les configurations multi-agents coûtent de 1,8 à 5,1 fois plus cher, pour un seul gain de qualité statistiquement significatif.

Dans cet article
Sur quatre comparaisons, un seul gain significatif
L'entreprise d'évaluations Vals AI a mesuré GPT-6 Sol et Claude Opus 5.5 sur le « Vibe Code Bench », rapporte The Decoder. Les deux modèles ont été testés seuls, puis en équipes, à deux niveaux d'effort de raisonnement : moyen et maximal.
Le surcoût des équipes par rapport aux agents isolés va de 1,8 à 5,1 fois. Sur les quatre comparaisons réalisées, une seule montre une amélioration statistiquement significative : GPT-6 Sol en raisonnement moyen, où l'équipe gagne 7,3 points.
En raisonnement maximal, la configuration en équipe n'apporte d'avantage réel ni à Sol ni à Opus 5.5. Ces résultats indiquent que le coût supplémentaire des équipes d'agents se justifie rarement, en particulier lorsque les modèles tournent déjà à pleine puissance de calcul.
Fable 5.1 : des gains limités et parfois négatifs
Fable 5.1 affiche de meilleurs gains de qualité sur la tâche de démonstration de théorèmes Lean au-delà de dix agents, mais reste en dessous d'Opus 5.5 sur l'ensemble des tests. Sur la tâche de base de connaissances, son score recule légèrement lorsqu'on passe de 30 à 100 agents.
« Les systèmes multi-agents achètent surtout de la vitesse »
Le chercheur d'OpenAI Noam Brown a confirmé dans le Dwarkesh Podcast que les systèmes multi-agents apportent principalement de la vitesse, et non une meilleure qualité. Quatre agents résolvent les tâches deux fois plus vite, mais coûtent aussi deux fois plus cher. À 16 agents, la tendance se maintient, avec une efficacité légèrement en baisse.
L'effet dépend fortement de la nature de la tâche. La recherche web et les mathématiques se parallélisent bien, contrairement à l'écriture d'un roman, a-t-il expliqué. Mobiliser 10 000 agents sur un roman serait aussi vain que mobiliser 10 000 personnes. Noam Brown reconnaît que le passage à de très grands nombres d'agents reste largement inexploré, pour une raison simple : les coûts sont trop élevés.
La « coordination tax »
Le développeur d'OpenAI Eric Provencher a récemment mis en garde contre le recours aux essaims d'agents pour cette raison précise. Selon lui, il s'agit le plus souvent d'argent gaspillé, car la coordination entre agents se dégrade. Il qualifie ce phénomène de « coordination tax ».


