Aller au contenu principal
Intelligence artificielleUSUS

Vals AI : les équipes d'agents IA coûtent jusqu'à 5,1 fois plus

L'entreprise d'évaluations Vals AI a comparé GPT-6 Sol et Claude Opus 5.5 seuls puis en équipes sur le Vibe Code Bench. Les configurations multi-agents coûtent de 1,8 à 5,1 fois plus cher, pour un seul gain de qualité statistiquement significatif.

4 min de lectureMis à jour il y a 1 h
Le benchmark de Vals AI montre le coût par application face au score sur Vibe Code Bench. Les flèches relient chaque modèle de son agent seul à son équipe, à effort de raisonnement égal. Les équipes coûtent bien plus cher sans guère amélior
Crédit image : Vals AI[
Dans cet article
  1. Sur quatre comparaisons, un seul gain significatif
  2. « Les systèmes multi-agents achètent surtout de la vitesse »

Sur quatre comparaisons, un seul gain significatif

L'entreprise d'évaluations Vals AI a mesuré GPT-6 Sol et Claude Opus 5.5 sur le « Vibe Code Bench », rapporte The Decoder. Les deux modèles ont été testés seuls, puis en équipes, à deux niveaux d'effort de raisonnement : moyen et maximal.

Le surcoût des équipes par rapport aux agents isolés va de 1,8 à 5,1 fois. Sur les quatre comparaisons réalisées, une seule montre une amélioration statistiquement significative : GPT-6 Sol en raisonnement moyen, où l'équipe gagne 7,3 points.

En raisonnement maximal, la configuration en équipe n'apporte d'avantage réel ni à Sol ni à Opus 5.5. Ces résultats indiquent que le coût supplémentaire des équipes d'agents se justifie rarement, en particulier lorsque les modèles tournent déjà à pleine puissance de calcul.

Fable 5.1 : des gains limités et parfois négatifs

Fable 5.1 affiche de meilleurs gains de qualité sur la tâche de démonstration de théorèmes Lean au-delà de dix agents, mais reste en dessous d'Opus 5.5 sur l'ensemble des tests. Sur la tâche de base de connaissances, son score recule légèrement lorsqu'on passe de 30 à 100 agents.

« Les systèmes multi-agents achètent surtout de la vitesse »

Le chercheur d'OpenAI Noam Brown a confirmé dans le Dwarkesh Podcast que les systèmes multi-agents apportent principalement de la vitesse, et non une meilleure qualité. Quatre agents résolvent les tâches deux fois plus vite, mais coûtent aussi deux fois plus cher. À 16 agents, la tendance se maintient, avec une efficacité légèrement en baisse.

L'effet dépend fortement de la nature de la tâche. La recherche web et les mathématiques se parallélisent bien, contrairement à l'écriture d'un roman, a-t-il expliqué. Mobiliser 10 000 agents sur un roman serait aussi vain que mobiliser 10 000 personnes. Noam Brown reconnaît que le passage à de très grands nombres d'agents reste largement inexploré, pour une raison simple : les coûts sont trop élevés.

La « coordination tax »

Le développeur d'OpenAI Eric Provencher a récemment mis en garde contre le recours aux essaims d'agents pour cette raison précise. Selon lui, il s'agit le plus souvent d'argent gaspillé, car la coordination entre agents se dégrade. Il qualifie ce phénomène de « coordination tax ».

Maillage