L'IA : des coûts en baisse de 13x par an selon Epoch AI
Le coût pour atteindre un niveau de performance fixé sur certains benchmarks d'IA recule d'environ 47 % par trimestre depuis 2023, selon Epoch AI. Le MIT, qui corrige les effets de matériel et de concurrence, estime le gain algorithmique réel à environ 3x par an.

Dans cet article
Une baisse des coûts inédite depuis 2023
Le prix à payer pour atteindre un niveau de performance donné sur certains benchmarks d'IA a fortement reculé depuis 2023. Selon The Decoder, l'organisation de recherche Epoch AI, qui suit les tendances du secteur, mesure une baisse d'environ 47 % par trimestre, soit près de 13x sur un an. Aucune autre technologie transformatrice n'aurait connu une décrue aussi rapide, affirme le groupe.
Ce chiffre reflète toutefois les prix de marché pour un score de benchmark fixé. Il ne traduit ni le progrès algorithmique ou architectural pur, ni les coûts de productivité en conditions réelles, précise l'organisation.
Le MIT corrige les effets de matériel et de concurrence
Des chercheurs du MIT, sur des données comparables, observent une baisse de 5x à 10x par an. Après retrait du matériel moins cher et de la pression concurrentielle sur les prix, ils ramènent le gain d'efficacité algorithmique réel à environ 3x par an. La performance de pointe par exécution peut en revanche coûter plus cher, les modèles de raisonnement récents consommant beaucoup plus de calcul par tâche.
Les deux travaux ne mesurent pas la même chose. Rejouer la meilleure capacité de l'année précédente coûte nettement moins cher ; faire tourner le meilleur modèle du moment coûte souvent bien plus cher par requête.
Le score de o3 accessible pour une fraction du prix
Epoch AI prend l'exemple de o3 d'OpenAI. Début 2025, o3 atteignait 75 % sur GPQA Diamond, un test scientifique de niveau doctorat, pour environ 30 cents par question. Dix-huit mois plus tard, un modèle de la famille GPT-5.6 a obtenu le même score pour quatre centièmes de cent, soit 1/725 du prix initial selon Epoch AI. OpenAI a lancé les modèles GPT-6 Sol et Luna, encore moins chers, quelques jours plus tôt, ce qui a probablement élargi l'écart.
Epoch AI fonde son analyse sur cinq benchmarks couvrant les mathématiques, les sciences et les puzzles logiques. Cet échantillon étant étroit, l'organisation qualifie ses résultats de « mesures raisonnables mais approximatives, fondées sur les meilleures données disponibles ».
L'efficacité algorithmique n'explique qu'une partie de la baisse
Hans Gundlach et ses collègues du MIT s'appuient sur les données tarifaires de la plateforme de comparaison Artificial Analysis, d'avril 2024 à novembre 2025, et évaluent bien plus de modèles par test que les travaux antérieurs. Leurs chiffres sont inférieurs à ceux d'Epoch AI, en partie parce que les modèles de raisonnement récents peuvent mobiliser du calcul supplémentaire au moment du test sur les problèmes difficiles, ce qui renchérit le coût par bonne réponse alors même que le prix par token continue de baisser. Les tokens sont les unités de texte facturées par les fournisseurs, et leur seule comparaison ne suffit pas à saisir l'ensemble.
Dans la décomposition du MIT, le matériel moins cher explique une part de la baisse, la concurrence une autre. Les chercheurs neutralisent l'effet de la concurrence en examinant séparément les modèles ouverts. Reste le gain d'efficacité algorithmique pur, d'environ 3x par an. Le chiffre de 13x avancé par Epoch AI est plus élevé parce qu'il ne retire pas les effets du matériel et de la concurrence.
Un meilleur score n'est pas toujours un gain d'efficacité
Le MIT constate aussi que certaines progressions de performance proviennent simplement d'un surcroît de calcul. Un nouveau modèle qui dépasse son prédécesseur sur GPQA Diamond peut sembler progresser, mais les auteurs estiment qu'une large part de l'amélioration vient d'un usage accru de puissance de traitement par question. Il obtient un meilleur score et coûte plus cher à exécuter. Les benchmarks de code et de mathématiques montrent une version atténuée du même schéma.
Toute progression sur un benchmark n'est pas un gain d'efficacité. Les nouveaux modèles combinent un meilleur entraînement, de meilleures données, une meilleure architecture et plus de calcul au test. Un score unique mélange tous ces facteurs.
S'ajoute le problème du « benchmaxxing » : les entreprises d'IA pourraient optimiser leurs modèles pour des tests bien connus, gonflant les scores sans bénéfice réel. Epoch AI tente de s'en prémunir en incluant un test, « Mystery Game Puzzles », fondé sur un jeu tenu secret. Les coûts baissent le plus lentement sur ce test, ce qui va dans le sens de la théorie du benchmaxxing, sans exclure d'autres explications : format de tâche ou bruit dans les données.
Le prix seul ne dit pas quel modèle choisir
Les moyennes de coûts larges aident peu lorsqu'il s'agit de choisir un modèle pour une tâche précise. Des plateformes comme Artificial Analysis classent les modèles selon la qualité, le prix, la latence, la fenêtre de contexte et la vitesse de sortie, et l'option la moins chère l'emporte rarement sur tous les critères.
Un modèle bon marché mais très lent est inutilisable pour un chatbot en temps réel. Un modèle de raisonnement puissant peut être trop lent pour des flux automatisés. Un modèle de frontière plus cher peut rester économique s'il obtient plus souvent la bonne réponse et réduit les reprises. Rien de tout cela n'apparaît dans une simple comparaison de prix par token.


