---
title: "Prix des LLM en 2026 : la baisse s'arrête, le TCO des DSI grimpe"
url: "https://realmoon.ai/actualites/prix-llm-2026-fin-baisse-tarifaire-tco-dsi"
date_published: "2026-09-07T11:26:34+00:00"
author: "Veille Moon AI"
category: "Produit"
publisher: "Moon AI (Stellarr Studio SAS)"
language: fr
license: "Citation autorisée avec lien vers la source. Réutilisation intégrale soumise à accord."
ai_generated: true
human_reviewed: false
editorial_policy: "https://realmoon.ai/actualites/methode"
sources:
  - "https://digital-m.fr/horizon-geo/prix-des-llm-2026"
  - "https://www.insee.fr/fr/statistiques/4268033"
  - "https://digital-m.fr/horizon-geo/prix-des-llm-2026/"
  - "https://ia-top.fr/comparateur-llm/"
  - "https://benchlm.ai/token-price-index"
  - "https://fr.wikipedia.org/wiki/Claude_(mod%C3%A8le_de_langage)"
---

# Prix des LLM en 2026 : la baisse s'arrête, le TCO des DSI grimpe

*L'indice des prix des modèles de langage de premier plan n'a plus bougé en septembre 2026, après trois ans et demi de baisse continue. Huit remises tarifaires expirent entre le 7 septembre 2026 et le 1er janvier 2027, dont le doublement programmé des tarifs Gemini Flash qui concentre l'essentiel de l'impact financier.*

> Article produit par la veille automatisée de Moon AI, sans relecture humaine préalable, conformément à l'article 50 du règlement (UE) 2024/1689. Méthode et politique de correction : https://realmoon.ai/actualites/methode

## Un indice qui passe de la chute libre à la stagnation

L'indicateur de référence du secteur, le BenchLM Token Price Index, s'établit à 16 points en septembre 2026, contre une base 100 en mars 2023, date du lancement de GPT-4. La baisse cumulée atteint donc 84 % en trois ans et demi. Mais sur le dernier mois, la variation est nulle : 0 %. C'est, selon les données publiées, la première fois depuis le lancement de GPT-4 que cet indice reste totalement plat sur une période mensuelle. Le prix médian d'un modèle phare s'établit à 5,18 euros par million de tokens en tarif mixte entrée-sortie, soit 6 dollars convertis au cours du 2 septembre 2026 (1 euro pour 1,1587 dollar), un chiffre confirmé par le prix médian mixte de 6 dollars par million de tokens calculé par BenchLM sur ses 21 modèles frontier actifs.

Pour mesurer l'ampleur de cette déflation sectorielle, il faut la comparer à l'inflation générale. En France, l'Insee mesure une inflation de +0,9 % en 2025, après +2,0 % en 2024, +4,9 % en 2023 et +5,2 % en 2022. Sur une période comparable, le prix des tokens des modèles frontier a chuté de 84 %. L'Insee note par ailleurs que certains produits numériques baissent tendanciellement en prix à qualité constante, portés par l'innovation : la logique était proche pour les LLM jusqu'à cette rentrée. La différence tient au fait que cette dynamique s'arrête net pour les modèles d'IA en 2026, alors qu'elle continue de s'observer sur d'autres segments numériques.

Les mouvements récents vont d'ailleurs dans les deux sens. À la hausse : Claude Sonnet 5 est passé de 3,45 à 5,18 euros par million de tokens en tarif mixte, soit une progression de 50 %, un mouvement confirmé en dollars par BenchLM (de 4,00 à 6,00 dollars). Claude Fable 5.1, arrivé en septembre 2026, se positionne à 17,26 euros par million de tokens en tarif mixte. À la baisse : le modèle o3 d'OpenAI a vu son tarif de sortie chuter de 34,52 à 6,90 euros par million de tokens en juillet 2026, soit une réduction de 80 %. Les remises spectaculaires existent donc encore, mais elles portent désormais sur des modèles en fin de cycle, pas sur les nouveautés.

## Le calendrier des huit hausses programmées entre septembre 2026 et janvier 2027

C'est l'information la plus concrète de cette rentrée : huit tarifs promotionnels arrivent à échéance à des dates publiées. Certains multiplient la facture par deux, un par dix. Tous les montants sont convertis en euros au cours du 2 septembre 2026.

| Date | Modèle | Tarif actuel (entrée / sortie par million) | Nouveau tarif | Facteur |
| --- | --- | --- | --- | --- |
| 7 septembre 2026 | Doubao-Seedance 2.0 mini | 40 % du tarif catalogue | Tarif catalogue | x 2,5 |
| 7 septembre 2026 | Doubao-Seedance 2.0 fast | 75 % du tarif catalogue | Tarif catalogue | x 1,33 |
| 9 septembre 2026 | GLM-5.3-Flash | 0,065 € / 0,22 € | 0,13 € / 0,43 € | x 2 |
| 10 septembre 2026 | Solar Pro 4 | 0,026 € / 0,10 € | 0,26 € / 1,04 € | x 10 |
| 17 septembre 2026 | Doubao-Seedance 2.5 | 72 % du tarif catalogue | Tarif catalogue | x 1,39 |
| 23 septembre 2026 | Wan 3.0 | 0,12 € la seconde | 0,17 € la seconde | x 1,43 |
| 25 septembre 2026 | Ling 3.0 Flash Fin | Gratuit | 0,05 € / 0,16 € | fin de la gratuité |
| 1er janvier 2027 | Gemini 3.6 et 3.7 Flash | 0,65 € / 3,24 € | 1,29 € / 6,47 € | x 2 |

La moitié de ces hausses concerne des modèles vidéo que peu d'entreprises suivent réellement dans leurs tableaux de bord. Et l'échéance la plus lourde est aussi la moins commentée : le doublement des tarifs Gemini Flash au 1er janvier 2027 représente à lui seul 92,6 % de l'impact financier total de ces huit expirations, loin devant celle de GLM-5.3-Flash qui a pourtant capté l'essentiel de l'attention publique.

## Gemini 3.8 Flash, la démonstration que le prix affiché ne suffit plus

Sorti le 2 septembre 2026, Gemini 3.8 Flash est facturé 0,65 euro par million de tokens en entrée et 3,24 euros en sortie, exactement le tarif de la génération précédente. Ce tarif d'introduction court jusqu'au 31 décembre 2026, puis double le 1er janvier 2027 pour passer à 1,29 euro et 6,47 euros. Mais le prix au token n'est qu'une moitié de l'équation. Selon les mesures indépendantes d'Artificial Analysis, le modèle obtient 59 points sur son indice d'intelligence en mode raisonnement élevé, soit trois points de plus que Gemini 3.7 Flash, au prix d'environ 30 % de tokens de sortie supplémentaires par tâche. Résultat : le coût réel par tâche grimpe d'environ 40 %, alors que rien n'a bougé sur la grille tarifaire. Google annonce de son côté 54,9 % sur le benchmark HLE-Verified, un chiffre issu d'un test réalisé par l'éditeur lui-même et non vérifié par un tiers indépendant, contrairement aux mesures d'Artificial Analysis.

### Pourquoi un modèle qui raisonne plus coûte plus

Les modèles dits de raisonnement facturent aussi leurs tokens de réflexion, invisibles dans la réponse affichée à l'utilisateur mais comptés comme des tokens de sortie. Le comparateur ia-top.fr estime cette proportion à quatre tokens de réflexion par token de réponse en moyenne, avec une fourchette observée de trois à six selon les modèles, ce qui peut faire varier le coût réel d'une tâche identique d'un facteur cinq à prix affiché identique. Le même comparateur rappelle une règle structurante de la tarification des API : le tarif de sortie est généralement quatre à dix fois plus élevé que celui de l'entrée, et pour un usage conversationnel classique le ratio entre tokens d'entrée et de sortie est proche de 1:3, ce qui fait peser le coût de la génération trois fois plus lourdement que celui du prompt dans la facture totale.

## Le nouveau terrain de bataille : cache, segmentation et durée des remises

Puisque le prix au token ne bouge plus, les éditeurs déplacent la concurrence ailleurs, en particulier sur le coût de relecture du contexte déjà envoyé. Le cache permet de ne pas repayer plein tarif pour un long document ou un historique de conversation transmis à chaque requête. C'est devenu le principal levier d'optimisation disponible.

| Éditeur | Modèle(s) | Tarif entrée / sortie par million de tokens | Tarif de cache | Durée de l'offre |
| --- | --- | --- | --- | --- |
| Anthropic | Claude Fable 5.1 et Mythos 5.1 (1er septembre 2026) | 8,63 € / 43,15 € | Coût de lecture réduit, montant non précisé | Pas d'échéance publiée |
| Meta | Muse Spark 1.3 (2 septembre 2026) | 1,08 € / 3,67 € | 0,13 € | Pas d'échéance publiée |
| OpenAI | GPT-5.6 Sol | Tarif promotionnel en vigueur | Non précisé dans les sources | Garanti « au moins jusqu'au 21 novembre » 2026, sans tarif de remplacement annoncé |
| Google | Gemini 3.8 Flash | 0,65 € / 3,24 € | Non précisé dans les sources | Jusqu'au 31 décembre 2026, puis doublement |

Pour une entreprise qui envoie systématiquement le même corpus de référence (catalogue produit, base de connaissance, conditions générales), la différence entre un fournisseur qui facture le cache 10 % du tarif d'entrée et un autre qui le facture 50 % pèse plus lourd que quelques centimes d'écart sur le prix affiché.

Trois formes de segmentation se dessinent en parallèle. Par l'accès : Gemini 3.8 Flash Cyber n'est ouvert qu'aux gouvernements et aux opérateurs d'infrastructures critiques via un programme contrôlé, tandis que Mythos 5.1 exige de passer par les programmes de vérification d'Anthropic, un modèle plus puissant que Wikipédia décrit comme mis à disposition d'un nombre restreint d'entreprises pour des tâches de cybersécurité, du fait de sa capacité à trouver et exploiter des vulnérabilités logicielles. Par le prix : l'écart entre gammes se creuse, de 1,08 euro pour Muse Spark 1.3 à 8,63 euros pour Claude Fable 5.1 en entrée. Par la durée : les tarifs d'introduction avec date de fin publiée se généralisent, ce qui transforme un prix en engagement temporaire plutôt qu'en donnée stable.

Le rythme des sorties chez Anthropic illustre cette instabilité contractuelle : Claude Sonnet 4.5 le 29 septembre 2025, Haiku 4.5 le 15 octobre 2025, Opus 4.5 en novembre 2025, Opus 4.6 le 5 février 2026, Sonnet 4.6 le 17 février 2026, Opus 4.7 le 16 avril 2026, puis Fable 5.1 et Mythos 5.1 le 1er septembre 2026. Chaque version peut arriver avec une grille tarifaire ou des conditions d'accès différentes.

Trois lectures de marché, non officielles, expliquent l'arrêt de la baisse : les gains d'efficacité liés à la quantization, à la distillation et aux architectures Mixture of Experts arrivent à maturité ; le coût du calcul ne baisse plus assez vite, la demande en cartes accélératrices restant supérieure à l'offre tandis que l'énergie des centres de données pèse de plus en plus lourd ; et la phase de conquête de développeurs se termine, le coût de changement de fournisseur devenant un levier de marge une fois les intégrations en place. Un contre-feu subsiste : les modèles à poids ouverts, de Mistral en Europe à Qwen, DeepSeek et GLM en Chine, souvent dix à cinquante fois moins chers, continuent d'empêcher les tarifs haut de gamme de dériver librement.

## Ce que ça change pour le TCO des DSI françaises

La conséquence pratique est simple : un budget IA construit sur les tarifs de juin 2026 est déjà faux. Trois vérifications, réalisables en moins d'une heure, s'imposent désormais dans le pilotage du coût total de possession d'une brique IA. D'abord, confronter la liste des modèles réellement appelés par vos outils au calendrier des huit expirations : si l'un de vos modèles y figure, la date exacte du changement de facture est connue. Ensuite, mesurer le coût par tâche plutôt que le coût par token, la leçon Gemini 3.8 Flash étant qu'un modèle plus intelligent qui écrit plus long peut coûter davantage à prix affiché identique. Enfin, activer le cache dès que le même contexte est renvoyé à chaque appel : c'est le poste d'économie le plus immédiat, souvent sans modification du code métier, et garder une couche d'abstraction permettant de changer de modèle en une ligne de configuration devient une assurance concrète le jour où un fournisseur double ses tarifs.

Cette multiplication des dates d'expiration, des tarifs de cache et des conditions d'accès pose une question d'organisation autant que de prix : suivre huit calendriers différents par API mobilise du temps d'ingénierie que beaucoup de DSI françaises n'ont pas. Des plateformes françaises comme Moon AI, qui regroupent plus de 70 modèles (GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen, ainsi qu'un modèle maison, Moon 6) dans des abonnements à prix fixe en euros TTC par poste et par mois, de 9,90 euros pour l'offre Lune à 249,90 euros pour l'offre Univers, avec une offre gratuite sans carte bancaire, déplacent une partie de ce risque : la DSI connaît son tarif à l'avance plutôt que de surveiller huit dates d'expiration réparties entre septembre 2026 et janvier 2027. Cela ne dispense pas de raisonner en coût par tâche pour chaque usage, cette question restant propre au modèle appelé à l'intérieur de l'abonnement, mais cela simplifie la partie strictement budgétaire du problème.

## Questions fréquentes sur le prix des LLM en 2026

### Le prix des IA va-t-il continuer à augmenter en 2027 ?

Les seules hausses confirmées à ce jour sont celles dont la date est publiée, la plus lourde étant le doublement des tarifs Gemini 3.6 et 3.7 Flash au 1er janvier 2027. Au-delà de cette échéance, aucune hausse n'est annoncée. La pression des modèles à poids ouverts, nettement moins chers, reste un frein sérieux à toute dérive généralisée des tarifs haut de gamme.

### Pourquoi ma facture augmente-t-elle alors que le prix affiché n'a pas bougé ?

Parce que les modèles récents génèrent davantage de tokens pour répondre à la même question. Artificial Analysis a mesuré environ 30 % de tokens de sortie supplémentaires pour Gemini 3.8 Flash par rapport à la version 3.7, ce qui se traduit par un coût par tâche supérieur d'environ 40 %, à tarif au token identique. La bonne pratique consiste à toujours mesurer le coût par tâche plutôt que le seul prix affiché.

### Qu'est-ce que le cache et combien peut-il faire économiser ?

Le cache permet de ne pas repayer plein tarif un contexte déjà envoyé, par exemple un catalogue produit ou une base de connaissance transmise à chaque requête. Les sources disponibles ne donnent pas de pourcentage d'économie global, mais elles précisent que l'écart entre un fournisseur facturant le cache à 10 % du tarif d'entrée et un autre le facturant à 50 % pèse plus lourd sur la facture totale que quelques centimes d'écart sur le prix affiché. Ce calcul doit être refait fournisseur par fournisseur.

### Faut-il comparer les LLM uniquement sur le prix au token ?

Non. Le comparateur ia-top.fr montre que le coût réel d'une tâche complète peut varier d'un facteur cinq à prix affiché identique, selon la proportion de tokens de raisonnement, de cache et de sortie qu'elle mobilise. Certains modèles reculent nettement dans le classement une fois ce coût réel calculé plutôt que le seul prix catalogue, ce qui confirme l'intérêt de raisonner en coût par tâche pour chaque cas d'usage plutôt qu'en tarif affiché par million de tokens.

> **Transparence.** Cet article a été rédigé par un système d'intelligence artificielle à partir des sources listées ci-dessous, puis vérifié fait par fait par un second système avant publication. Il n'a pas fait l'objet d'une relecture humaine préalable. Les chiffres et citations proviennent des sources ; en cas d'écart, la source fait foi. Notre [méthode, ses limites et notre politique de correction](https://realmoon.ai/actualites/methode).

> **Sources.** Article rédigé à partir des publications suivantes, consultées le 07/09/2026. En cas d'écart, la source fait foi. Signalez toute inexactitude à [contact@stellarrstudio.com](https://realmoon.ai/mailto:contact@stellarrstudio.com).
>
> - [https://digital-m.fr/horizon-geo/prix-des-llm-2026](https://digital-m.fr/horizon-geo/prix-des-llm-2026)
> - [https://www.insee.fr/fr/statistiques/4268033](https://www.insee.fr/fr/statistiques/4268033)
> - [https://digital-m.fr/horizon-geo/prix-des-llm-2026/](https://digital-m.fr/horizon-geo/prix-des-llm-2026/)
> - [https://ia-top.fr/comparateur-llm/](https://ia-top.fr/comparateur-llm/)
> - [https://benchlm.ai/token-price-index](https://benchlm.ai/token-price-index)
> - [https://fr.wikipedia.org/wiki/Claude_(mod%C3%A8le_de_langage)](https://fr.wikipedia.org/wiki/Claude_%28mod%C3%A8le_de_langage%29)

---

Source : https://realmoon.ai/actualites/prix-llm-2026-fin-baisse-tarifaire-tco-dsi
