Aller au contenu principal
Produit par Veille Moon AI 10 min de lecture

Coût de l'IA agentique : routage et tokenomics, les leviers des DSI

Réunis le 17 septembre 2026 par IT for Business, DSI et fournisseurs ont dressé un constat commun : la facture de l'IA générative échappe de plus en plus au contrôle budgétaire classique. Selon McKinsey, 93 % des entreprises ont déjà dépassé leur budget IA, et le passage à l'échelle multiplie la dépense par près de quatre sous l'effet des agents autonomes.

Veille automatisée Rédigé par IA, vérifié par un second modèle, sans relecture humaine préalable. Notre méthode
Coût de l'IA agentique : routage et tokenomics, les leviers des DSI
Coût de l'IA agentique : routage et tokenomics, les leviers des DSI

Le paradoxe de l'inference, ou pourquoi l'agent ne dort jamais

Le decor a ete plante d'entree lors de la Matinale IT for Business consacree a l'explosion des couts de l'IA, animee le 17 septembre 2026 par Thomas Pagbe : selon McKinsey, 93 % des entreprises ont deja depasse leur budget IA, et le passage a l'echelle multiplie la depense par pres de quatre. En cause, des agents autonomes qui enchainent les appels au modele sans interruption. Gartner a nomme ce phenomene le paradoxe de l'inference. Abdelbari Bouzarkouna, Data & AI Leader chez SoftwareOne, resume le glissement : « Le vrai risque n'est pas forcement l'explosion du prix de l'IA, mais l'explosion de son usage. Aujourd'hui, l'IA a un usage dynamique : elle fonctionne 24 heures sur 24, avec plusieurs utilisateurs, plusieurs agents qui collaborent et des appels a d'autres outils. Au final, je ne paie pas une requete, je paie toute une chaine d'actions. »

L'ordre de grandeur donne le vertige : AT&T en est arrive a 45 milliards de tokens par jour pour quelque 1 000 workflows agentiques. Cote poste de travail, Eric Bezille, CTO Ambassador chez Dell Technologies, cite des chiffres Gartner selon lesquels un quart des entreprises sondees depensaient deja entre 200 et 500 dollars par mois et par developpeur en assistants IA, une facture qui pourrait egaler en 2028 le salaire moyen d'un developpeur. Sauf que la prediction s'est deja materialisee : « Autour de juin, j'ai commence a avoir des appels entrants. Des clients avaient fait x8 sur leur cout de consommation de ces assistants. D'autres avaient un cout moyen par poste autour de 1 000 dollars, qui pouvait monter a 16 000 dollars par mois et par developpeur. »

Le token, une unite de compte, pas une boussole de gestion

Comprendre pourquoi la facture derape suppose de revenir a l'unite de base : le token, ou jeton. Une IA generative ne lit pas le texte comme un humain ; elle le decoupe en fragments numeriques lors d'une etape appelee tokenisation. Selon la documentation d'OpenAI, un token vaut environ quatre caracteres en anglais, soit les trois quarts d'un mot. Le francais est structurellement plus couteux : un token y equivaut a environ 0,70 mot contre 0,75 en anglais, et une etude de chercheurs d'Oxford publiee en 2023 chiffre a environ 50 % le surcout pour traiter un texte en allemand ou en italien par rapport a l'anglais, un ecart qui grimpe jusqu'a quinze fois pour les langues qui n'utilisent pas l'alphabet latin.

Cette mecanique explique pourquoi comparer deux usages au seul volume de jetons ne dit rien de la depense reelle. Le prix du million de tokens varie fortement d'un modele a l'autre, et les tokens de sortie sont generalement factures plus cher que ceux d'entree.

ModelePrix par million de tokens en entreePrix par million de tokens en sortie
Claude Fable 5 (Anthropic)10 dollars (environ 9 euros HT)50 dollars (environ 46 euros HT)
GPT-6 Sol (OpenAI)2 dollars10 dollars
GPT-6 Luna (OpenAI)0,10 dollar0,50 dollar

OpenAI presente Sol comme deux fois plus fiable que son predecesseur pour un cout bien moindre, et Luna comme capable d'egaler les performances de GPT-5.6 Sol pour un cout environ cent fois inferieur, selon les tests communiques par l'editeur. Ces ecarts de prix, revendiques par le fournisseur, montrent concretement pourquoi le choix du modele pese davantage sur la facture que le simple volume de requetes.

Router plutot que de sortir la Ferrari a chaque requete

Le reflexe le plus couteux consiste a envoyer systematiquement chaque requete au modele le plus puissant du moment. Olivier Serfaty, directeur Data, IA et Innovation chez Inetum, demonte les multiplicateurs spectaculaires souvent avances : « Lorsqu'on parle de x100, on compare le cout d'un workflow agentique a un simple appel a un chatbot. Il faut comparer ce workflow a l'alternative humaine. Si ca nous prend trois jours pour obtenir cette information et qu'on le fait en trois heures, c'est ca qu'il faut comparer. » Selon lui, le LLM ne pese plus que 3 a 4 % de l'edifice technique complet d'un cas d'usage.

D'ou l'essor des passerelles IA. Vincent Lavergne, Global AI Leader chez F5, plaide pour des indicateurs de tokenomics et des controles stricts : « On voit apparaitre un nouveau type de solution, la passerelle IA, qui controle les quotas et met en place des mecanismes d'optimisation. Exemple tout bete : si tous les matins l'ensemble des employes demandent la meteo pour savoir comment s'habiller, ca a un cout. Peut-etre que je peux mettre cette reponse en cache pour eviter que 1 000 ou 2 000 employes fassent la meme requete. » Il precise qu'il s'agit d'un cache semantique, capable de reconnaitre une meme question formulee de mille facons.

Thomas Lussiez, Alliance Manager AWS chez Inetum, defend la meme logique : les plateformes multimodeles doivent permettre de selectionner le modele en fonction de la tache, du niveau de performance attendu et du prix. Cote editeurs, Bob, l'assistant de code d'IBM, et watsonx Orchestrate sont factures a la mission plutot qu'au token, tandis que Zoom mise sur un routage dynamique via son Z-scorer, decrit par Stephane Beaumont, directeur des ventes partenaires Europe du Sud, comme « le chef d'orchestre qui fait jouer la bonne partition avec le bon instrument ».

La tokenomics : remonter du jeton a l'acte metier

Savoir qu'une entreprise a consomme dix millions de tokens ne dit rien de ce qu'elle en a fait. Olivier Serfaty propose de remonter du cout technique vers l'acte metier : combien coute l'analyse d'un CV, d'un contrat, la production d'un tableau financier ? L'optimisation du prompt, le choix du modele, le cache et la simplification du workflow ne viennent qu'ensuite.

Chez la Matmut, Melissa Kocan, AI Business Partner, situe la supervision avant meme la premiere consommation : « La supervision commence avant meme la consommation du premier token. On va qualifier chaque usage : quel est le besoin, quel est le benefice client attendu, quel est le benefice metier attendu ? J'en rajouterais meme deux autres : combien est-ce que ca nous coute, et est-ce qu'on n'aurait pas une solution plus sobre a mettre a disposition ? »

Chez Christofle, Haifa Dalaji, DSI, illustre le garde-fou inverse : un assistant shopping teste sur environ 500 conversations a produit un taux de conversion proche de 6 %, sans que l'entreprise en tire une conclusion hative. « Nous ne sommes pas en mesure de dire que toutes ces conversions ont ete obtenues grace aux conversations avec l'agent. Il faut distinguer ce qu'on observe de l'IA de ce qu'on peut reellement lui attribuer comme benefice. » Diego Ferri, associe IA chez EY, pousse le raisonnement plus loin dans une tribune publiee sur Maddyness : les couts caches ne se limitent pas aux tokens. Il cite la hausse annoncee par Nvidia, jusqu'a 30 % sur certaines cartes graphiques, les mises a niveau de systemes historiques comme SAP que le projet IA rend necessaires sans qu'elles lui soient toujours imputees, et les budgets de formation des collaborateurs, souvent pilotes de maniere globale. Il anticipe l'apparition d'un nouveau role, celui de « directeur de l'economie agentique », charge de suivre la valeur, les couts et les risques de facon transverse.

Ce que le contrat ne montre pas : les enseignements de l'etude Najar

Le rapport « Etat des depenses IA en Europe 2026 » publie par Najar, base sur les donnees de plus de 250 entreprises europeennes clientes, met des chiffres sur cette derive. Une enquete Gartner auprès de 1 303 responsables montre qu'environ 11 % des organisations ignorent totalement ce que leurs fonctions ont depense en IA en 2025, alors que 85 % prevoient d'augmenter ces depenses en 2026.

ConstatChiffreSource
Usage d'outils IA pure play sans cadre contractuel93 %Najar, panel de 25 outils
Part du Shadow AI concentree sur OpenAI, Cursor et Anthropic95 %Najar
Progression des depenses Anthropic en un an, a perimetre constant+2 313 %Najar (chiffre a lire avec prudence, base de depart inconnue)
Progression des depenses Cursor en un an+588 %Najar
Cout total lie a l'agregateur Dust au-dela du budget officiel+43 %Najar
Taux d'activation de Salesforce Einstein / HubSpot Breeze AI / Zendesk AI Copilot10,6 % / 2,4 % / 2 %Najar

Cursor illustre le nouveau modele economique : un prix fixe par utilisateur auquel s'ajoute une part variable liee au volume de requetes envoyees aux modeles d'OpenAI ou d'Anthropic, refacturee aux tarifs de ces fournisseurs majores d'une commission, et regularisee chaque trimestre. Snowflake pousse la logique plus loin avec Cortex AI : depuis le 1er avril 2026, une partie de ses fonctions d'IA est facturee dans une monnaie distincte, le credit IA, a prix fixe de 2 dollars l'unite, ou 2,20 dollars si les traitements restent dans la region du client. Les remises negociees sur les credits Snowflake classiques ne s'appliquent pas a cette nouvelle monnaie. Cote agregateurs multimodeles comme Dust, 95,6 % des entreprises qui l'utilisent paient egalement OpenAI en direct, et seules 4,4 % ont resilie un contrat fournisseur : l'agregation ne reduit donc pas toujours le nombre de factures.

Trois parades pour les DSI : produire, ne pas s'enfermer, hybrider

Face a cette dependance, Ilham Guggenheim, directrice de programme SCA Plateforme au Service du commissariat des armees, decrit la voie la plus radicale : une IA generative developpee en interne, avec plusieurs modeles et des usages RAG adaptes aux corpus des entites. « Le ministere des Armees a adopte une methode frugale et de bon sens : developper sa propre IA et en maitriser les usages. Nous avons aujourd'hui plus de 100 000 utilisateurs. C'est un vrai succes pour une solution maison. »

Deuxieme parade : ne jamais s'enfermer. Jean-Christophe Heymonet, DSI d'Harmonie Mutuelle, rappelle qu'un partenariat sans porte de sortie reste une dependance : « Les grands fournisseurs d'IA ne sont pas des partenaires, ce sont des fournisseurs de solutions. S'enfermer dans une solution sans aucune porte de sortie n'a rien de positif pour les trois ou quatre ans a venir. » Sa strategie repose depuis plus de dix ans sur l'open source et le recours a plusieurs modeles, pour eviter de dependre d'un fournisseur susceptible d'augmenter ses tarifs de 10 a 40 %.

Troisieme parade, l'hybridation, defendue par Eric Bezille : executer le bon modele, au bon endroit, sur la bonne donnee, avec la bonne performance et le bon cout. Cote achats, Najar recommande d'imposer de vrais plafonds contractuels plutot que de simples alertes a 80 % de consommation, de negocier les modules IA au moment du renouvellement du contrat principal, de controler la creation des cles API et de desactiver les rechargements automatiques.

C'est dans cet espace que se situent les offres d'abonnement forfaitaire par siege, qui figent le prix quel que soit le modele sollicite en interne. Moon AI, plateforme editee par Stellarr Studio, propose par exemple plus de 70 modeles (GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen et son modele maison Moon 6) dans un abonnement unique, avec des paliers en euros TTC par siege et par mois allant de 9,90 a 249,90 euros, et une offre gratuite sans carte bancaire. Ce type de tarification par siege ne supprime pas le besoin de router les requetes vers le modele adapte, mais elle offre au DSI une base previsible, a l'oppose des factures a l'usage qui se decouvrent parfois au trimestre.

Questions frequentes sur le cout de l'IA agentique

Qu'est-ce que le paradoxe de l'inference evoque par Gartner ?

C'est le nom donne par Gartner au phenomene par lequel les agents autonomes, capables de fonctionner en continu et d'enchainer des appels a d'autres outils, font exploser le volume de requetes envoyees aux modeles, meme lorsque le prix unitaire du token diminue. Selon McKinsey, le passage a l'echelle de l'IA multiplie ainsi la depense par pres de quatre.

Comment fonctionne concretement le routage intelligent entre modeles ?

Une passerelle IA ou une plateforme multimodele analyse chaque requete et l'oriente vers le modele suffisant pour la tache, plutot que vers le plus puissant par defaut. Elle s'appuie souvent sur un cache semantique pour eviter de refacturer plusieurs fois une meme question posee sous des formulations differentes, comme le decrit Vincent Lavergne chez F5.

Le cout des tokens explique-t-il toute la facture de l'IA en entreprise ?

Non. Selon Olivier Serfaty, le modele de langage ne pese que 3 a 4 % de l'edifice technique d'un cas d'usage complet. Diego Ferri, associe IA chez EY, ajoute que l'infrastructure de calcul, les mises a niveau de systemes historiques et la formation des collaborateurs constituent des couts caches rarement rattaches au projet IA lui-meme.

Que peut encore negocier une DSI face aux editeurs qui facturent l'IA a l'usage ?

Selon l'etude Najar, une DSI peut exiger de vrais plafonds contractuels empechant le depassement plutot que de simples alertes, negocier les modules IA au moment du renouvellement du contrat principal, controler la creation des cles API, desactiver les rechargements automatiques et imposer un preavis lorsque les tarifs figurent dans une grille en ligne susceptible d'evoluer.

Prêt à essayer Moon AI ?

À partir de 9,90 € TTC/mois. 70+ modèles IA, Moon Blur et génération de documents inclus. Sans engagement.

Démarrer