01.08.2026
7 min de lecture

98 % des praticiens FinOps gèrent désormais les dépenses liées à l’IA – il y a deux ans, ils n’étaient que 31 %. La tokenomics passe ainsi du statut de détail technique à un point clé de l’agenda des DSI, DCTO et membres du comité de direction.

Les points clés en bref

  • Les dépenses IA sont devenues la norme : Selon l’étude State of FinOps 2026, 98 % des praticiens gèrent les coûts liés à l’IA. La gestion des coûts IA est la compétence la plus souvent citée comme nécessaire par les équipes.
  • Impact au niveau C-level : 78 % des pratiques FinOps rendent compte au DCTO ou au DSI. La Linux Foundation a annoncé, le 3 juin 2026, la création de la Tokenomics Foundation.
  • Maturité et leviers : McKinsey estime que seuls 20 à 25 % des entreprises disposent de pratiques FinOps IA matures. Une consommation optimisée peut permettre d’économiser 20 à 30 % des coûts liés à l’IA.

Articles associésTrois budgets IA, aucun bilan consolidé  /  L’informatique quantique : la solution à la voracité énergétique de l’IA ?

Le FinOps pilote les coûts de l’IA et se rapproche du responsable technique

L’enquête State of FinOps 2026 de la FinOps Foundation, basée sur 1 192 répondants, représente un budget cloud annuel de plus de 76 milliards d’euros. Le constat est sans appel : la gestion des coûts liés à l’IA est passée du statut de sujet marginal à celui de mission centrale. 98 % des praticiens FinOps gèrent désormais les dépenses IA, contre 31 % il y a deux ans. Par ailleurs, la gestion des coûts IA est la compétence la plus souvent citée comme nécessaire par les équipes.

Cette évolution entraîne un changement dans l’ancrage organisationnel. 78 % des pratiques FinOps rendent compte au DCTO ou au DSI. Avec l’implication des membres du comité de direction et des vice-présidents, l’influence sur le choix des technologies augmente considérablement. Pour les responsables du numérique au sein des organisations DACH, cela signifie que les budgets IA et les décisions relatives aux modèles doivent s’inscrire dans la même boucle de pilotage que le portefeuille cloud et la gouvernance des fournisseurs, dès lors que le FinOps est clairement rattaché au responsable technique.

L’enquête sera publiée le 19 février 2026 et marque le point de départ empirique d’un débat qui, au cours de l’année, s’élargira à la tokenomics et aux normes ouvertes. Quiconque ne gère l’IA que comme une simple pipeline de fonctionnalités et corrige les coûts a posteriori perd le contact avec la nouvelle norme de cette discipline.

Valeur, autofinancement et la pression derrière la croissance de l’IA

Dans la pratique du FinOps, il ne suffit plus d’optimiser simplement les gaspillages. Les périmètres, la gouvernance, l’alignement et les prévisions pèsent désormais plus lourd que l’optimisation seule. L’objectif est la création de valeur, c’est-à-dire la contribution des investissements cloud et IA aux résultats de l’entreprise, et non plus seulement la réduction des coûts à la marge.

De nombreuses organisations financent leurs investissements IA grâce aux économies réalisées sur l’optimisation. Cet autofinancement lie la pression d’efficacité à la croissance de l’IA : chaque euro de marge libéré grâce à la discipline cloud et d’inférence peut alimenter de nouveaux modèles, agents ou cas d’usage. Pour les comités de direction, cela se traduit par une double mission de pilotage. Les programmes d’efficacité financent l’innovation, et l’innovation augmente à son tour la consommation si la gouvernance et la consommation ne progressent pas en parallèle.

McKinsey confirme ce déficit de maturité à travers une analyse secondaire. Dans son enquête Enterprise AI FinOps Survey de mai 2026, citée en juillet 2026, seuls 20 à 25 % des entreprises disposent de pratiques FinOps IA matures. Pourtant, 20 à 30 % des dépenses liées à l’IA ne sont souvent pas correctement attribuées. Selon McKinsey, une consommation optimisée permet d’économiser 20 à 30 % des coûts liés à l’IA. La conclusion stratégique est évidente : sans attribution claire et sans conception de la consommation, l’autofinancement reste une vaine espérance plutôt qu’un cycle maîtrisable.

La tokenomics transforme le token en unité de contrôle atomique

Selon J.R. Storment, directeur exécutif de la FinOps Foundation, la tokenomics applique les principes du FinOps à l’IA. Le token devient l’unité atomique de facturation et de contrôle pour l’inférence, sans pour autant représenter un droit de propriété ou un indicateur spéculatif. Ce cadre a été formalisé par Storment en mai 2026 : les coûts et l’efficacité des tokens doivent désormais figurer à l’ordre du jour des PDG.

Les tokens se distinguent des ressources cloud classiques. Les tokens d’entrée utilisateur et les tokens de prompt effectivement facturés au niveau de l’API peuvent diverger. Le suivi en temps réel des métriques liées aux tokens et à l’API est, selon la FinOps Foundation, essentiel pour éviter les dépassements budgétaires. Se contenter de consulter les factures mensuelles revient à agir trop tard.

Par ailleurs, les tokens ne représentent qu’une couche de la pile des coûts de l’IA. Au-delà, on trouve les GPU et le calcul, les embeddings SaaS, l’IA fantôme (Shadow AI) ainsi que les efforts d’ingénierie et de gouvernance. Une analyse centrée uniquement sur les tokens reste donc incomplète. CIO Dive a résumé en juin 2026 : les tokens ne constituent qu’une partie des dépenses en IA, mais la couche la plus facile à mesurer. C’est précisément pour cette raison qu’ils se prêtent idéalement comme point d’entrée dans cette discipline, sans pour autant remplacer le reste de la pile.

Cinq facteurs de consommation et baisse des prix unitaires malgré l’augmentation des dépenses globales

Cinq leviers déterminent la consommation de tokens par requête : l’overhead du prompt système, le contexte et la mémoire, le choix du modèle, la longueur de la réponse ainsi que les tentatives de relance et l’orchestration. Les agents et le RAG (Retrieval-Augmented Generation) peuvent multiplier cette consommation par un à deux ordres de grandeur. Pour la gestion de portefeuille, cela signifie que l’unité la plus coûteuse est rarement une simple conversation, mais plutôt une chaîne orchestrée de récupération, d’outils et d’appels multiples.

Le choix du modèle reste un levier direct. Utiliser systématiquement les modèles les plus coûteux et les plus complexes pour chaque tâche génère des coûts superflus. Le modèle doit correspondre au contexte et aux exigences de qualité. Une étude académique, FrugalGPT, menée par Lingjiao Chen, Matei Zaharia et James Zou en 2023, le confirme : le cascading et le routage de modèles peuvent, selon les auteurs, réduire jusqu’à 98 % des coûts par rapport à une baseline GPT-4, tout en maintenant des performances comparables. Pour les DSI, cela démontre que le routage et le cascading doivent intégrer l’architecture standard.

Les prix unitaires par token peuvent baisser, tandis que les dépenses globales augmentent. La demande est élastique : des unités moins chères génèrent une utilisation accrue, des contextes plus longs et davantage d’exécutions d’agents. Storment résume cette paradoxale ainsi : un token peut devenir moins cher, mais le coût total des tokens, lui, n’est pas réduit. Une planification budgétaire se limitant à extrapoler le prix catalogue par million de tokens sous-estime précisément cette expansion des volumes.

McKinsey définit la tokenomics de manière plus large, incluant les coûts des prompts et de l’inférence : choix du modèle, routage, orchestration, comportement des agents, conception des workflows, utilisation de l’infrastructure et élimination des gaspillages en font partie. Ainsi, l’architecture et le modèle opérationnel s’intègrent au même cercle de contrôle que le compteur de tokens.

Normes, quotas et gouvernance des parties prenantes pour une IA à grande échelle

Le 3 juin 2026, la Linux Foundation a annoncé son intention de créer la Tokenomics Foundation, dédiée aux normes ouvertes, aux benchmarks et aux bonnes pratiques de l’économie des coûts de l’IA, en partenariat avec la FinOps Foundation. Jim Zemlin, PDG de la Linux Foundation, considère les tokens comme la nouvelle unité de mesure des dépenses technologiques et souligne l’absence de normes neutres en matière d’efficacité des tokens, applicables à tous les modèles et fournisseurs. J.R. Storment réitère dans ce contexte que les coûts et l’efficacité des tokens doivent être discutés au niveau des PDG.

Les bonnes pratiques de la FinOps Foundation incluent les quotas, le tagging, l’allocation des GPU et la gouvernance des parties prenantes impliquant les data scientists, les services achats et la finance. CIO Dive rapportait en juin 2026 que la Tokenomics Foundation devrait collaborer avec la FinOps Foundation pour élaborer des bonnes pratiques destinées à l’IA d’entreprise à grande échelle. Pour les organisations DACH (Allemagne, Autriche, Suisse) travaillant avec plusieurs fournisseurs cloud et modèles, cela signifie concevoir des systèmes internes de mesure et de tagging compatibles avec les futurs benchmarks sectoriels.

Les sources primaires ne mentionnent pas de positions opposées considérant la tokenomics comme superflue. Les contrepoids se situent à l’intérieur même de cette discipline : l’optimisation seule ne suffit pas, le token ne représente pas l’ensemble de la pile, et les niveaux de maturité restent faibles dans la plupart des entreprises. Ces tensions internes rendent la gestion complexe, mais aussi adaptée à un pilotage au niveau de la direction générale.

Ce que les DSI et les CDO doivent désormais intégrer dans leur portefeuille

Premièrement : intégrer les dépenses liées à l’IA dans la ligne de reporting FinOps vers le DSI ou le DSO, et désigner clairement les responsabilités pour les quotas, les balises et les alertes budgétaires. Deuxièmement : ancrer le *consumption design* et le routage des modèles comme principes architecturaux, plutôt que de se contenter de vérifier les factures. Troisièmement : rendre transparent le *self-funding*, en identifiant quelles économies financent quels investissements en IA et quels risques en découlent pour le budget global.

Quatrièmement : cartographier la structure des coûts de l’IA, c’est-à-dire les tokens, les GPU et le calcul, les SaaS d’embeddings, l’IA fantôme (*shadow AI*) et les efforts de gouvernance. Cinquièmement : institutionnaliser des réunions régulières avec les parties prenantes, en associant les équipes de Data Science, les achats et la finance. Sixièmement : exiger un suivi en temps réel des métriques liées aux tokens et aux API, afin de détecter les dépassements budgétaires avant la clôture mensuelle.

En actionnant ces leviers, vous piloterez l’IA comme un portefeuille géré selon une logique de création de valeur mesurable. Les données de l’étude *State of FinOps 2026*, l’analyse des *tokenomics* par la FinOps Foundation et la future fondation *Tokenomics* de la Linux Foundation convergent vers une même conclusion : l’économie des coûts de l’IA passe du bordereau de la facture cloud au cœur de la stratégie, devenant ainsi un outil de pilotage pour les décisions technologiques de l’entreprise.

Foire aux questions

Qu’est-ce que la tokenomics dans le contexte du FinOps ?

La tokenomics applique les principes du FinOps à l’IA. Le token sert d’unité atomique de facturation et de pilotage des inférences. McKinsey y inclut également le choix des modèles, le routage, l’orchestration, le comportement des agents, la conception des workflows, l’optimisation de l’infrastructure et l’élimination des gaspillages.

Pourquoi les coûts de l’IA augmentent-ils malgré la baisse des prix des tokens ?

Les prix unitaires par token peuvent diminuer, tandis que la demande, elle, croît de manière élastique. Une utilisation accrue, des contextes plus longs, les agents et le RAG stimulent les dépenses globales. Les tokens deviennent individuellement moins chers, mais pas automatiquement moins coûteux pour l’entreprise dans leur ensemble.

Quels rôles doivent être intégrés dans la gouvernance des coûts de l’IA ?

La FinOps Foundation cite les quotas, le tagging, l’allocation des GPU et la gouvernance des parties prenantes, en associant les équipes Data Science, Achats et Finance. 78 % des pratiques FinOps rendent déjà des comptes au DSI ou au DAF, ce qui renforce l’impact sur le choix des technologies.

Les métriques basées sur les tokens suffisent-elles à piloter les dépenses en IA ?

Les tokens constituent la couche la plus facilement mesurable et se prêtent à un suivi en temps réel. Cependant, ils ne couvrent qu’une partie des dépenses liées à l’IA. Les coûts GPU et de calcul, les embeddings SaaS, l’IA fantôme ainsi que les dépenses d’ingénierie et de gouvernance doivent être intégrés dans la même analyse.

Quels sont les gains d’économie avérés ?

McKinsey évoque des économies de 20 à 30 % grâce à une consommation optimisée. FrugalGPT rapporte jusqu’à 98 % de réduction des coûts grâce au cascading et au routage de modèles, avec des performances comparables à la baseline GPT-4. Les leviers concrets dépendent de l’architecture et du mix des cas d’usage.

Autres contenus du réseau MBF Media

À lire aussi sur Digital Chiefs

Digital ChiefsL’IA transforme le développement en travail de vérification. Qui valide ?Digital ChiefsVous payez la R&D du prochain concurrentDigital ChiefsSécurité illusoire : quand la cyberpolice ne réagit pas en cas d’urgence
cloudmagazinFrontier Labs dévorent leurs meilleurs clients mybusinessfutureSamsung-Q2 : la mémoire reste plus rare que prévu securitytodayAnthropic : Claude a infiltré trois entreprises

Source de l’image : Générée par IA (août 2026)

Partager cet article :

Aussi disponible en

Plus d'articles

09.09.2026

Nvidia acquiert Hugging Face pour plus de 11 milliards d’euros

Eva Mickler

4 min de lecture Nvidia acquiert Hugging Face pour environ 11,1 milliards d'euros, contrat du 2 septembre ...

Lire l’article
08.09.2026

SAP laisse Joule piloter des robots, la responsabilité reste ouverte

Bernhard Liebl

4 min de lecture SAP a documenté le premier Embodied-AI-Jam dans la Swiss Smart Factory de Bienne. Des ...

Lire l’article
15.08.2026

ChatGPT pourrait espionner les conversations sur le Mac

Eva Mickler

6 min de lecture OpenAI a décrit le 13 août 2026 l’historique informatique pour l’application ...

Lire l’article
14.08.2026

SpaceX rachète Cursor : les clauses de l’UE restent en suspens

Eva Mickler

5 min de lecture L’accord de vente a été finalisé le 14 août 2026. Toute entreprise utilisant cet ...

Lire l’article
13.08.2026

CRA impose aux fabricants de déclarer sous 24 heures

Bernhard Liebl

9 min de lecture Le 11 septembre 2026, l’article 14 du Cyber Resilience Act entrera en vigueur. À ...

Lire l’article
11.08.2026

Les plans de milliards de dollars de NVIDIA et ce que les exploitants doivent désormais examiner

Bernhard Liebl

7 min de lecture NVIDIA a annoncé le 10 août 2026, en collaboration avec six partenaires financiers, ...

Lire l’article
Un magazine de Evernine Media GmbH