ai-machine-learning

Suivi des coûts LLM : évitez la flambée de la facture (2026)

Écrit par Mert Batur
Mis à jour Jul 31, 2026
16 lecture
Suivi des coûts LLM : évitez la flambée de la facture (2026)

Suivi des coûts LLM : évitez la flambée de la facture (2026)

Le suivi des coûts LLM, c'est la différence entre une facture surprise de 412 $ et un ping Slack à 80 % du budget. Ce mois-ci, Claude Sonnet 5 facture 3,00 $ par million de tokens d'entrée, et une seule boucle d'agent incontrôlée peut griller ce montant en un après-midi. La plupart des équipes câblent le suivi en une journée ; l'alerte, c'est la partie qu'elles sautent.

Points clés :

  • Le suivi des coûts LLM attache un décompte de tokens et une estimation en dollars à chaque requête, puis agrège le tout par modèle et par équipe.
  • Cinq métriques à suivre : tokens par requête, coût par fonctionnalité/équipe/modèle, taux de hits du cache, coût par conversation, taux de flambée.
  • Les budgets LiteLLM, les traces Langfuse ou Datadog LLM Observability offrent chacun une visibilité sur les dépenses en moins d'une journée.
  • Les dashboards affichent des estimations ; les tarifs d'entrée en cache et les remises batch font que la facture atterrit généralement en dessous.

Que mesure réellement le suivi des coûts LLM ?

Le suivi des coûts LLM consiste à attacher un décompte de tokens et une estimation en dollars à chaque requête LLM, puis à agréger ces estimations par modèle, par fonctionnalité et par équipe, afin de pouvoir alerter sur les dépenses avant que la facture n'arrive. L'estimation est calculée par requête à partir des tarifs de tokens publiés, consolidée selon les tags que vous apposez sur l'appel, et comparée à un budget défini à l'avance.

Le calcul sous-jacent est neutre vis-à-vis des fournisseurs. La réponse d'usage de chaque fournisseur décompose les tokens en champs, et la documentation coûts de Datadog décrit explicitement ces relations. Les conventions sémantiques GenAI d'OpenTelemetry normalisent ces mêmes champs d'un fournisseur à l'autre, si bien qu'un dashboard construit dessus n'est pas verrouillé à un seul fournisseur.

ChampCe qu'il compteFacturé au
input_tokensTout ce que vous envoyez : prompt système, historique, contexte récupéré, la questionTarif d'entrée de base
output_tokensTout ce que le modèle génèreTarif de sortie de base (3 à 6x l'entrée)
cache_read_tokensEntrée réutilisée depuis un cache précédent0,1x à 0,25x de l'entrée de base
cache_write_tokensEntrée écrite dans le cache pour la première fois~1,25x l'entrée de base (TTL 5 min chez Anthropic)
reasoning_tokensChaîne de pensée interne, sous-ensemble de la sortieTarif de sortie

Trois relations font l'essentiel du travail : total des tokens = entrée + sortie ; entrée = hors cache + cache_read + cache_write ; et les tokens de raisonnement se trouvent à l'intérieur de la sortie, au tarif de sortie. Traitez-les correctement et l'estimation par requête reste proche de la réalité ; ignorez-les et le dashboard dérive de la facture chaque mois. Le suivi des coûts est l'un des piliers de l'observabilité de l'IA ; le tracing et les evals sont les deux autres, et ils partagent ce même vocabulaire de champs.

Votre dashboard affiche une estimation ; la facture est la seule métrique de coût qui n'est jamais mise en cache.

Combien coûte 1 million de tokens en LLM ?

Cela dépend du modèle et du sens : 1 million de tokens coûte 0,14 $ en entrée DeepSeek-V4 et 15,00 $ en sortie GPT-5.6 Terra, soit un écart de 1 à 100 pour la même unité. Voici quatre modèles tirés de notre recherche tarifaire du 14 juillet 2026, vérifiés sur les pages officielles :

ModèleEntrée / 1M tokensSortie / 1M tokensEntrée en cache / 1M tokens
Claude Sonnet 53,00 $15,00 $0,30 $
GPT-5.6 Terra2,50 $15,00 $0,25 $
Gemini 2.5 Pro1,25 $10,00 $0,31 $
DeepSeek-V40,14 $0,28 $0,003 $

Sources : tarifs OpenAI et tarifs Anthropic. Une note de bas de page : Claude Sonnet 5 bénéficie d'un tarif de lancement de 2,00 $ en entrée / 10,00 $ en sortie jusqu'au 31 août 2026, puis revient aux chiffres ci-dessus.

Les 5 métriques qui comptent vraiment

Cinq métriques couvrent le suivi des dépenses LLM, et la plupart des équipes ne mettent jamais d'alerte que sur deux d'entre elles. Commencez par les deux premières lignes : les tokens par requête repèrent le gonflement des prompts le jour même où il apparaît, et le coût par équipe est le chiffre que la finance finit toujours par demander. Les trois autres affinent le tableau une fois celles-ci en place.

MétriqueComment la calculerPourquoi elle compteSeuil d'alerte
Tokens par requêteSomme entrée + sortie par appel, groupée par fonctionnalitéLe gonflement des prompts et le bourrage de contexte apparaissent ici en premier+30 % au-dessus de la médiane sur 7 jours
Coût par fonctionnalité / équipe / modèleSomme des coûts estimés, groupée par tag ou clé virtuelleLa base sur laquelle tournent réellement refacturation et budgets80 % du budget mensuel
Taux de hits du cachecache_read / total des tokens d'entréeUn taux faible signifie que vous payez le prix fort pour des prompts répétésSous 50 % à trafic stable
Coût par conversation / sessionSomme des coûts sur tous les tours d'une même sessionRévèle les agents multi-tours incontrôlés qu'une vue par requête ne voit pas2x la session au 90e percentile
Taux de flambée / d'anomalieVariation journalière de la dépense totaleLa seule métrique qui détecte une boucle cassée avant la facture+50 % d'un jour sur l'autre

Une note sur la granularité : Datadog stocke le coût par requête en nanodollars (milliardièmes de dollar) selon sa documentation coûts. À 0,14 $ le million de tokens, une seule requête DeepSeek-V4 peut coûter moins d'un millième de centime, alors agrégez avant d'arrondir, sinon le trafic des petits modèles disparaît du rapport.

Si vous ne devez suivre que deux choses, suivez les lignes un et deux. Les tokens par requête sont le signal d'alerte le plus précoce ; le coût par équipe est celui qui survit au contact d'un service comptable.

Trois façons de mettre en place le suivi des coûts LLM

Aucune des pages les mieux classées sur cette requête ne livre une seule ligne de code exécutable, alors voici trois configurations qui fonctionnent. Chacune est opérationnelle en moins d'une journée, et elles se combinent : nous faisons tourner les deux premières ensemble.

Ce que nous faisons réellement tourner en production : dans notre configuration, chaque agent client parle au proxy LiteLLM via sa propre clé virtuelle, avec un budget mensuel sur chaque clé et Langfuse qui trace chaque requête derrière le proxy. Quand nous avons déployé les deux ensemble, la répartition des rôles était l'essentiel : le proxy applique les plafonds, et les traces expliquent ce qui les a consommés. Chacune de nos clés client porte aussi un tpm_limit de 100 000 tokens par minute en guise de second fusible ; d'après la documentation de LiteLLM, le proxy rejette les requêtes une fois la limite atteinte, et c'est sur ce comportement documenté que nous nous appuyons, pas sur un benchmark que nous aurions mesuré nous-mêmes. Notre configuration évite entièrement LiteLLM 1.82.7 et 1.82.8, les deux versions touchées par l'incident supply chain de mars 2026, et épingle le tag de l'image au lieu de flotter sur latest.

Proxy LiteLLM : clés virtuelles + budgets

Techsy fait tourner une configuration de proxy LiteLLM en production avec une clé virtuelle par client et un budget mensuel sur chaque clé. La requête ci-dessous est la forme documentée dans la documentation virtual_keys de LiteLLM : d'après cette documentation, une fois que la dépense cumulée sur cette clé dépasse 50 $ dans le mois, le proxy rejette les requêtes suivantes avec une erreur de budget dépassé plutôt que de journaliser un avertissement après coup.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Faites le calcul sur les prix publiés : aux 3,00 $ / 15,00 $ par million de tokens de Claude Sonnet 5, 50 $ achètent environ 16,7M de tokens d'entrée ou 3,3M de tokens de sortie, soit à peu près une semaine de trafic pour l'un de nos agents clients les plus légers. C'est exactement le rayon d'impact que nous voulons. Le tpm_limit est le second fusible : une boucle incontrôlée déclenche les 100K tokens par minute bien avant de déclencher le budget mensuel. L'attribution par utilisateur fonctionne de la même manière via l'endpoint users, et notre guide des meilleurs outils de gateway LLM couvre les cas où un proxy mérite sa place et ceux où il n'est qu'un saut de plus.

Langfuse : tracing des coûts avec @observe

L'autocomplétion de Google associe « langfuse monitoring » à cette requête, et pour une bonne raison : Langfuse est le choix par défaut en tracing open source. Son SDK Python enveloppe votre client de fournisseur pour que chaque appel devienne une trace portant les décomptes de tokens et un coût calculé, d'après la documentation de tracing Langfuse :

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Le coût se pose sur la trace sans aucun calcul de tokens de votre côté ; groupez les traces par session ou par identifiant utilisateur pour des consolidations par fonctionnalité, et auto-hébergez si les données ne peuvent pas quitter votre réseau.

Datadog LLM Observability : si vous y êtes déjà

Si votre équipe déploie déjà des agents Datadog, sa documentation coûts LLM est la référence unique la plus complète de cette page : coût par requête en nanodollars, cost_tags personnalisés pour les ventilations par équipe et par fonctionnalité, et une vraie section de dépannage pour les trous de coûts partiels. La limite honnête : c'est réservé à Datadog. Les métriques ne quittent pas la plateforme, et il n'y a pas de repli open source si la tarification cesse de convenir. Choisissez-le pour la consolidation, pas pour la flexibilité.

Comment câbler budgets, alertes et refacturation ?

On le câble en trois couches : un plafond de budget qui rejette les requêtes à la limite, une alerte webhook qui se déclenche à un seuil en pourcentage avant le plafond, et des clés virtuelles par équipe qui transforment le showback et la refacturation en une requête plutôt qu'en une dispute. LiteLLM livre les trois nativement ; les motifs se transposent à toute gateway disposant de budgets au niveau des clés.

Un budget qui ne fait que compter est un rapport ; un budget qui rejette les requêtes au plafond est un contrôle.

Des alertes qui se déclenchent avant la flambée

Fixez l'alerte à 80 % du plafond, pas à 100 %. LiteLLM intègre nativement les alertes Slack : définissez alerting: ["slack"] et alerting_threshold: 80 dans general_settings, pointez la variable d'environnement SLACK_WEBHOOK_URL vers un canal, et un message comme celui-ci arrive quand une clé franchit le seuil :

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

À 80 %, un humain a encore des jours pour agir : rétrograder le modèle, resserrer le prompt, ou relever le plafond avec un nom sur l'approbation. Une alerte à 100 % est une autopsie.

Du showback à la refacturation

Le showback signifie que chaque équipe voit sa propre dépense ; la refacturation signifie qu'elle sort de son budget. Les deux reposent sur un seul ingrédient : une clé virtuelle par équipe, taguée à la création. Le rapport mensuel devient alors un group-by sur la table des dépenses :

ÉquipeBudget mensuelDépense à dateStatut
search50 $40,18 $alerte déclenchée à 80 %
support-chat200 $112,40 $en ligne
evals-batch30 $29,97 $plafond atteint, rejet
sandbox10 $1,06 $en ligne

Format d'exemple, pas des données clients. La ligne evals-batch est le motif qui fonctionne comme prévu : le travail batch a tourné jusqu'à son plafond et s'est arrêté, au lieu de saigner silencieusement dans la facture. Le comportement d'application est documenté dans la documentation virtual_keys de LiteLLM, y compris la façon dont la durée du budget se réinitialise.

Pourquoi votre dashboard ne correspond-il pas à la facture ?

Parce que les dashboards facturent au prix catalogue pendant que les factures appliquent des remises que votre monitoring ne voit jamais. L'entrée en cache atterrit à 0,1x à 0,25x du prix de base, le batch tourne à moitié prix, et les tokens de raisonnement sont facturés au tarif de sortie à l'intérieur du décompte de sortie. Quand les deux chiffres divergent, la facture est généralement le plus bas, et l'écart vient presque toujours de l'un des quatre modificateurs.

Modificateur de prixMultiplicateur typiqueEffet sur votre estimation
Entrée en cache (lecture de cache)0,1x à 0,25x de l'entrée de baseLe dashboard surestime s'il facture les hits de cache au prix fort
API Batch0,5x sur l'entrée et la sortieLes jobs asynchrones coûtent la moitié du chiffre suivi
Tokens de raisonnement1x le tarif de sortie, comptés dans la sortieLes longues chaînes de pensée grillent le budget de sortie en silence
Écriture de cache~1,25x l'entrée de baseLa première requête d'une fenêtre de cache coûte un peu plus

Le catalogue ouvert pydantic/genai-prices montre pourquoi ces multiplicateurs diffèrent d'un modèle à l'autre : chaque fournisseur fixe ses propres facteurs de cache et de batch, si bien qu'une table de prix codée en dur dérive le jour où un fournisseur révise ses grilles. La documentation coûts de Datadog documente l'autre moitié du problème, les trous de coûts partiels où un champ de tokens manquant renvoie COST UNAVAILABLE pour une requête. Regardez de ce côté quand le dashboard affiche moins que la facture ; regardez la table des remises quand il affiche plus. Le mécanisme derrière le plus gros multiplicateur est la mise en cache des prompts LLM, et un taux de hits de cache élevé est la raison la plus fréquente pour laquelle une estimation suivie dépasse la facture réelle.

Une estimation de coûts sans les remises de cache et de batch est un plafond, pas une prévision.

Quels outils font réellement du suivi des coûts LLM ?

Six outils couvrent l'essentiel des configurations de production : Langfuse, LiteLLM, Helicone et Portkey côté open source et gateway, Datadog et Braintrust côté commercial. La ligne de partage honnête est celle de l'application contre l'observabilité : un proxy peut rejeter des requêtes à un budget donné, tandis qu'un outil de tracing mesure la dépense après coup. La plupart des stacks matures finissent avec un de chaque.

OutilTypeApproche du suivi des coûtsOffre gratuiteChoisissez-le si...
LangfuseOpen sourceCoût par trace à partir des grilles de prix des modèles, auto-hébergeableGratuit en auto-hébergement ; offre hobby gratuite sur le cloudVous voulez l'open source et posséder les données
LiteLLMProxy open sourceBudgets par clé et par équipe appliqués à la gatewayGratuit (OSS) ; entreprise payanteVous avez besoin de budgets qui rejettent les requêtes, pas seulement qui comptent
HeliconeGateway open sourceJournaux de coûts au niveau du proxy par clé et par modèleOffre gratuite avec limites de débitVous voulez un swap de proxy en une ligne sans changer de SDK
PortkeyGateway commercialeBudgets de clés virtuelles plus analyse des coûtsOffre développeur gratuiteVous voulez gateway, prompts et evals dans un seul panneau
Datadog LLM ObservabilityCommercialMétriques de requête en nanodollars plus cost_tagsEssai de 14 joursVous faites déjà tourner Datadog pour tout le reste
BraintrustCommercialDépense liée aux evals par projetOffre gratuiteVotre travail sur les coûts part des evals, pas des factures

Une mise en garde sur le contenu des fournisseurs dans ce domaine : la propre comparaison 2026 de Braintrust sur les outils de suivi des coûts se classe elle-même première et omet toutes les options open source du tableau ci-dessus. Lisez les listicles des fournisseurs pour leurs données, pas pour leurs classements.

Pour une équipe qui part de zéro, nous ferions tourner LiteLLM devant et Langfuse derrière : le proxy applique les budgets, les traces les expliquent, et l'attelage ne coûte rien tant que vous ne passez pas aux offres hébergées. Si vous pesez les deux choix par défaut en tracing, notre comparatif Langfuse vs Langsmith examine cette décision en profondeur, et le tour d'horizon des meilleures plateformes d'observabilité IA couvre l'ensemble du champ.

Du monitoring à la réduction des coûts

Le monitoring montre où va l'argent ; l'étape suivante est de décider combien y va. Les trois leviers, par ordre de rendement : mettre en cache les entrées répétées, router les requêtes faciles vers des modèles moins chers, et réduire la taille du modèle là où la qualité tient encore. Notre guide pour réduire les coûts d'API LLM couvre chaque levier, et le comparatif des prix d'API LLM est l'entrée de tous les calculs ci-dessus.

Notre point de vue : quand la dépense LLM d'un client le surprend, nous monitorons d'abord et coupons ensuite, jamais l'inverse. Les équipes qui mettent en cache avant de mesurer finissent généralement par mettre en cache les mauvais prompts. Le monitoring dit où va l'argent ; la mise en cache et le routage décident combien y va. Si votre facture fait déjà mal, obtenez une consultation gratuite et nous regarderons les chiffres avec vous.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe livre des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la stack d'outillage LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.

Questions fréquemment posées

Combien coûte 1 million de tokens en LLM ?

Au prix catalogue, de 0,14 $ à 15 $ par million selon le modèle et le sens : l'entrée DeepSeek-V4 coûte 0,14 $ par million, tandis que la sortie GPT-5.6 Terra coûte 15 $. Les tokens de sortie valent 3 à 6 fois le tarif d'entrée chez tous les grands fournisseurs. Le tableau de la première section couvre quatre modèles, et notre comparatif des prix d'API LLM tarifie les dix-sept, vérifié sur les pages OpenAI et Anthropic en juillet 2026.

Qu'est-ce que l'optimisation des coûts LLM ?

La pratique qui consiste à baisser le coût par requête sans sacrifier la qualité : mise en cache des prompts pour les entrées répétées, routage des tâches faciles vers des modèles moins chers, API batch pour le travail asynchrone, et dimensionnement du modèle au plus juste par fonctionnalité. Le suivi des coûts LLM est le prérequis, car on ne peut pas optimiser ce qu'on n'a pas attribué. Le taux de hits de cache et le coût par fonctionnalité sont les deux métriques qui pointent d'abord vers les plus gros leviers.

Pourquoi les LLM sont-ils si chers ?

L'inférence est limitée par le calcul : chaque token généré exécute une passe avant complète du modèle sur des GPU, et les modèles de raisonnement dépensent des tokens supplémentaires à réfléchir avant de répondre, facturés au tarif de sortie. Les longs prompts système multiplient ce coût sur chaque requête. La facture croît avec la verbosité des deux côtés de l'appel, c'est pourquoi les tokens par requête sont la première métrique à surveiller.

Combien coûte un LLM aux États-Unis ?

Les tarifs d'API sont libellés en dollars et mondiaux : OpenAI, Anthropic et Google facturent le même prix catalogue par million de tokens, que la requête parte de l'Ohio ou d'Osaka. Les différences régionales apparaissent dans l'auto-hébergement, où les heures de GPU varient selon la région cloud, et dans les plateformes hébergées qui ajoutent une marge. Pour le travail par API, la localisation change la latence, pas le prix.

Comment suivre les coûts LLM par équipe ?

Émettez une clé virtuelle par équipe via un proxy comme LiteLLM, taguez chaque clé avec le nom de l'équipe à la création, et agrégez la dépense par ce tag. Chaque requête porte alors son attribution dès l'instant où elle est émise, sans aucune analyse de logs. Le tableau de showback dans la section budgets ci-dessus est le produit fini : équipe, budget mensuel, dépense à date, statut.

Langfuse ou Datadog pour le suivi des coûts LLM : lequel choisir ?

Choisissez Langfuse si vous voulez l'open source, l'auto-hébergement et des données que vous contrôlez ; il est gratuit à faire tourner et trace le coût par requête dès l'installation. Choisissez Datadog uniquement si votre équipe le fait déjà tourner pour l'infrastructure, car ses fonctionnalités de coûts LLM ne quittent pas la plateforme. Pour la plupart des équipes qui démarrent de zéro, Langfuse plus un proxy LiteLLM bat l'une ou l'autre option seule.

Les coûts LLM estimés correspondent-ils à la facture réelle ?

Non, et généralement la facture est plus basse. Les dashboards facturent au prix catalogue tandis que l'entrée en cache atterrit à 0,1x à 0,25x et les jobs batch à 0,5x, si bien qu'une charge de travail fortement mise en cache voit la facture réelle arriver bien sous l'estimation suivie. Des champs de tokens manquants poussent l'erreur dans l'autre sens. Le tableau de dérive ci-dessus liste chaque multiplicateur et où regarder.

Comment alerter sur les flambées de dépense LLM ?

Fixez une alerte de seuil à 80 % du budget mensuel de chaque équipe, distribuée sur Slack par webhook, plus une alerte d'anomalie jour sur jour à +50 % pour les boucles qui grillent vite. LiteLLM livre nativement le motif de seuil via son réglage alerting_threshold. Une alerte à 80 % laisse des jours pour réagir ; une alerte à 100 % confirme seulement que le plafond a fait son travail.

Existe-t-il un outil gratuit de suivi des coûts LLM ?

Oui, trois qui tiennent la route. Langfuse auto-hébergé est gratuit et open source, avec une offre hobby gratuite sur le cloud d'après la page tarifs de Langfuse. Les budgets de clés intégrés de LiteLLM ne coûtent rien sur le proxy open source. L'offre gratuite d'Helicone couvre les journaux de coûts au niveau du proxy avec des limites de débit. Les offres gratuites couvrent le monitoring ; l'application et les alertes à l'échelle sont là où commencent les offres payantes.

Conclusion

Choisissez un chemin de configuration aujourd'hui, car l'alerte que vous voudrez dans six semaines prend un après-midi à câbler maintenant. La version courte :

  • Suivez d'abord les tokens par requête et le coût par équipe ; ajoutez les trois autres métriques une fois que celles-ci fonctionnent.
  • Un budget qui rejette les requêtes est un contrôle ; celui qui ne fait que compter est un rapport.
  • Fixez l'alerte à 80 %, dans Slack, avant que la facture ne puisse surprendre quiconque.
  • Votre dashboard est une estimation ; les tarifs d'entrée en cache et batch font que la facture atterrit généralement en dessous.

Si vous préférez que quelqu'un regarde vos chiffres avec vous, obtenez une consultation gratuite.

Tags

suivi des coûts llmtracking des coûts llmsuivi de la consommation de tokensobservabilité llm

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.