Calculateur de coût des API OpenAI, Claude et Gemini
Comparez le coût mensuel d’un fournisseur à l’autre, économies de caching et de batch comprises.
Le coût des API GPT, Claude et Gemini va de 0,15 $ à 75 $ par million de tokens d’entrée, les tokens de sortie étant en général 3 à 5 fois plus chers. Pour 10 millions de tokens par mois, comptez environ 775 $ avec GPT-4o, 1 140 $ avec Claude Sonnet 4 et 825 $ avec Gemini 2.5 Pro. Le prompt caching divise par 10 le coût des tokens mis en cache ; la Batch API le réduit de 50 % pour les traitements qui ne sont pas en temps réel. Ce calculateur vous permet de modéliser précisément votre consommation chez les trois fournisseurs.
Vos paramètres
05 fieldsQui devrait utiliser cet outil
Les fondateurs qui cadrent un projet openai api avant de consulter des prestataires. Les CTO et responsables techniques qui bâtissent un budget annuel pour de nouveaux développements. Les product managers qui transforment une idée en une ligne en fourchette défendable face à la finance. Les équipes achats qui vérifient la cohérence des devis d'agences et de prestataires.
Comment nous calculons
Tarifs établis d’après les grilles publiques d’OpenAI, d’Anthropic et de Google en 2026. Le prompt caching ne porte que sur les tokens d’entrée mis en cache (en général le prompt système et le contexte stable). La Batch API s’applique aux tokens d’entrée comme de sortie, pour les traitements hors temps réel, avec un SLA de 24 heures.
Sources de données
Les facteurs qui font bouger le chiffre
Sélection du palier de modèle
Les modèles de pointe comme GPT-4.5, Claude Opus 4 et Gemini 2.5 Pro coûtent 5 à 10 fois plus cher au token que leurs équivalents de milieu de gamme. Ne réservez le haut de gamme qu’aux tâches de raisonnement difficiles où le milieu de gamme échoue réellement : logique complexe à plusieurs étapes, mathématiques, génération de code ambigu ou tâches qui exigent une connaissance approfondie du monde. Pour tout le reste, routez vers Claude Sonnet 4, GPT-4o ou Gemini Flash. L’écart de coût est assez large pour qu’un routage intelligent réduise en général la dépense de 60 à 80 % sur des charges mixtes.
Prompt caching
Anthropic met les tokens d’entrée en cache pendant 5 minutes gratuitement, ou 1 heure moyennant une surcharge de 25 %, ce qui réduit d’environ 90 % le coût des tokens mis en cache. OpenAI met en cache automatiquement pendant 5 à 10 minutes sur certains endpoints, sans aucune configuration. Le cache donne le meilleur quand votre prompt système dépasse 2 000 tokens et reste stable d’une requête à l’autre, ce qui correspond à la plupart des chatbots et systèmes RAG en production. Les économies culminent sur les charges à contexte long et stable, et à fort débit de requêtes.
Batch API
OpenAI et Anthropic proposent tous deux des endpoints batch à exactement 50 % du tarif standard, en échange d’un SLA de 24 heures. Le batch est idéal pour la classification, la génération d’embeddings, le résumé, les campagnes d’évaluation et tout traitement en arrière-plan. L’intégration ne demande presque rien : même modèle, même prompt, un endpoint différent et une file d’attente pour récupérer les résultats. La plupart des équipes passent à côté du batch et paient plein tarif pour des charges sans la moindre exigence de temps réel, l’un des coûts d’IA les plus simples à éviter.
Tokens de sortie
Chez tous les fournisseurs, les tokens de sortie coûtent 3 à 5 fois plus cher que ceux d’entrée, et la plupart des réponses n’ont pas besoin de la marge de 4 000 tokens de sortie que l’API autorise par défaut. Pour une réponse par oui ou non, plafonnez la sortie à 10 tokens. Pour un court résumé, plafonnez à 200. Le modèle a souvent envie d’expliquer son raisonnement même quand vous ne le lui demandez pas, et ces explications, c’est vous qui les payez. Resserrer max_tokens réduit souvent le coût de sortie de 30 à 50 % sans toucher à la qualité.
La fenêtre de contexte n'égale pas le prix
Tous les grands fournisseurs facturent au token consommé, pas selon la taille de la fenêtre de contexte. Utiliser une fenêtre de 200K pour un prompt de 5K tokens coûte exactement la même chose qu’utiliser une fenêtre de 5K pour ce même prompt de 5K. Autrement dit, les modèles à long contexte ne sont pas « plus chers à l’usage », sauf si vous remplissez réellement le contexte. Choisissez le modèle d’après sa capacité et son prix au token, pas d’après la fenêtre de contexte la plus large.
Comment réduire le coût
Activez le prompt caching en tout premier, avant toute autre optimisation. Chez Anthropic, marquez votre prompt système stable avec des en-têtes cache_control et le coût des tokens mis en cache tombe à environ 10 % du tarif d’entrée standard. Chez OpenAI, le cache se déclenche automatiquement sur certains endpoints dès que le préfixe de votre prompt est identique d’une requête à l’autre. Le gain est maximal sur les charges à contexte long et stable et à fort volume de requêtes : chatbots aux personas détaillés, systèmes RAG au contexte de récupération récurrent, et toute boucle d’agent qui renvoie un long jeu d’instructions. La plupart des équipes oublient d’activer le cache et paient 5 à 10 fois trop cher.
Basculez toutes vos charges hors temps réel vers la Batch API. Anthropic et OpenAI proposent des endpoints batch à exactement 50 % du tarif standard, en échange d’un SLA de réponse de 24 heures. La classification, la modération de contenu, la génération d’embeddings, les pipelines de résumé et les campagnes d’évaluation sont autant de bons candidats. L’intégration ne demande presque rien, puisque le prompt et le modèle ne changent pas. Bien des équipes font tourner tout leur pipeline d’étiquetage de contenu au tarif standard, alors que le batch diviserait la facture par deux sans la moindre différence de qualité.
Routez les requêtes selon leur difficulté. Les requêtes simples (salutations, mise en forme, recherches de base) ont leur place sur GPT-4o mini, Claude Haiku ou Gemini Flash, à 0,15 à 0,80 $ par million de tokens d’entrée. Le raisonnement difficile revient à Claude Opus, GPT-4.5 ou Gemini Pro, à 1,25 à 75 $ par million. Un petit classifieur placé devant votre routeur de modèles réduit en général les coûts de 60 à 80 % sur des charges mixtes. Tout envoyer vers un modèle de pointe est l’erreur de coût d’IA la plus courante que nous voyons en production.
Plafonnez max_tokens sans état d’âme. Les tokens de sortie coûtent 3 à 5 fois plus cher que ceux d’entrée, et la marge de sortie par défaut de 4 000 tokens dépasse de loin ce dont la plupart des réponses ont besoin. Plafonnez les réponses par oui ou non à 10 tokens, les courts résumés à 200, le JSON structuré à ce qu’exige votre schéma plus une petite marge. Le modèle a parfois envie de s’étendre même quand vous ne le demandez pas, et ce sont ces digressions que vous payez. Resserrer max_tokens réduit le coût de sortie de 30 à 50 % dans la plupart des cas.
Réduisez le contexte récupéré au strict nécessaire pour chaque requête. Les systèmes RAG récupèrent souvent 10 à 20 fragments et les empilent tous dans le prompt, par prudence. Résultat : vous payez des milliers de tokens hors sujet à chaque requête. Ajouter un reranker qui ne retient que les 3 à 5 fragments les plus pertinents réduit en général la consommation de tokens d’entrée de 50 à 70 %, sans perte de qualité, et souvent avec un gain, car le modèle n’est plus distrait par un contexte hors sujet.
Journalisez chaque requête avec son nombre de tokens, le modèle utilisé et son statut, en cache ou hors cache. On n’optimise pas ce qu’on ne mesure pas, et les coûts d’IA peuvent changer de visage du jour au lendemain, dès qu’une nouvelle fonctionnalité sort ou qu’un prompt est retouché. Mettez en place des alertes de dépense quotidiennes. Construisez un tableau de bord qui ventile la dépense par fonctionnalité, par modèle et par endpoint. La plupart des dépassements que nous rencontrons en production viennent d’un schéma d’usage qui a changé deux semaines avant que quiconque ne regarde la facture.
Coût par million de tokens (tarifs 2026)
| Modèle | Entrée | Sortie | Entrée en cache |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
FAQ
Questions reçues chaque semaine
Des réponses courtes, en langage clair. Si votre question n’y figure pas,
GPT-4o : 2,50 $ par million de tokens d’entrée, 10 $ en sortie. GPT-4o mini : 0,15 $/M en entrée, 0,60 $ en sortie. GPT-4.5 : 75 $/M en entrée, 150 $ en sortie. Pour 10M de tokens par mois, avec une répartition entrée/sortie de 30/70, comptez de 25 $ à 13 000 $ selon le modèle.
Pour la plupart des charges de travail : GPT-4o mini, Gemini 2.5 Flash ou Claude Haiku 4, toutes sous la barre du dollar par million de tokens d’entrée. Pour le meilleur rapport qualité/prix : Claude Sonnet 4 ou Gemini 2.5 Pro.
Anthropic et OpenAI mettent en cache les gros prompts d’entrée d’une requête à l’autre. Les tokens mis en cache coûtent environ 90 % de moins. Idéal pour les chatbots dont le prompt système est stable, ou pour le RAG dont le contexte ne change pas.
Exactement 50 % sur les tokens d’entrée comme de sortie. En contrepartie, il faut accepter un SLA de 24 heures. Parfait pour la classification, le résumé, les embeddings et l’évaluation. À éviter pour le chat temps réel ou une expérience interactive.
À niveaux de qualité comparables, les coûts sont proches. Claude Sonnet 4 et GPT-4o sont quasiment à égalité. Avec le prompt caching, Claude Opus 4 revient environ 30 % moins cher que GPT-4o sur les charges à prompt stable.
(1) Activez le prompt caching. (2) Utilisez la Batch API dès que possible. (3) Routez les requêtes simples vers les modèles mini. (4) Plafonnez max_tokens sans état d’âme. (5) Réduisez le contexte récupéré à l’essentiel.
Le seuil de rentabilité se situe autour de 5 000 $ par mois de dépenses API. En dessous, restez sur les API. Au-dessus, auto-héberger Llama 3.1 ou Mistral peut réduire les coûts de 50 à 70 %, à condition d’avoir l’expertise infrastructure.
Prenez un échantillon représentatif de 100 requêtes. Mesurez la moyenne des tokens d’entrée et de sortie. Multipliez par votre volume mensuel de requêtes, puis par le coût au million de tokens. Ajoutez 30 % de marge de sécurité.
Uniquement pour les tâches de raisonnement difficiles où les modèles de milieu de gamme échouent. Pour 80 % des charges en production, Sonnet 4, GPT-4o ou Gemini 2.5 Pro font l’affaire, à un coût 10 fois moindre.
À ±15 % près pour les charges courantes. Les écarts réels tiennent à la variation de longueur des prompts, à celle des sorties, aux boucles d’erreurs et de relances, et à la logique de routage. Servez-vous-en comme outil de planification, pas comme estimation de la facture finale.
Outils similaires
Les autres calculateurs que l’on ouvre le plus souvent juste après celui-ci ; choisissez celui qui correspond à votre prochaine décision.
Coût de développement et coût d’exploitation mensuel : la vision complète.
Obtenez une estimation précise auprès de notre équipe
Un calculateur vous donne une fourchette. Un appel de 30 minutes vous donne un périmètre, un calendrier et un budget fermes. Consultation gratuite, sans engagement.
Démarrer la conversation