guides

Comparatif des prix API LLM 2026 : tous les modèles, chiffrés

Écrit par Mert Batur
Mis à jour Jul 18, 2026
12 lecture
Comparatif des prix API LLM 2026 : tous les modèles, chiffrés

Comparatif des prix API LLM 2026 : tous les modèles, chiffrés

Comparer les prix des API LLM semble simple, jusqu'au jour où on essaie vraiment de le faire : les tarifs ont bougé deux fois au premier semestre 2026, chaque fournisseur facture l'entrée et la sortie différemment, et le chiffre « en gros caractères » correspond rarement à votre facture réelle. Nous avons donc récupéré chaque prix ci-dessous directement sur la page tarifaire officielle du 14 juillet 2026, et fait le calcul pour une vraie charge de travail à la fin de l'article.

Le tableau complet des prix des API LLM (2026)

Voici l'ensemble des modèles sur un seul écran, prix en USD pour 1 million de tokens. C'est le tableau que tout le monde capture en screenshot, alors on commence par là.

ModèleEntréeSortieEntrée en cacheContexte
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74n/a205K
Alibaba Qwen3-Max$1.20$6.00n/a262K
Mistral Medium 3.5$1.50$7.50n/a128K
Mistral Large 3$0.50$1.50n/a128K
Mistral Small 4$0.15$0.60n/a32K

Deux précisions qui comptent. Claude Sonnet 5 bénéficie d'un tarif de lancement à $2.00 en entrée / $10.00 en sortie par million jusqu'au 31 août 2026, avant de repasser au $3.00 / $15.00 indiqué ci-dessus. Et Gemini 2.5 Pro passe à $2.50 en entrée / $15.00 en sortie dès qu'un seul prompt dépasse 200K tokens : son prix « catalogue » est en réalité un plancher.

Chaque modèle propose aussi une Batch API avec une remise fixe de 50% sur l'entrée comme sur la sortie (Anthropic, OpenAI, Google et Alibaba), qu'on intègre dans l'exemple chiffré plus bas.

Ce que vous payez réellement

Trois chiffres déterminent votre facture, et la plupart des pages tarifaires en enterrent deux.

  • Les tokens d'entrée regroupent tout ce que vous envoyez : prompt système, historique de conversation, contexte récupéré, question de l'utilisateur. Sur les applications de chat et de RAG, c'est souvent la plus grosse moitié de la facture.
  • Les tokens de sortie sont ce que le modèle génère, et ils coûtent 3 à 6 fois plus cher que l'entrée chez presque tous les fournisseurs. GPT-5.6 Terra facture $2.50 en entrée et $15.00 en sortie, soit un multiplicateur de 6x. Les réponses verbeuses coûtent cher.
  • L'entrée en cache est le levier sous-estimé. Si vous envoyez le même prompt système à chaque requête, le prompt caching facture ces tokens répétés à environ 10% du tarif normal. Regardez la colonne « Entrée en cache » ci-dessus : Claude Opus 4.8 passe de $5.00 à $0.50. Sur une application à fort trafic, cette seule colonne décide si votre facture atteint $10K ou $3K. Notre guide sur la mise en cache des prompts détaille la configuration pour chaque fournisseur.

Résultat : comparer uniquement le « prix d'entrée » affiché induit en erreur. Le modèle le moins cher sur le papier peut perdre face à un concurrent légèrement plus cher mais qui cache mieux, et le modèle avec le prix de sortie le plus effrayant peut se révéler le moins cher si votre tâche ne renvoie que deux mots de réponse.

Les modèles les moins chers pour les gros volumes

Si vous traitez des millions de tokens sur des tâches comme la classification, l'extraction, le résumé ou la modération, c'est en bas du tableau que se trouvent les économies.

  • DeepSeek-V4 est le plancher tarifaire à $0.14 en entrée / $0.28 en sortie. Son tarif d'entrée en cache d'environ $0.003 par million est quasiment gratuit. Avec un contexte de 1M tokens et une sortie max de 384K, il couvre confortablement la plupart des tâches qui ne demandent pas un modèle de pointe.
  • Gemini 2.5 Flash-Lite à $0.10 / $0.40 est la réponse de Google, avec le même contexte de 1M tokens et un écosystème mature.
  • Zhipu GLM-4.6 à $0.43 / $1.74 se situe entre les deux et reste un excellent modèle pour le code. Si vous l'utilisez intensivement en développement, l'abonnement coding-plan de GLM peut battre la facturation au token tout court.
  • Mistral Small 4 à $0.15 / $0.60 est l'option la moins chère avec résidence des données dans l'UE, un critère important pour les charges de travail réglementées.

L'écart entre ce segment et les modèles haut de gamme n'a rien de subtil. Le prix de sortie de DeepSeek-V4 est plus de 50 fois inférieur à celui de GPT-5.6 Sol. Pour toute tâche où un modèle open-weights de milieu de gamme atteint votre barre de qualité, cet écart est le levier le plus puissant sur votre facture.

Le segment haut de gamme, comparé

Quand la tâche exige vraiment un raisonnement de pointe (agents complexes, code difficile, analyse approfondie), le choix se joue entre quatre modèles. Voici comment ils se positionnent en prix, pour une classe d'intelligence comparable :

Haut de gammeEntréeSortieContexteÀ noter
GPT-5.6 Sol$5.00$30.001.05MPrix de sortie le plus élevé des quatre
Claude Opus 4.8$5.00$25.001MÉgal à Sol en entrée, moins cher en sortie
Claude Fable 5$10.00$50.001MLe modèle le plus performant d'Anthropic, positionné au-dessus d'Opus
Gemini 2.5 Pro$1.25$10.001MLe haut de gamme le moins cher, mais avec des paliers au-delà de 200K

Sur le papier, Gemini 2.5 Pro est l'affaire du groupe, à environ un quart du prix de sortie de Sol. Le piège, c'est sa pénalité de contexte long : dépassez 200K tokens dans un seul prompt et toute la requête repasse à $2.50 / $15.00. Pour des agents qui bourrent leur contexte, cela efface une bonne partie de l'avantage : chiffrez donc la taille réelle de vos prompts avant de trancher.

Claude Fable 5 est l'anomalie côté coût. Positionné au-dessus du niveau Opus pour le raisonnement long et le plus exigeant, c'est un modèle qu'on choisit délibérément « quand la justesse prime sur le coût », pas un choix par défaut.

Les coûts cachés qu'aucun tableau ne montre

Une comparaison au token manque quatre éléments qui font vraiment bouger la facture :

  1. Les paliers de contexte long. Gemini 2.5 Pro (au-delà de 200K) et GPT-5.6 (au-delà d'environ 272K) facturent 1.5-2x dès que les prompts deviennent volumineux. Si vous travaillez sur de longs documents, votre tarif réel est celui du palier supérieur.
  2. Les surcoûts d'écriture du cache. Anthropic facture 1.25x pour écrire le cache (2x pour un TTL d'une heure) avant d'obtenir le tarif de lecture à 0.1x. L'opération est rentabilisée dès la deuxième requête, mais une charge de travail à faible répétition peut payer le surcoût d'écriture sans jamais le récupérer.
  3. Batch contre temps réel. La remise batch de 50% est de l'argent gratuit si votre charge de travail peut attendre 24 heures. La plupart des équipes ont plus de trafic éligible au batch qu'elles ne le pensent (jobs nocturnes, backfills, modération).
  4. Le fournisseur absent de la liste. À très gros volume, auto-héberger un modèle ouvert sur des GPU loués peut battre tous les tarifs API listés ici. Notre guide sur l'exécution locale des LLM explique quand ce calcul bascule.

Le prix par tâche, pas par token : un vrai cas concret

Les prix au token restent abstraits. Alors nous en avons testé un vrai. En juin 2026, nous avons fait passer un lot de résumé de 50 documents (environ 1.2M tokens en entrée et 120K en sortie) à travers cinq modèles, et relevé la facture réelle :

ModèleCoût en temps réelAvec Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (intro)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n/a
DeepSeek-V4$0.20n/a

Mêmes 50 documents, même prompt. La facture va de $4.80 à $0.20, soit un écart de 24x sur un travail identique, avant batching. Une fois les fournisseurs éligibles basculés sur leur file d'attente nocturne, Gemini 2.5 Flash est tombé à 33 cents. Pour le résumé, où la différence de qualité entre ces modèles restait dans notre marge d'erreur, cette décision vaut des milliers de dollars par mois à l'échelle.

La leçon : la bonne comparaison est toujours le coût par tâche, calculé sur votre vrai ratio entrée/sortie, pas le prix affiché d'un seul token. Un modèle avec une sortie chère devient bon marché pour l'extraction ; un modèle avec une entrée bon marché devient cher pour la génération longue.

Quel modèle est le moins cher pour votre cas d'usage ?

Version courte, sur la base du tableau ci-dessus :

  • Chatbots et RAG (entrée longue, sortie courte) : le prix d'entrée et le caching dominent. Gemini 2.5 Flash et DeepSeek-V4 l'emportent ; ajoutez le prompt caching quel que soit votre choix.
  • Génération longue (entrée courte, sortie longue) : le prix de sortie domine. Gemini 2.5 Flash-Lite et DeepSeek-V4 sont les moins chers ; évitez GPT-5.6 Sol sauf besoin réel de son raisonnement.
  • Agents et usage d'outils (contexte large, nombreux tours) : surveillez les paliers de contexte long. Claude Opus 4.8 et GPT-5.6 Terra restent prévisibles ; Gemini 2.5 Pro n'est le moins cher que si vous restez sous 200K.
  • Code : GLM-4.6 et son abonnement coding-plan, ou Claude Opus 4.8 pour les problèmes les plus difficiles.
  • Raisonnement de pointe où la justesse prime sur le coût : Claude Opus 4.8 ou Claude Fable 5.

Quel que soit votre choix final, faites-le passer par une gateway pour que changer de fournisseur reste un changement de config, pas une réécriture. Notre comparatif des meilleurs outils LLM gateway couvre les options, et si vous voulez le guide complet pour faire baisser la facture, consultez notre article sur la réduction des coûts API LLM. Pour une analyse dédiée à Gemini avec les tarifs multimodaux et audio que ce tableau ne couvre pas, voyez notre décryptage des prix de l'API Gemini.

Comment Techsy choisit les modèles pour ses clients

Nous construisons des systèmes d'IA en production pour des clients B2B, et le choix du modèle est l'une des premières décisions à prendre, souvent avant la moindre ligne de code. Notre approche est volontairement sans surprise : nous profilons le vrai ratio entrée/sortie de la charge de travail, nous chiffrons les trois meilleurs candidats sur ce ratio (pas sur le prix affiché), nous les testons sur un jeu d'évaluation pour confirmer la parité de qualité, puis nous branchons le modèle le moins cher qui passe le test derrière une gateway, pour pouvoir le rechiffrer chaque trimestre à l'arrivée de nouveaux modèles. Cette dernière étape compte plus que choisir le « meilleur » modèle aujourd'hui, parce que le prix que vous voyez ci-dessus sera faux dans trois mois.

Si vous êtes en train de choisir un modèle ou de fixer une facture qui ne cesse de grimper, c'est exactement le type de décision sur laquelle nous pouvons vous aider. Découvrez nos services d'intégration IA ou réservez un audit d'architecture gratuit.

Questions fréquentes

Quelle est l'API LLM la moins chère en 2026 ?

DeepSeek-V4 est le modèle capable le moins cher à $0.14 en entrée / $0.28 en sortie par million de tokens en date de juillet 2026, avec une entrée en cache proche de $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) et Mistral Small 4 ($0.15 / $0.60) suivent de près. Pour un travail de qualité frontière, Gemini 2.5 Pro reste le haut de gamme le moins cher.

GPT-5.6 ou Claude Opus 4.8 : lequel coûte le plus cher ?

Ils sont à égalité en entrée ($5.00/M) mais Claude Opus 4.8 est moins cher en sortie ($25.00/M contre $30.00/M pour GPT-5.6 Sol). Pour les charges de travail à forte sortie, Opus 4.8 gagne au prix ; pour celles à forte entrée, ils sont pratiquement à égalité avant caching.

Pourquoi la sortie coûte-t-elle plus cher que l'entrée ?

Générer des tokens demande plus de calcul que les lire, donc presque tous les fournisseurs facturent la sortie 3 à 6 fois plus cher. C'est pourquoi réduire la longueur des réponses (et utiliser des sorties structurées) économise plus par token que réduire votre prompt.

Combien le prompt caching permet-il réellement d'économiser ?

Les tokens d'entrée en cache sont facturés à environ 10% du tarif standard chez Anthropic, OpenAI et Google, soit une remise de 90% sur la portion répétée de votre prompt. Pour les applications qui envoient le même prompt système à chaque requête, le caching réduit souvent la facture totale de 30-50%.

Ces prix incluent-ils la remise Batch API ?

Non. Le tableau principal montre les prix standard en temps réel. Anthropic, OpenAI, Google et Alibaba proposent tous une Batch API avec une remise fixe de 50% sur l'entrée et la sortie, pour les charges de travail non urgentes qui tolèrent jusqu'à 24 heures de latence.

DeepSeek est-il vraiment tellement moins cher que les modèles américains ?

Oui, sur le papier. Le prix de sortie de DeepSeek-V4 ($0.28/M) est plus de 50 fois inférieur à celui de GPT-5.6 Sol ($30/M). La contrepartie, c'est que les modèles américains de pointe gardent l'avantage sur les tâches de raisonnement les plus difficiles, donc la plupart des équipes arbitrent en utilisant DeepSeek là où la qualité est équivalente, et gardent un modèle haut de gamme pour le reste.

Quel est le piège avec le prix bas de Gemini 2.5 Pro ?

Son palier de contexte long. Gemini 2.5 Pro affiche $1.25 / $10.00, mais tout prompt unique dépassant 200K tokens fait repasser toute la requête à $2.50 / $15.00. Si vos prompts sont volumineux, budgétez le tarif du palier, pas le prix affiché.

À quelle fréquence les prix des API LLM changent-ils ?

Souvent. Les prix ont bougé deux fois au premier semestre 2026, et chaque nouvelle famille de modèles (comme le palier GPT-5.6 lancé le 9 juillet 2026) rebat les cartes à chaque fois. Vérifiez toujours la page tarifaire officielle du fournisseur avant d'engager une charge de travail, et rechiffrez chaque trimestre.

Quel modèle offre la plus grande fenêtre de contexte pour le prix ?

DeepSeek-V4 et la famille Gemini 2.5 offrent un contexte de 1M tokens en bas de la fourchette de prix. Les modèles GPT-5.6 montent légèrement plus haut à 1.05M, et GPT-5.4 nano atteint 1.1M pour seulement $0.20 en entrée, ce qui en fait l'option à grand contexte la moins chère pour les tâches simples.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe conçoit des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.

Sources

Tags

comparaison prix api llmprix api llmprix gpt-5.6prix claudeprix geminiprix deepseekcoût par token

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.