guides

LLM API Preisvergleich 2026: Jedes große Modell im Preis-Check

Geschrieben von Mert Batur
Aktualisiert Jul 18, 2026
10 Lesezeit
LLM API Preisvergleich 2026: Jedes große Modell im Preis-Check

LLM API Preisvergleich 2026: Jedes große Modell im Preis-Check

Ein LLM API Preisvergleich klingt einfach, bis man wirklich einen erstellen will: Die Preise haben sich in der ersten Jahreshälfte 2026 zweimal geändert, jeder Anbieter berechnet Input und Output unterschiedlich, und die „Schlagzeilen"-Zahl deckt sich selten mit der tatsächlichen Rechnung. Deshalb haben wir jede Zahl unten direkt von der offiziellen Preisseite am 14. Juli 2026 übernommen und am Ende mit einer echten Arbeitslast durchgerechnet.

Die komplette LLM API Preistabelle (2026)

Hier ist das komplette Feld auf einen Blick, angegeben in USD pro 1 Million Token. Das ist die Tabelle, die man als Screenshot teilt, deshalb steht sie ganz oben.

ModellInputOutputCache-InputKontext
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74n/a205K
Alibaba Qwen3-Max$1.20$6.00n/a262K
Mistral Medium 3.5$1.50$7.50n/a128K
Mistral Large 3$0.50$1.50n/a128K
Mistral Small 4$0.15$0.60n/a32K

Zwei Fußnoten, die wichtig sind. Claude Sonnet 5 läuft bis zum 31. August 2026 mit Einführungspreisen von $2.00 Input / $10.00 Output pro Million, danach fällt der Preis zurück auf die oben gezeigten $3.00 / $15.00. Und Gemini 2.5 Pro springt auf $2.50 Input / $15.00 Output, sobald ein einzelner Prompt die 200K-Token-Grenze überschreitet, damit ist der „Listenpreis" eigentlich nur eine Untergrenze.

Jedes Modell hier bietet außerdem eine Batch API mit pauschal 50% Rabatt auf Input und Output (Anthropic, OpenAI, Google und Alibaba), den wir weiter unten ins Praxisbeispiel einrechnen.

Wofür Sie eigentlich bezahlen

Drei Zahlen bestimmen Ihre Rechnung, und die meisten Preisseiten verstecken zwei davon.

  • Input-Token sind alles, was Sie senden: System-Prompt, Konversationsverlauf, abgerufener Kontext, die Frage des Nutzers. Bei Chat- und RAG-Anwendungen ist das meist die größere Hälfte.
  • Output-Token sind das, was das Modell generiert, und sie kosten bei fast jedem Anbieter 3-6x mehr als Input. GPT-5.6 Terra berechnet $2.50 für Input und $15.00 für Output, ein 6x-Multiplikator. Wortreiche Antworten schlagen entsprechend stärker zu Buche.
  • Cache-Input ist der Geheimtipp. Wenn Sie bei jeder Anfrage denselben System-Prompt senden, rechnet Prompt-Caching diese wiederholten Token zu etwa 10% des normalen Satzes ab. Ein Blick auf die Spalte „Cache-Input" oben: Claude Opus 4.8 fällt von $5.00 auf $0.50. Bei einer App mit hohem Traffic entscheidet genau diese eine Spalte, ob die Rechnung bei $10K oder $3K liegt. Unser Leitfaden zu Prompt-Caching behandelt das Setup für jeden Anbieter.

Die Lehre daraus: Ein reiner Vergleich der „Input-Preise" führt in die Irre. Das Modell mit dem niedrigsten Preisschild kann gegen ein etwas teureres verlieren, das besser cacht, und das Modell mit dem schreckenerregendsten Output-Preis kann am günstigsten sein, wenn Ihre Aufgabe nur Zwei-Wort-Antworten liefert.

Die günstigsten Modelle für Hochvolumen-Workloads

Wer Millionen von Token für Aufgaben wie Klassifikation, Extraktion, Zusammenfassung oder Moderation verarbeitet, findet am unteren Ende der Tabelle das meiste Sparpotenzial.

  • DeepSeek-V4 markiert mit $0.14 Input / $0.28 Output die Preisuntergrenze. Der Cache-Hit-Satz von rund $0.003 pro Million für Input ist praktisch geschenkt. Mit einem 1M-Token-Kontext und 384K maximalem Output bewältigt es die meisten Nicht-Frontier-Aufgaben mühelos.
  • Gemini 2.5 Flash-Lite mit $0.10 / $0.40 ist Googles Antwort darauf, mit demselben 1M-Kontext und einem ausgereiften Ökosystem.
  • Zhipu GLM-4.6 mit $0.43 / $1.74 liegt in der Mitte und ist ein starkes Coding-Modell. Wer es intensiv für Entwicklungsarbeit nutzt, kann mit GLMs Coding-Plan-Abo die Token-Abrechnung klar unterbieten.
  • Mistral Small 4 mit $0.15 / $0.60 ist die günstigste Option mit EU-Datenresidenz, was für regulierte Workloads entscheidend sein kann.

Der Abstand zwischen dieser Stufe und den Flaggschiffen ist alles andere als subtil. Der Output-Preis von DeepSeek-V4 ist über 50x günstiger als der von GPT-5.6 Sol. Für jede Aufgabe, bei der ein Mid-Tier-Open-Weights-Modell Ihre Qualitätsanforderung erfüllt, ist genau diese Spanne der größte Hebel für Ihre Rechnung.

Die Flaggschiff-Stufe im Vergleich

Wenn die Aufgabe tatsächlich Frontier-Reasoning braucht (komplexe Agenten, schwieriger Code, tiefgehende Analyse), stehen vier Modelle zur Auswahl. So schneiden sie preislich innerhalb derselben Intelligenzklasse ab:

FlaggschiffInputOutputKontextBesonderheit
GPT-5.6 Sol$5.00$30.001.05MHöchster Output-Preis der vier
Claude Opus 4.8$5.00$25.001MGleicher Input wie Sol, günstigerer Output
Claude Fable 5$10.00$50.001MAnthropics leistungsfähigstes Modell, teurer als Opus
Gemini 2.5 Pro$1.25$10.001MGünstigstes Flaggschiff, aber Preisstufe ab 200K

Auf dem Papier ist Gemini 2.5 Pro das Schnäppchen der Gruppe, etwa ein Viertel von Sols Output-Preis. Der Haken ist die Long-Context-Strafgebühr: Überschreitet ein einzelner Prompt 200K Token, wird die gesamte Anfrage zu $2.50 / $15.00 neu bepreist. Bei Agenten, die große Kontexte vollstopfen, frisst das einen Großteil des Vorteils auf, deshalb sollten Sie Ihre tatsächlichen Prompt-Größen durchrechnen, bevor Sie sich entscheiden.

Claude Fable 5 ist der Ausreißer bei den Kosten. Es ist über der Opus-Stufe positioniert für die anspruchsvollsten Long-Horizon-Reasoning-Aufgaben, also ein bewusstes „Greifen Sie danach, wenn Korrektheit wichtiger ist als Kosten"-Modell, keine Standardwahl.

Die versteckten Kosten, die in keiner Tabelle stehen

Ein reiner Pro-Token-Vergleich übersieht vier Dinge, die echte Rechnungen bewegen:

  1. Long-Context-Preisstufen. Gemini 2.5 Pro (über 200K) und GPT-5.6 (über etwa 272K) berechnen 1.5-2x, sobald Prompts groß werden. Wer mit langen Dokumenten arbeitet, zahlt effektiv den gestuften Satz.
  2. Cache-Write-Aufschläge. Anthropic berechnet 1.25x, um den Cache zu schreiben (2x bei der 1-Stunden-TTL), bevor Sie den 0.1x-Lesesatz erhalten. Das rechnet sich ab der zweiten Anfrage, aber bei einem Workload mit wenig Wiederholung zahlt man den Schreib-Aufschlag und profitiert nie davon.
  3. Batch vs. Echtzeit. Der 50%-Batch-Rabatt ist geschenktes Geld, wenn Ihr Workload 24 Stunden warten kann. Die meisten Teams haben mehr batch-fähigen Traffic, als sie denken (nächtliche Jobs, Backfills, Moderation).
  4. Der Anbieter, der nicht auf der Liste steht. Bei sehr hohem Volumen kann Self-Hosting eines offenen Modells auf gemieteten GPUs jeden hier gelisteten API-Satz unterbieten. Unser Leitfaden zum lokalen Betrieb von LLMs zeigt, wann diese Rechnung kippt.

Preis pro Aufgabe statt pro Token: Ein echter Job

Pro-Token-Preise sind abstrakt. Also haben wir einen echten Test gefahren. Im Juni 2026 haben wir einen Zusammenfassungs-Batch mit 50 Dokumenten (etwa 1.2M Input-Token und 120K Output-Token) durch fünf Modelle geschickt und die tatsächliche Rechnung protokolliert:

ModellEchtzeit-KostenMit Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (Einführungspreis)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n/a
DeepSeek-V4$0.20n/a

Dieselben 50 Dokumente, derselbe Prompt. Die Rechnung reichte von $4.80 bis $0.20, eine 24x-Spanne bei identischer Arbeit, noch vor dem Batching. Nachdem wir die batch-fähigen Anbieter in ihre Nacht-Queue verschoben hatten, landete Gemini 2.5 Flash bei 33 Cent. Für Zusammenfassungen, bei denen der Qualitätsunterschied zwischen diesen Modellen innerhalb unserer Fehlermarge lag, ist diese Entscheidung im großen Maßstab tausende Dollar im Monat wert.

Die Lehre: Der richtige Vergleich sind immer die Kosten pro Aufgabe, berechnet auf Basis Ihres tatsächlichen Input/Output-Verhältnisses, nicht der Listenpreis eines einzelnen Tokens. Ein Modell mit teurem Output ist günstig für Extraktion; ein Modell mit günstigem Input ist teuer für lange Generierung.

Welches Modell ist für Ihren Anwendungsfall am günstigsten?

Kurzfassung, basierend auf der Tabelle oben:

  • Chatbots und RAG (langer Input, kurzer Output): Input-Preis und Caching dominieren. Gemini 2.5 Flash und DeepSeek-V4 gewinnen; ergänzen Sie Prompt-Caching bei Ihrer Wahl.
  • Long-Form-Generierung (kurzer Input, langer Output): Der Output-Preis dominiert. Gemini 2.5 Flash-Lite und DeepSeek-V4 sind am günstigsten; GPT-5.6 Sol meiden, außer Sie brauchen dessen Reasoning.
  • Agenten und Tool-Use (großer Kontext, viele Turns): Achten Sie auf die Long-Context-Preisstufen. Claude Opus 4.8 und GPT-5.6 Terra sind vorhersehbar; Gemini 2.5 Pro ist nur unter 200K am günstigsten.
  • Coding: GLM-4.6 mit seinem Coding-Plan-Abo oder Claude Opus 4.8 für die schwierigsten Probleme.
  • Frontier-Reasoning, bei dem Korrektheit wichtiger ist als Kosten: Claude Opus 4.8 oder Claude Fable 5.

Für welches Modell Sie sich auch entscheiden, routen Sie es über ein Gateway, damit der Anbieterwechsel eine Config-Änderung bleibt und kein Rewrite. Unser Vergleich der besten LLM-Gateway-Tools deckt die Optionen ab, und wer das komplette Playbook zur Kostensenkung möchte, findet es in unserem Leitfaden zur Senkung von LLM-API-Kosten. Für einen reinen Gemini-Deep-Dive mit den multimodalen und Audio-Sätzen, die diese Tabelle nicht abdeckt, siehe unsere Gemini-API-Preisaufschlüsselung.

Wie Techsy Modelle für Kunden auswählt

Wir bauen Produktions-KI-Systeme für B2B-Kunden, und die Modellwahl ist eine der ersten Entscheidungen, die wir treffen, meist noch vor der ersten Codezeile. Unser Ansatz ist bewusst unspektakulär: Wir profilieren das tatsächliche Input/Output-Verhältnis des Workloads, kalkulieren die drei Top-Kandidaten anhand dieses Verhältnisses (nicht des Listenpreises), testen sie gegen ein Eval-Set, um Qualitätsparität zu bestätigen, und verdrahten dann das günstigste Modell, das besteht, hinter ein Gateway, damit wir es jedes Quartal neu bepreisen können, wenn neue Modelle erscheinen. Dieser letzte Schritt zählt mehr als heute das „beste" Modell auszuwählen, denn der Preis, den Sie oben sehen, wird in drei Monaten schon wieder falsch sein.

Wenn Sie gerade ein Modell auswählen oder auf eine Rechnung starren, die immer weiter klettert: Genau bei solchen Entscheidungen helfen wir. Entdecken Sie unsere KI-Integrationsleistungen oder buchen Sie ein kostenloses Architektur-Review.

Häufig gestellte Fragen

Welche LLM API ist 2026 am günstigsten?

DeepSeek-V4 ist mit $0.14 Input / $0.28 Output pro Million Token (Stand Juli 2026) das günstigste leistungsfähige Modell, mit einem Cache-Hit-Input-Satz von rund $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) und Mistral Small 4 ($0.15 / $0.60) liegen dicht dahinter. Für Frontier-Qualität ist Gemini 2.5 Pro das günstigste Flaggschiff.

Ist GPT-5.6 oder Claude Opus 4.8 teurer?

Beim Input liegen sie gleichauf ($5.00/M), aber Claude Opus 4.8 ist beim Output günstiger ($25.00/M gegenüber $30.00/M bei GPT-5.6 Sol). Bei output-lastigen Workloads gewinnt Opus 4.8 preislich; bei input-lastigen liegen sie vor dem Caching praktisch gleichauf.

Warum ist Output teurer als Input?

Token zu generieren ist rechenintensiver als sie zu lesen, deshalb berechnen fast alle Anbieter 3-6x mehr für Output. Deshalb spart das Kürzen der Antwortlänge (und die Nutzung strukturierter Outputs) pro Token mehr als das Kürzen des Prompts.

Wie viel spart Prompt-Caching tatsächlich?

Gecachte Input-Token werden bei Anthropic, OpenAI und Google zu etwa 10% des Standardsatzes abgerechnet, also mit 90% Rabatt auf den wiederholten Teil des Prompts. Bei Apps, die bei jeder Anfrage denselben System-Prompt senden, senkt Caching die Gesamtrechnung oft um 30-50%.

Sind diese Preise inklusive Batch-API-Rabatt?

Nein. Die Haupttabelle zeigt Standard-Echtzeitpreise. Anthropic, OpenAI, Google und Alibaba bieten alle eine Batch API mit pauschal 50% Rabatt auf Input und Output für nicht dringende Workloads, die bis zu 24 Stunden Latenz tolerieren.

Ist DeepSeek wirklich so viel günstiger als US-Modelle?

Auf dem Papier ja. Der Output-Preis von DeepSeek-V4 ($0.28/M) ist über 50x günstiger als der von GPT-5.6 Sol ($30/M). Der Kompromiss: US-Frontier-Modelle führen bei den schwierigsten Reasoning-Aufgaben weiterhin, deshalb arbitragieren die meisten Teams die Aufgaben mit Qualitätsparität und behalten für den Rest ein Flaggschiff.

Was ist der Haken am niedrigen Preis von Gemini 2.5 Pro?

Die Long-Context-Preisstufe. Gemini 2.5 Pro listet mit $1.25 / $10.00, aber jeder einzelne Prompt über 200K Token bepreist die gesamte Anfrage neu bei $2.50 / $15.00. Bei großen Prompts sollten Sie mit dem gestuften Satz kalkulieren, nicht mit der Schlagzeile.

Wie oft ändern sich die LLM-API-Preise?

Häufig. Die Preise haben sich in der ersten Jahreshälfte 2026 zweimal geändert, und neue Modellfamilien (wie die GPT-5.6-Stufe, die am 9. Juli 2026 gestartet ist) mischen das Feld jedes Mal neu auf. Prüfen Sie vor jeder Workload-Entscheidung immer die offizielle Preisseite des Anbieters und kalkulieren Sie vierteljährlich neu.

Welches Modell hat das größte Kontextfenster für sein Geld?

DeepSeek-V4 und die Gemini-2.5-Familie bieten einen 1M-Token-Kontext am unteren Ende der Preisspanne. GPT-5.6-Modelle liegen mit 1.05M leicht darüber, und GPT-5.4 nano erreicht 1.1M bei nur $0.20 Input, was es zur günstigsten Large-Context-Option für einfache Aufgaben macht.

Über den Autor

Mert Batur ist Co-Founder von Techsy.io, wo das Team KI-Agenten, Automatisierungssysteme und Voice-/SDR-Pipelines für B2B-Kunden entwickelt. Er schreibt über den LLM-Tooling-Stack, den das Techsy-Team tatsächlich in der Produktion einsetzt. Vernetzen Sie sich auf LinkedIn.

Quellen

Tags

llm api preisvergleichllm preisegpt-5.6 preiseclaude preisegemini preisedeepseek preisekosten pro token

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.