ai-machine-learning

Grok 4.6 vs Grok 4.5: Wir haben am Launch-Tag 80 API-Aufrufe gemacht – gleiches 40/40, 1.38× die Rechnung

Geschrieben von Gokay Yilmaz
Aktualisiert Aug 12, 2026
10 Lesezeit
Grok 4.6 vs Grok 4.5: Wir haben am Launch-Tag 80 API-Aufrufe gemacht – gleiches 40/40, 1.38× die Rechnung

Grok 4.6 vs Grok 4.5: Wir haben am Launch-Tag 80 API-Aufrufe gemacht – gleiches 40/40, 1.38× die Rechnung

Grok 4.6 hat uns $0.2992 gekostet, um 40 bewertete Aufgaben zu lösen. Grok 4.5 hat $0.2174 für dieselben 40 gekostet – und dieselben Antworten geliefert.

Wir haben es am 12 August 2026 gemessen, Stunden nachdem SpaceXAI (vormals xAI) das Modell veröffentlicht hatte. Gleiche Preisliste: $2 pro Million Input-Tokens, $6 für Output. Gleicher Score: 40/40 gegen 40/40. Der Unterschied liegt bei 1.90× der medianen Output-Tokens bei 4.6, was auf eine um 38% höhere Rechnung hinausläuft.

Was SpaceXAI am 12 August veröffentlicht hat

SpaceXAI hat Grok 4.6 am 12 August 2026 zu $2 pro Million Input-Tokens und $6 für Output veröffentlicht – dieselbe Preisliste wie bei Grok 4.5. Es ging laut 9to5Mac um 08:56 PT live, und die offizielle Ankündigung (abgerufen 2026-08-12) stellt Agentic Coding in den Vordergrund, veröffentlicht dabei aber überhaupt keine Zahl zu Betriebskosten, Latenz oder Token-Verbrauch.

  1. Gleichzeitige Verfügbarkeit als grok-4.6 über die SpaceXAI-API und als x-ai/grok-4.6 auf OpenRouter.
  2. Ein 500K-Token-Kontextfenster, unverändert gegenüber Grok 4.5.
  3. $2/M Input, $6/M Output, plus eine schnellere Variante zum doppelten Satz.
  4. Ein Artificial-Analysis-Intelligence-Index-Score von 61, den der Hersteller als gleichauf mit GPT-5.6 Sol einordnet.
  5. Ein qualitativer 4.5-Vergleich: stärkere erste Durchläufe bei visuellen und interaktiven Projekten.

Cursors Launch-Day-Bericht liest sich wie eine unabhängige Bestätigung, ist es aber nicht: SpaceX hat sich verpflichtet, Cursors Hersteller Anysphere für $60B in Aktien zu übernehmen, angekündigt am 16 June 2026.

Solltest du auf Grok 4.6 wechseln?

Bleib für Routine-Strukturarbeit bei 4.5: Unsere 80 Aufrufe lieferten identische Antworten für 1.38× die Kosten. Die Preisliste ist auf beiden OpenRouter-Modellseiten byte-identisch, eine Preisseite kann dich also nicht warnen. Token-Zahlen können es.

MetrikGrok 4.6Grok 4.5
AA Intelligence Index6156
Preis pro M (Input / Output)$2 / $6$2 / $6
Cached Input pro M$0.50$0.30
Bestandene Aufgaben (unsere, 80 Aufrufe)40/4040/40
Median Output-Tokens (unsere)409215
Kosten für dieselbe Antwort (gemessen)$0.2992$0.2174
Median-Latenz (unsere)5.25 s4.17 s
Wähle das, wennLong-Horizon-Agentenarbeitkurze strukturierte Aufrufe in hohem Volumen

Zeilen mit „unsere" markiert sind unsere eigenen, gemessen am Launch-Tag; Index- und Cache-Zeilen stammen von Artificial Analysis, abgerufen 2026-08-12.

Identische Preisliste, 1.90× die Tokens, damit rund 1.38× die Rechnung für dieselben Antworten. Das ist die Frage grok 4.6 vs grok 4.5 für die meisten Produktions-Workloads: gleicher Preis pro Token, eine andere Rechnung.

Was 80 API-Aufrufe am Launch-Tag tatsächlich zeigten

Über 80 Launch-Day-Aufrufe bei Temperature null erreichten beide Modelle 40/40, während 4.6 1.90× die mediane Anzahl an Output-Tokens verbrauchte.

Wir haben jeden Prompt zweimal geschickt, einmal an x-ai/grok-4.6 und einmal an x-ai/grok-4.5, gemessen über OpenRouter bei temperature: 0. Runde 1 (24 Aufrufe) war leicht: die JSON-Schema-Aufgaben, die wir bewertet haben, eine Preisberechnung, ein Python-Bugfix, eine eingeschränkte Schreibaufgabe. Runde 2 (24 Aufrufe) wurde härter, nachdem Runde 1 gesättigt war: ein Terminplanungs-Rätsel, eine Einheiten-Umrechnungsfalle, ein 402-Zeilen-Needle-Retrieval mit einem REVOKED-Ablenker sowie eine Spezifikationsaufgabe, bei der retry_on 429 und 503 enthalten muss, aber nicht 500. Runde 3 (32 Aufrufe) ist die Kontrolle weiter unten. Jeder Grader ist deterministisch; nichts wird per LLM bewertet. Skripte grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; Rohdaten in benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Gesamtausgabe: $0.52.

python
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
    r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
        headers={"Authorization": f"Bearer {KEY}"},
        json={"model": model, "temperature": 0,
              "messages": [{"role": "user", "content": PROMPT}]}).json()
    u = r["usage"]
    print(model, u["completion_tokens"],
          u["completion_tokens_details"]["reasoning_tokens"])
Runde bei Standard-EffortGrok 4.6Grok 4.5
1, leicht (24 Aufrufe)12/12, 468 Median Output-Tok12/12, 241 Tok
2, schwer (24 Aufrufe)12/12, 493 Median Output-Tok12/12, 332 Tok

Der Vor-Launch-Konsens, ein X-Post von @haider1 vom 11 August, der über zahlreiche Aggregator-Blogs kopiert wurde, ging davon aus, dass 4.6 die Geschwindigkeit und Token-Effizienz von 4.5 halten würde. SpaceXAI hat das nie behauptet; die Ankündigung enthält keinerlei Token-Aussage. Unite.AI merkte am Launch-Tag an, dass „bislang keine unabhängige Auswertung" die Behauptungen des Modells bestätigt habe – hier ist eine. Grok 4.6 verbrauchte 409 mediane Output-Tokens gegenüber 215 bei Grok 4.5 auf identischen Prompts bei Temperature null, 365 mediane Reasoning-Tokens gegenüber 200, und 27,565 insgesamt gegenüber 13,929. Was auch immer 4.6 gewinnt, es bezahlt dafür mit 1.90× der medianen Output-Tokens.

Am Rand der Verteilung tut es am meisten weh

Gleicher Prompt, temperature: 0, drei Durchläufe von unit_trap in den Runden mit Standard-Effort:

DurchlaufGrok 4.6Grok 4.5
112.25 s / 726 Tok8.38 s / 414 Tok
223.20 s / 1,400 Tok15.32 s / 750 Tok
381.61 s / 4,770 Tok10.08 s / 480 Tok

Eine 6.6×-Streuung bei 4.6 gegenüber 1.8× bei 4.5, bei byte-identischen Eingaben. Wenn du ein Timeout oder ein Token-Budget pro Anfrage dimensionierst, zählt dieser Rand der Verteilung mehr als der Median – und das spricht dafür, wann das neuere Modell die falsche Standardwahl ist.

Die eine Aufgabe, die anders lief

Bei constraint_schedule war 4.6 im Median schneller in den Standard-Effort-Runden: 26.38 s gegenüber 34.21 s, dazu bei weniger Output-Tokens (1,644 gegenüber 1,710). Nur die Zahlen zu berichten, die zu einer These passen, ist genau das, was Leser und Google abwerten.

Ist es das Modell, oder ist es der Default?

reasoning_effort bei beiden Modellen auf denselben Wert zu fixieren schließt die Lücke nicht – sie wird größer, von 1.51× auf 2.91×. docs.x.ai (abgerufen 2026-08-12) listet vier Stufen (low, medium, high, xhigh), und Runde 1 und 2 haben keine davon gesetzt, sodass die Lücke ein Effekt der ausgelieferten Voreinstellung hätte sein können. Runde 3 hat den Wert über 32 Aufrufe hinweg explizit fixiert.

Angeglichener Effort4.6 Median Output4.5 Median OutputVerhältnisGenauigkeit
low222 Tok147 Tok1.51×8/8 vs 8/8
high606 Tok208 Tok2.91×8/8 vs 8/8

Wäre die Lücke bei angeglichenem Effort verschwunden, hätte die ehrliche Schlagzeile gelautet „es ist nur ein Default". Das war nicht der Fall.

Wie senkst du Grok 4.6s Token-Rechnung?

reasoning_effort auf low setzen, und der Median-Output von 4.6 sinkt von 438 auf 222 Tokens, bei unveränderter Genauigkeit von 8/8. Dieselben vier Aufgaben in beiden Fällen: Die Default-Zahl bündelt zwölf Aufrufe aus den ersten beiden Runden, die low-Zahl acht aus der Kontrolle.

json
{
  "model": "x-ai/grok-4.6",
  "messages": [{"role": "user", "content": "..."}],
  "temperature": 0,
  "reasoning": {"effort": "low"}
}

Das ist eine Reduktion um 49%, was bei $6 pro Million Output-Tokens für Aufrufe dieser Art rund $1.30 pro tausend Aufrufe wert ist. Ein einziger Request-Parameter halbiert Grok 4.6s Output-Rechnung bei Routine-Strukturarbeit fast, ohne dass wir dabei irgendetwas Messbares eingebüßt hätten. Vier Aufgaben sind ein Hinweis, keine Regel: Teste es zuerst an deiner eigenen Mischung.

Was die Messungen anderer zeigen

Artificial Analysis hat auf seiner eigenen Evaluierungssuite $1,068.47 abgerechnet, um Grok 4.6 zu bewerten, gegenüber $579.21 für Grok 4.5. Ihre Zahlen, nicht unsere, von ihren Grok-4.6- und Grok-4.5-Modellseiten auf artificialanalysis.ai, abgerufen 2026-08-12.

Metrik (Artificial Analysis)Grok 4.6 (high)Grok 4.5 (high)Verhältnis
Intelligence Index6156+5 Pkt
Output-Tokens für den Index-Lauf72M60M1.20×
Kosten für den Index-Lauf$1,068.47$579.211.84×
Zeit bis zum ersten Token32.30 s8.68 s3.72×
Cache-Hit-Preis pro M$0.50$0.301.67×

Ihr 1.84× und unser 1.38× stimmen nicht überein, und der Grund dafür ist aufschlussreich: Ihre Aufgabenmischung ist gewichtiger, und ihre Gesamtsumme rechnet Input-Tokens mit ein, während unsere isoliert auf Output schaut. Zwei Messinstrumente, dieselbe Richtung.

Die Cache-Zeile wurde zuerst von HN-Nutzer pzo im Launch-Thread (Kommentar 49275740) angemerkt und bestätigt sich auf beiden Seiten: ein Plus von 67%, und es trifft am härtesten die Long-Running-Agent-Workloads, auf die 4.6 abzielt, wo Cache-Wiederverwendung der eigentliche Sinn der Sache ist.

Ist Grok 4.6 besser als Claude beim Programmieren?

Bei der Korrektheit liegt es gleichauf: Grok 4.6, Claude Sonnet 5 und Claude Opus 4.8 haben jeweils 10 von 10 ausgeführten Coding-Tests bestanden. Das ist die Schlagzeile, und für Grok ein echter Fortschritt.

Für diesen Test haben wir aufgehört, Text zu bewerten. Fünf Aufgaben mit versteckten Unit-Tests, je zwei Durchläufe, 30 Aufrufe: Semver-Matching einschließlich des Falls ^0.x, ein LRU-Cache mit explizitem Clock-TTL, Intervall-Merging mit berührenden Grenzen, ein Duration-Parser, der 1m30h und 1.5h zurückweisen muss, und grapheme-sicheres Truncation, das kein kombinierendes Zeichen verwaisen lassen oder ein Emoji zerschneiden darf. Jede Antwort läuft in einem Subprocess und besteht nur, wenn jede Assertion hält. Skript grok_vs_claude_coding.py, Rohdaten in benchmark-coding-raw.json.

python
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout   # the model never sees the tests
ModellBestandenMedian-LatenzMedian Output-TokOutput $/MGesamtkosten
Grok 4.610/1026.82 s2,016$6$0.1169
Claude Sonnet 510/106.76 s500$10$0.0596
Claude Opus 4.810/104.96 s411$25$0.1006

Das Unentschieden bei der Korrektheit ist die Nachricht. Die Rechnung ist der Haken: Grok 4.6 lief 4.0× langsamer als Sonnet 5 und 5.4× langsamer als Opus 4.8, bei 4.0× beziehungsweise 4.9× der medianen Output-Tokens. Dieser Token-Appetit frisst den Preisvorteil komplett auf. Grok 4.6 hat bei diesen fünf Aufgaben mehr gekostet als Claude Opus 4.8, obwohl seine Output-Tokens 4.2× günstiger sind, weil es 18,345 Output-Tokens ausgab gegenüber 3,630 bei Opus 4.8. Gegenüber Sonnet 5 hat es 1.96× so viel gekostet, und Sonnets Output-Preis pro Token ist der höhere von beiden. Eine günstigere Preisliste ist kein günstigeres Modell – dieselbe Lehre wie bei den Zahlen zu 4.6 gegenüber 4.5 einen Abschnitt weiter oben.

Eine Einschätzung, ausdrücklich als Einschätzung markiert, nicht als Messung: Bei Media- und Content-Automatisierungs-Pipelines haben wir in der Vergangenheit eher zu Grok als zu Claude gegriffen, vor allem wegen seiner nativen X-Einbindung und des lockereren Umgangs mit Marketingtexten. Dafür haben wir keinen Benchmark, und wir präsentieren auch keinen. Bei der Coding-Arbeit, die wir deterministisch bewerten können, liegen die drei bei der Korrektheit gleichauf, und Grok bezahlt vier- bis fünfmal so viele Tokens.

Was wir nicht getestet haben

Unsere Aufgaben waren bei 40/40 gesättigt, dieser Test misst also Kosten bei Routinearbeit, nicht die Fähigkeit bei den Agentenaufgaben, für die SpaceXAI abgestimmt hat. Fünf Einschränkungen:

  1. Das Gleichstehen bei der Genauigkeit ist ein Deckeneffekt, kein Beweis, dass 4.6 nicht klüger ist. Unsere Aufgaben gingen der Schwierigkeit aus, bevor die Modelle es taten, und sie prüfen kein Grenzfall-Long-Horizon-Coding.
  2. Zwei bis drei Durchläufe pro Aufgabe. Genug für eine Richtung und eine Aussage zur Streuung, nicht für ein Konfidenzintervall.
  3. Gemessen über OpenRouter, nicht über SpaceXAIs eigenen Endpunkt. Routing fügt Latenz hinzu, die nicht dem Modell zuzuschreiben ist – deshalb tragen die providerunabhängigen Token-Zahlen das eigentliche Argument.
  4. Eine Aufgabe lief der These entgegen, constraint_schedule, bei der 4.6 im Median schneller war.
  5. Auch der Claude-Vergleich ist gesättigt. Fünf Coding-Aufgaben, alle drei Modelle 10/10 – er trennt also Kosten und Latenz, sagt aber nichts darüber aus, welches Modell an der Obergrenze stärker ist.

Wir haben zudem nicht getestet, was SpaceXAI tatsächlich behauptet: stärkere erste Durchläufe bei visuellen und interaktiven Projekten. Dafür gibt es keinen deterministischen Grader, wir stellen es also nicht infrage. Wir haben keine kommerzielle Beziehung zu SpaceXAI und haben jeden Aufruf selbst bezahlt.

Wer sollte upgraden, und wer sollte bei 4.5 bleiben?

Upgrade, wenn dein Traffic Long-Horizon-Agentenarbeit ist; bleib bei 4.5, wenn es kurze strukturierte Aufrufe in hohem Volumen sind. Auf der Index-Achse, die jeder andere Launch-Day-Artikel verwendet, gewinnt 4.6 bei identischer Preisliste. Bei den gemessenen Kosten pro korrekter Antwort dreht sich grok 4.6 vs grok 4.5 in die andere Richtung.

Dein WorkloadWahlWas es kippt
High-Volume strukturierte oder JSON-AufrufeGrok 4.5eine Aufgabe, an der 4.5 tatsächlich scheitert
Long-Horizon Agentic CodingGrok 4.6nichts, was wir gemessen haben; das ist sein Fall
Latenzsensible User-PfadeGrok 4.5der 81.61-s-Tail-Aufruf, bis du den Effort deckelst
Sessions mit starker Cache-Wiederverwendungrechne es durch$0.50 vs $0.30 pro M können die Token-Lücke aufwiegen
Schon auf 4.6bleib, aber setze den Effortihn unbestimmt zu lassen kostet 49% mehr Output

Grok 4.5 ist weiterhin der günstigere Weg, um bei Routine-Strukturarbeit dieselbe Antwort zu bekommen. Das heißt nicht, dass 4.6 schlechter ist: Es erkauft sich seine Vorteile durch längeres Nachdenken, und bei alltäglichen Produktionsaufrufen ist dieser Tausch eine Kostensteigerung ohne messbaren Genauigkeitsgewinn. Ein weiteres Argument dafür, eine Modellversion in einem Agenten-Stack festzupinnen, statt latest zu verfolgen.

Drei Skripte, ein OpenRouter-Key und unter einem Dollar an Guthaben – das sind die gesamten Kosten, um zu prüfen, ob dein Traffic wie unserer aussieht.

Häufig gestellte Fragen

Gibt es einen Grok 5 oder Grok 5.6?

Keines von beiden existiert. Stand 12 August 2026 ist Grok 4.6 das neueste ausgelieferte Modell. Grok 4.7 wurde für Ende August oder Anfang September angekündigt und war noch nicht ausgeliefert, als wir diesen Text geschrieben haben; alles danach ist für Ende 2026 anvisiert. Die „5.6" ist mit sehr hoher Wahrscheinlichkeit GPT-5.6 Sol, ein OpenAI-Modell, gegen das Grok 4.6 gebenchmarkt wird.

Kostet Grok 4.6 mehr als Grok 4.5?

Gleiche Preisliste, $2/M Input und $6/M Output bei beiden. Unsere 80 gemessenen Aufrufe lieferten identische Antworten für 1.38× die Gesamtkosten, weil 4.6 1.90× die mediane Anzahl an Output-Tokens ausgibt. Auch Cached Input stieg von $0.30 auf $0.50 pro Million.

Ist Grok 4.6 langsamer als Grok 4.5?

Bei unserem Median 1.26× langsamer: 5.25 s gegenüber 4.17 s über je 40 Aufrufe. Bei unserem schlechtesten Aufruf 2.27×: 81.61 s gegenüber 35.98 s. Artificial Analysis berichtet, separat gemessen, eine Zeit bis zum ersten Token von 32.30 s gegenüber 8.68 s. Zu beachten: Wir haben über OpenRouter gemessen, Routing fügt also Latenz hinzu, für die nicht das Modell selbst verantwortlich ist.

Wie groß ist Grok 4.6s Kontextfenster, und wie rufe ich es auf?

500K Tokens, unverändert gegenüber Grok 4.5. Der Slug lautet x-ai/grok-4.6 auf OpenRouter und grok-4.6 auf der SpaceXAI-API, mit einer schnelleren Variante zum doppelten Standardsatz. Setze reasoning_effort explizit, statt ihn zu vererben; der Default ist high, und bei unseren vier Kontrollaufgaben hat das Absenken auf low die Output-Tokens halbiert, ohne eine einzige korrekte Antwort zu kosten.

Sollte ich bei Grok 4.5 bleiben?

Für High-Volume-Strukturarbeit, ja: Es lieferte über alle 80 Aufrufe hinweg dieselben Antworten für weniger Geld. Für Long-Horizon Agentic Coding, den Workload, auf den SpaceXAI 4.6 abgestimmt hat, klären unsere Aufgaben das nicht, und wir haben es nicht getestet. Miss deine eigene Mischung.

Tags

grok 4.6grok 4.5spacexaillm costopenrouter

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.