
Grok 4.6 vs Grok 4.5: we deden 80 API-calls op lanceerdag – zelfde 40/40, 1.38× de rekening
Grok 4.6 kostte ons $0.2992 om 40 beoordeelde taken af te ronden. Grok 4.5 kostte $0.2174 voor dezelfde 40, en gaf dezelfde antwoorden.
We maten dit op 12 augustus 2026, enkele uren nadat SpaceXAI (voorheen xAI) het model uitbracht. Zelfde tarieven: $2 per miljoen input-tokens, $6 output. Zelfde score: 40/40 tegen 40/40. Het verschil is 1.90× de mediane output-tokens op 4.6, wat neerkomt op een 38% hogere rekening.
Wat SpaceXAI uitbracht op 12 augustus
SpaceXAI bracht Grok 4.6 op 12 augustus 2026 uit tegen $2 per miljoen input-tokens en $6 output, dezelfde tarieven als Grok 4.5. Het model verscheen om 08:56 PT volgens 9to5Mac, en de officiële aankondiging (geraadpleegd op 2026-08-12) focust op agentic coding, maar publiceert geen enkel cijfer over operationele kosten, latency of tokenverbruik.
- Beschikbaar vanaf dezelfde dag als
grok-4.6op de SpaceXAI API enx-ai/grok-4.6op OpenRouter. - Een contextvenster van 500K tokens, ongewijzigd ten opzichte van Grok 4.5.
- $2/M input, $6/M output, plus een snelle variant tegen het dubbele tarief.
- Een Artificial Analysis Intelligence Index-score van 61, door de leverancier gepresenteerd als gelijk aan GPT-5.6 Sol.
- Eén kwalitatieve vergelijking met 4.5: sterkere eerste pogingen bij visuele en interactieve projecten.
Cursors lanceerdag-artikel leest als onafhankelijke validatie, maar dat is het niet: SpaceX kwam overeen om Cursors maker, Anysphere, over te nemen voor $60B in aandelen, op 16 juni 2026.
Moet je overstappen naar Grok 4.6?
Blijf op 4.5 voor routinematig gestructureerd werk: onze 80 calls leverden identieke antwoorden op voor 1.38× het geld. De tarieven zijn byte-identiek op beide OpenRouter-modelpagina's, dus geen enkele prijspagina kan je waarschuwen. Tokentellingen wel.
| Metriek | Grok 4.6 | Grok 4.5 |
|---|---|---|
| AA Intelligence Index | 61 | 56 |
| Prijs per M (input / output) | $2 / $6 | $2 / $6 |
| Cached input per M | $0.50 | $0.30 |
| Geslaagde taken (van ons, 80 calls) | 40/40 | 40/40 |
| Mediane output-tokens (van ons) | 409 | 215 |
| Kosten voor hetzelfde antwoord (gemeten) | $0.2992 | $0.2174 |
| Mediane latency (van ons) | 5.25 s | 4.17 s |
| Kies dit als | long-horizon agentwerk | korte gestructureerde calls op volume |
Rijen gemarkeerd "van ons" zijn van ons, gemeten op lanceerdag; de index- en cache-rijen zijn van Artificial Analysis, geraadpleegd op 2026-08-12.
Identieke tarieven, 1.90× de tokens, dus ruwweg 1.38× de rekening voor dezelfde antwoorden. Dat is de vraag rond grok 4.6 vs grok 4.5 voor het meeste productieverkeer: dezelfde prijs per token, een andere rekening.
Wat 80 API-calls op lanceerdag daadwerkelijk lieten zien
Over 80 calls op lanceerdag, bij temperature zero, scoorden beide modellen 40/40, terwijl 4.6 1.90× de mediane output-tokens verbruikte.
We stuurden elke prompt tweemaal, één keer naar x-ai/grok-4.6 en één keer naar x-ai/grok-4.5, gemeten via OpenRouter bij temperature: 0. Ronde 1 (24 calls) was eenvoudig: de JSON-schema-taken die we beoordeelden, een prijsberekening, een Python-bugfix, een gebonden schrijftaak. Ronde 2 (24 calls) werd lastiger nadat ronde 1 verzadigd raakte: een planningspuzzel, een eenheidsconversie-valstrik, een naaldophaling van 402 regels met een REVOKED lokaas, en een spec-taak waarbij retry_on 429 en 503 moet bevatten maar niet 500. Ronde 3 (32 calls) is de controle hieronder. Elke beoordelaar is deterministisch; niets wordt door een LLM beoordeeld. Scripts grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; ruwe output in benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Totale uitgave, $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| Ronde met standaardinspanning | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1, eenvoudig (24 calls) | 12/12, 468 mediane output-tok | 12/12, 241 tok |
| 2, moeilijk (24 calls) | 12/12, 493 mediane output-tok | 12/12, 332 tok |
De consensus vóór de lancering, een X-post van @haider1 van 11 augustus en overgenomen door diverse aggregatorblogs, stelde dat 4.6 de snelheid en tokenefficiëntie van 4.5 zou behouden. SpaceXAI heeft dat nooit beweerd; de aankondiging doet helemaal geen uitspraak over tokens. Unite.AI merkte op lanceerdag op dat "nog geen onafhankelijke evaluatie de claims van het model heeft bevestigd", dus hier is er een. Grok 4.6 gebruikte 409 mediane output-tokens tegenover 215 voor Grok 4.5, bij identieke prompts en temperature zero, 365 mediane reasoning-tokens tegenover 200, en 27,565 in totaal tegenover 13,929. Wat 4.6 ook wint, het betaalt daarvoor met 1.90× de mediane output-tokens.
De staart is waar het pijn doet
Dezelfde prompt, temperature: 0, drie pogingen van unit_trap in de rondes met standaardinspanning:
| Poging | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
Een spreiding van 6.6× op 4.6 tegenover 1.8× op 4.5, bij byte-identieke input. Bij het dimensioneren van een timeout of een tokenbudget per request telt die staart zwaarder dan de mediaan, en dat pleit voor wanneer het nieuwere model de verkeerde default is.
De ene taak die de andere kant op ging
Bij constraint_schedule was 4.6 sneller op de mediaan in de rondes met standaardinspanning: 26.38 s tegenover 34.21 s, en ook op minder output-tokens (1,644 tegenover 1,710). Alleen de cijfers rapporteren die bij een stelling passen, is precies wat lezers en Google afstraffen.
Is het het model, of is het de default?
reasoning_effort bij beide modellen op dezelfde waarde vastzetten dicht het verschil niet; het vergroot het, van 1.51× naar 2.91×. docs.x.ai (geraadpleegd op 2026-08-12) noemt vier niveaus (low, medium, high, xhigh) en rondes 1 en 2 stelden er nooit één in, dus het verschil kon een uitgeleverde default zijn geweest. Ronde 3 zette dit expliciet vast over 32 calls.
| Gelijke inspanning | 4.6 mediane output | 4.5 mediane output | Ratio | Nauwkeurigheid |
|---|---|---|---|---|
| low | 222 tok | 147 tok | 1.51× | 8/8 vs 8/8 |
| high | 606 tok | 208 tok | 2.91× | 8/8 vs 8/8 |
Als het verschil bij gelijke inspanning was weggevallen, was de eerlijke conclusie geweest: "it's just a default." Dat gebeurde niet.
Hoe verlaag je de tokenrekening van Grok 4.6?
Zet reasoning_effort op low en de mediane output van 4.6 daalt van 438 naar 222 tokens, met een ongewijzigde nauwkeurigheid van 8/8. Dezelfde vier taken in beide gevallen: het defaultcijfer bundelt twaalf calls uit de eerste twee rondes, het low-cijfer acht uit de controle.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}Dat is een reductie van 49%, goed voor ruwweg $1.30 per duizend calls van dit type bij $6 per miljoen output-tokens. Eén request-parameter halveert ruwweg de outputrekening van Grok 4.6 bij routinematig gestructureerd werk, zonder dat we enig meetbaar verlies zagen. Vier taken zijn een signaal, geen beleid: test het eerst op je eigen mix.
Wat andermans meters laten zien
Artificial Analysis rekende, op zijn eigen evaluatiesuite, $1,068.47 om Grok 4.6 te scoren, tegenover $579.21 voor Grok 4.5. Hun cijfers, niet de onze, afkomstig van hun Grok 4.6- en Grok 4.5-modelpagina's op artificialanalysis.ai, geraadpleegd op 2026-08-12.
| Metriek (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | Ratio |
|---|---|---|---|
| Intelligence Index | 61 | 56 | +5 pts |
| Output-tokens om de index te draaien | 72M | 60M | 1.20× |
| Kosten om de index te draaien | $1,068.47 | $579.21 | 1.84× |
| Tijd tot eerste token | 32.30 s | 8.68 s | 3.72× |
| Cache-hit-prijs per M | $0.50 | $0.30 | 1.67× |
Hun 1.84× en onze 1.38× komen niet overeen, en de reden daarvoor is informatief: hun takenmix is zwaarder, en hun totaal telt input-tokens mee waar het onze alleen output isoleert. Twee meters, dezelfde richting.
De cache-rij werd als eerste opgemerkt door HN-gebruiker pzo in de lanceringsthread (comment 49275740) en wordt op beide pagina's bevestigd: 67% hoger, en dat kost het meeste bij de long-running agentworkloads waar 4.6 op mikt, waar cache-hergebruik het hele punt is.
Is Grok 4.6 beter dan Claude voor code?
Op correctheid is het gelijk: Grok 4.6, Claude Sonnet 5 en Claude Opus 4.8 haalden elk 10 van de 10 uitgevoerde codeertaken. Dat is de hoofdconclusie, en voor Grok een echte winst.
We stopten met het beoordelen van tekst voor deze test. Vijf taken met verborgen unit tests, twee pogingen elk, 30 calls: semver-matching inclusief het ^0.x-geval, een LRU-cache met expliciete-klok TTL, interval-samenvoeging met rakende grenzen, een duur-parser die 1m30h en 1.5h moet afwijzen, en grapheme-veilige truncatie die geen combinerend teken mag afsnijden of een emoji mag splitsen. Elk antwoord draait in een subprocess en slaagt alleen als elke assertie standhoudt. Script grok_vs_claude_coding.py, ruwe data in benchmark-coding-raw.json.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # the model never sees the tests| Model | Geslaagd | Mediane latency | Mediane output-tok | Output $/M | Totale kosten |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
De gelijkstand op correctheid is het nieuws. De rekening is de vangst: Grok 4.6 draaide 4.0× trager dan Sonnet 5 en 5.4× trager dan Opus 4.8, bij 4.0× en 4.9× de mediane output-tokens. Die tokenhonger vreet het prijsvoordeel volledig op. Grok 4.6 kostte meer dan Claude Opus 4.8 op deze vijf taken, ondanks dat de output-tokens 4.2× goedkoper zijn, omdat het 18,345 output-tokens genereerde tegenover 3,630 voor Opus 4.8. Tegenover Sonnet 5 kostte het 1.96× zoveel, en Sonnet's tarief per output-token is de hogere van de twee. Een goedkopere prijskaart is geen goedkoper model, dezelfde les die de cijfers rond 4.6 versus 4.5 leren een sectie hierboven.
Eén oordeel, expliciet gemarkeerd als oordeel en niet als meting: bij media- en content-automatiseringspijplijnen grepen we historisch eerder naar Grok dan naar Claude, vooral vanwege de X-native ingestie en de soepelere omgang met marketingteksten. Daar hebben we geen benchmark voor en presenteren we er ook geen. Op het codeerwerk dat we deterministisch kunnen beoordelen, staan de drie gelijk op correctheid en betaalt Grok vier tot vijf keer zoveel tokens.
Wat we niet hebben getest
Onze taken raakten verzadigd op 40/40, dus dit meet de kosten van routinewerk, niet de capaciteit op de agentic taken waarvoor SpaceXAI het model afstemde. Vijf beperkingen:
- De gelijke score is een plafondeffect, geen bewijs dat 4.6 niet slimmer is. Onze taken raakten uitgeput voordat de modellen dat deden, en ze testen geen frontier long-horizon coding.
- Twee tot drie pogingen per taak. Genoeg voor een richting en een verhaal over spreiding, niet voor een betrouwbaarheidsinterval.
- Gemeten via OpenRouter, niet via SpaceXAI's eigen endpoint. Routing voegt latency toe die niet aan het model ligt, en daarom dragen de providerinafhankelijke tokentellingen het argument.
- Eén taak ging tegen de stelling in,
constraint_schedule, waarbij 4.6 sneller was op de mediaan. - De Claude-vergelijking raakte ook verzadigd. Vijf codeertaken, alle drie modellen 10/10, dus dat scheidt kosten en latency maar zegt niets over welk model sterker is aan het plafond.
We hebben ook niet getest wat SpaceXAI daadwerkelijk claimt: sterkere eerste pogingen bij visuele en interactieve projecten. Daar bestaat geen deterministische beoordelaar voor, dus we betwisten dat niet. We hebben geen commerciële relatie met SpaceXAI en hebben elke call zelf betaald.
Wie moet upgraden, en wie moet op 4.5 blijven?
Upgrade als je verkeer bestaat uit long-horizon agentwerk; blijf op 4.5 als het gaat om korte gestructureerde calls op volume. Op de indexas die elk ander lanceerdag-artikel gebruikt, wint 4.6 bij identieke tarieven. Op gemeten kosten per correct antwoord slaat grok 4.6 vs grok 4.5 de andere kant op.
| Jouw workload | Keuze | Wat het kantelt |
|---|---|---|
| Gestructureerde of JSON-calls met hoog volume | Grok 4.5 | een taak waarbij 4.5 daadwerkelijk faalt |
| Long-horizon agentic coding | Grok 4.6 | niets wat wij maten; dit is zijn sterke kant |
| Latency-gevoelige gebruikerspaden | Grok 4.5 | de 81.61 s-staartcall, totdat je effort begrenst |
| Sessies met zwaar cache-hergebruik | reken het na | $0.50 vs $0.30 per M kan het tokenverschil overstemmen |
| Al op 4.6 | blijf, maar stel effort in | niet instellen kost 49% meer output |
Grok 4.5 is nog steeds de goedkopere manier om hetzelfde antwoord te krijgen bij routinematig gestructureerd werk. Dat betekent niet dat 4.6 slechter is: het koopt zijn winst door langer na te denken, en bij alledaagse productiecalls is die ruil een kostenstijging zonder meetbare winst in nauwkeurigheid. Nog een argument voor een modelversie vastzetten in een agentstack in plaats van latest te volgen.
Drie scripts, één OpenRouter-key en minder dan een dollar aan credit: dat is de totale kostprijs om te checken of jouw verkeer op het onze lijkt.
Veelgestelde vragen
Bestaat er een Grok 5 of Grok 5.6?
Geen van beide bestaat. Vanaf 12 augustus 2026 is Grok 4.6 het nieuwste uitgebrachte model. Grok 4.7 werd aangekondigd voor eind augustus of begin september en was nog niet uitgebracht op het moment dat we dit schreven; alles daarna staat gepland voor eind 2026. De "5.6" is vrijwel zeker GPT-5.6 Sol, een OpenAI-model waartegen Grok 4.6 wordt benchmarkt.
Kost Grok 4.6 meer dan Grok 4.5?
Dezelfde tarieven, $2/M input en $6/M output bij beide. Onze 80 gemeten calls leverden identieke antwoorden op voor 1.38× de totale kosten, omdat 4.6 1.90× de mediane output-tokens genereert. Cached input steeg ook van $0.30 naar $0.50 per miljoen.
Is Grok 4.6 trager dan Grok 4.5?
Op onze mediaan, 1.26× trager: 5.25 s tegenover 4.17 s, over 40 calls elk. Bij onze slechtste call, 2.27×: 81.61 s tegenover 35.98 s. Artificial Analysis, dat apart mat, rapporteert een tijd tot eerste token van 32.30 s tegenover 8.68 s. Let op: wij maten via OpenRouter, dus routing voegt latency toe waar het model zelf niet verantwoordelijk voor is.
Wat is het contextvenster van Grok 4.6 en hoe roep ik het aan?
500K tokens, ongewijzigd ten opzichte van Grok 4.5. De slug is x-ai/grok-4.6 op OpenRouter en grok-4.6 op de SpaceXAI API, met een snelle variant tegen het dubbele standaardtarief. Stel reasoning_effort expliciet in in plaats van de default over te nemen; de default is high, en bij onze vier controletaken halveerde het overzetten naar low de output-tokens zonder ook maar één correct antwoord te kosten.
Moet ik op Grok 4.5 blijven?
Voor gestructureerd werk met hoog volume, ja: het leverde over alle 80 calls dezelfde antwoorden op voor minder geld. Voor long-horizon agentic coding, de workload waarvoor SpaceXAI 4.6 afstemde, geven onze taken geen uitsluitsel en hebben we het niet getest. Meet je eigen mix.