ai-machine-learning

Grok 4.6 vs Grok 4.5: we deden 80 API-calls op lanceerdag – zelfde 40/40, 1.38× de rekening

Geschreven door Gokay Yilmaz
Bijgewerkt Aug 12, 2026
10 leestijd
Grok 4.6 vs Grok 4.5: we deden 80 API-calls op lanceerdag – zelfde 40/40, 1.38× de rekening

Grok 4.6 vs Grok 4.5: we deden 80 API-calls op lanceerdag – zelfde 40/40, 1.38× de rekening

Grok 4.6 kostte ons $0.2992 om 40 beoordeelde taken af te ronden. Grok 4.5 kostte $0.2174 voor dezelfde 40, en gaf dezelfde antwoorden.

We maten dit op 12 augustus 2026, enkele uren nadat SpaceXAI (voorheen xAI) het model uitbracht. Zelfde tarieven: $2 per miljoen input-tokens, $6 output. Zelfde score: 40/40 tegen 40/40. Het verschil is 1.90× de mediane output-tokens op 4.6, wat neerkomt op een 38% hogere rekening.

Wat SpaceXAI uitbracht op 12 augustus

SpaceXAI bracht Grok 4.6 op 12 augustus 2026 uit tegen $2 per miljoen input-tokens en $6 output, dezelfde tarieven als Grok 4.5. Het model verscheen om 08:56 PT volgens 9to5Mac, en de officiële aankondiging (geraadpleegd op 2026-08-12) focust op agentic coding, maar publiceert geen enkel cijfer over operationele kosten, latency of tokenverbruik.

  1. Beschikbaar vanaf dezelfde dag als grok-4.6 op de SpaceXAI API en x-ai/grok-4.6 op OpenRouter.
  2. Een contextvenster van 500K tokens, ongewijzigd ten opzichte van Grok 4.5.
  3. $2/M input, $6/M output, plus een snelle variant tegen het dubbele tarief.
  4. Een Artificial Analysis Intelligence Index-score van 61, door de leverancier gepresenteerd als gelijk aan GPT-5.6 Sol.
  5. Eén kwalitatieve vergelijking met 4.5: sterkere eerste pogingen bij visuele en interactieve projecten.

Cursors lanceerdag-artikel leest als onafhankelijke validatie, maar dat is het niet: SpaceX kwam overeen om Cursors maker, Anysphere, over te nemen voor $60B in aandelen, op 16 juni 2026.

Moet je overstappen naar Grok 4.6?

Blijf op 4.5 voor routinematig gestructureerd werk: onze 80 calls leverden identieke antwoorden op voor 1.38× het geld. De tarieven zijn byte-identiek op beide OpenRouter-modelpagina's, dus geen enkele prijspagina kan je waarschuwen. Tokentellingen wel.

MetriekGrok 4.6Grok 4.5
AA Intelligence Index6156
Prijs per M (input / output)$2 / $6$2 / $6
Cached input per M$0.50$0.30
Geslaagde taken (van ons, 80 calls)40/4040/40
Mediane output-tokens (van ons)409215
Kosten voor hetzelfde antwoord (gemeten)$0.2992$0.2174
Mediane latency (van ons)5.25 s4.17 s
Kies dit alslong-horizon agentwerkkorte gestructureerde calls op volume

Rijen gemarkeerd "van ons" zijn van ons, gemeten op lanceerdag; de index- en cache-rijen zijn van Artificial Analysis, geraadpleegd op 2026-08-12.

Identieke tarieven, 1.90× de tokens, dus ruwweg 1.38× de rekening voor dezelfde antwoorden. Dat is de vraag rond grok 4.6 vs grok 4.5 voor het meeste productieverkeer: dezelfde prijs per token, een andere rekening.

Wat 80 API-calls op lanceerdag daadwerkelijk lieten zien

Over 80 calls op lanceerdag, bij temperature zero, scoorden beide modellen 40/40, terwijl 4.6 1.90× de mediane output-tokens verbruikte.

We stuurden elke prompt tweemaal, één keer naar x-ai/grok-4.6 en één keer naar x-ai/grok-4.5, gemeten via OpenRouter bij temperature: 0. Ronde 1 (24 calls) was eenvoudig: de JSON-schema-taken die we beoordeelden, een prijsberekening, een Python-bugfix, een gebonden schrijftaak. Ronde 2 (24 calls) werd lastiger nadat ronde 1 verzadigd raakte: een planningspuzzel, een eenheidsconversie-valstrik, een naaldophaling van 402 regels met een REVOKED lokaas, en een spec-taak waarbij retry_on 429 en 503 moet bevatten maar niet 500. Ronde 3 (32 calls) is de controle hieronder. Elke beoordelaar is deterministisch; niets wordt door een LLM beoordeeld. Scripts grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; ruwe output in benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Totale uitgave, $0.52.

python
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
    r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
        headers={"Authorization": f"Bearer {KEY}"},
        json={"model": model, "temperature": 0,
              "messages": [{"role": "user", "content": PROMPT}]}).json()
    u = r["usage"]
    print(model, u["completion_tokens"],
          u["completion_tokens_details"]["reasoning_tokens"])
Ronde met standaardinspanningGrok 4.6Grok 4.5
1, eenvoudig (24 calls)12/12, 468 mediane output-tok12/12, 241 tok
2, moeilijk (24 calls)12/12, 493 mediane output-tok12/12, 332 tok

De consensus vóór de lancering, een X-post van @haider1 van 11 augustus en overgenomen door diverse aggregatorblogs, stelde dat 4.6 de snelheid en tokenefficiëntie van 4.5 zou behouden. SpaceXAI heeft dat nooit beweerd; de aankondiging doet helemaal geen uitspraak over tokens. Unite.AI merkte op lanceerdag op dat "nog geen onafhankelijke evaluatie de claims van het model heeft bevestigd", dus hier is er een. Grok 4.6 gebruikte 409 mediane output-tokens tegenover 215 voor Grok 4.5, bij identieke prompts en temperature zero, 365 mediane reasoning-tokens tegenover 200, en 27,565 in totaal tegenover 13,929. Wat 4.6 ook wint, het betaalt daarvoor met 1.90× de mediane output-tokens.

De staart is waar het pijn doet

Dezelfde prompt, temperature: 0, drie pogingen van unit_trap in de rondes met standaardinspanning:

PogingGrok 4.6Grok 4.5
112.25 s / 726 tok8.38 s / 414 tok
223.20 s / 1,400 tok15.32 s / 750 tok
381.61 s / 4,770 tok10.08 s / 480 tok

Een spreiding van 6.6× op 4.6 tegenover 1.8× op 4.5, bij byte-identieke input. Bij het dimensioneren van een timeout of een tokenbudget per request telt die staart zwaarder dan de mediaan, en dat pleit voor wanneer het nieuwere model de verkeerde default is.

De ene taak die de andere kant op ging

Bij constraint_schedule was 4.6 sneller op de mediaan in de rondes met standaardinspanning: 26.38 s tegenover 34.21 s, en ook op minder output-tokens (1,644 tegenover 1,710). Alleen de cijfers rapporteren die bij een stelling passen, is precies wat lezers en Google afstraffen.

Is het het model, of is het de default?

reasoning_effort bij beide modellen op dezelfde waarde vastzetten dicht het verschil niet; het vergroot het, van 1.51× naar 2.91×. docs.x.ai (geraadpleegd op 2026-08-12) noemt vier niveaus (low, medium, high, xhigh) en rondes 1 en 2 stelden er nooit één in, dus het verschil kon een uitgeleverde default zijn geweest. Ronde 3 zette dit expliciet vast over 32 calls.

Gelijke inspanning4.6 mediane output4.5 mediane outputRatioNauwkeurigheid
low222 tok147 tok1.51×8/8 vs 8/8
high606 tok208 tok2.91×8/8 vs 8/8

Als het verschil bij gelijke inspanning was weggevallen, was de eerlijke conclusie geweest: "it's just a default." Dat gebeurde niet.

Hoe verlaag je de tokenrekening van Grok 4.6?

Zet reasoning_effort op low en de mediane output van 4.6 daalt van 438 naar 222 tokens, met een ongewijzigde nauwkeurigheid van 8/8. Dezelfde vier taken in beide gevallen: het defaultcijfer bundelt twaalf calls uit de eerste twee rondes, het low-cijfer acht uit de controle.

json
{
  "model": "x-ai/grok-4.6",
  "messages": [{"role": "user", "content": "..."}],
  "temperature": 0,
  "reasoning": {"effort": "low"}
}

Dat is een reductie van 49%, goed voor ruwweg $1.30 per duizend calls van dit type bij $6 per miljoen output-tokens. Eén request-parameter halveert ruwweg de outputrekening van Grok 4.6 bij routinematig gestructureerd werk, zonder dat we enig meetbaar verlies zagen. Vier taken zijn een signaal, geen beleid: test het eerst op je eigen mix.

Wat andermans meters laten zien

Artificial Analysis rekende, op zijn eigen evaluatiesuite, $1,068.47 om Grok 4.6 te scoren, tegenover $579.21 voor Grok 4.5. Hun cijfers, niet de onze, afkomstig van hun Grok 4.6- en Grok 4.5-modelpagina's op artificialanalysis.ai, geraadpleegd op 2026-08-12.

Metriek (Artificial Analysis)Grok 4.6 (high)Grok 4.5 (high)Ratio
Intelligence Index6156+5 pts
Output-tokens om de index te draaien72M60M1.20×
Kosten om de index te draaien$1,068.47$579.211.84×
Tijd tot eerste token32.30 s8.68 s3.72×
Cache-hit-prijs per M$0.50$0.301.67×

Hun 1.84× en onze 1.38× komen niet overeen, en de reden daarvoor is informatief: hun takenmix is zwaarder, en hun totaal telt input-tokens mee waar het onze alleen output isoleert. Twee meters, dezelfde richting.

De cache-rij werd als eerste opgemerkt door HN-gebruiker pzo in de lanceringsthread (comment 49275740) en wordt op beide pagina's bevestigd: 67% hoger, en dat kost het meeste bij de long-running agentworkloads waar 4.6 op mikt, waar cache-hergebruik het hele punt is.

Is Grok 4.6 beter dan Claude voor code?

Op correctheid is het gelijk: Grok 4.6, Claude Sonnet 5 en Claude Opus 4.8 haalden elk 10 van de 10 uitgevoerde codeertaken. Dat is de hoofdconclusie, en voor Grok een echte winst.

We stopten met het beoordelen van tekst voor deze test. Vijf taken met verborgen unit tests, twee pogingen elk, 30 calls: semver-matching inclusief het ^0.x-geval, een LRU-cache met expliciete-klok TTL, interval-samenvoeging met rakende grenzen, een duur-parser die 1m30h en 1.5h moet afwijzen, en grapheme-veilige truncatie die geen combinerend teken mag afsnijden of een emoji mag splitsen. Elk antwoord draait in een subprocess en slaagt alleen als elke assertie standhoudt. Script grok_vs_claude_coding.py, ruwe data in benchmark-coding-raw.json.

python
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout   # the model never sees the tests
ModelGeslaagdMediane latencyMediane output-tokOutput $/MTotale kosten
Grok 4.610/1026.82 s2,016$6$0.1169
Claude Sonnet 510/106.76 s500$10$0.0596
Claude Opus 4.810/104.96 s411$25$0.1006

De gelijkstand op correctheid is het nieuws. De rekening is de vangst: Grok 4.6 draaide 4.0× trager dan Sonnet 5 en 5.4× trager dan Opus 4.8, bij 4.0× en 4.9× de mediane output-tokens. Die tokenhonger vreet het prijsvoordeel volledig op. Grok 4.6 kostte meer dan Claude Opus 4.8 op deze vijf taken, ondanks dat de output-tokens 4.2× goedkoper zijn, omdat het 18,345 output-tokens genereerde tegenover 3,630 voor Opus 4.8. Tegenover Sonnet 5 kostte het 1.96× zoveel, en Sonnet's tarief per output-token is de hogere van de twee. Een goedkopere prijskaart is geen goedkoper model, dezelfde les die de cijfers rond 4.6 versus 4.5 leren een sectie hierboven.

Eén oordeel, expliciet gemarkeerd als oordeel en niet als meting: bij media- en content-automatiseringspijplijnen grepen we historisch eerder naar Grok dan naar Claude, vooral vanwege de X-native ingestie en de soepelere omgang met marketingteksten. Daar hebben we geen benchmark voor en presenteren we er ook geen. Op het codeerwerk dat we deterministisch kunnen beoordelen, staan de drie gelijk op correctheid en betaalt Grok vier tot vijf keer zoveel tokens.

Wat we niet hebben getest

Onze taken raakten verzadigd op 40/40, dus dit meet de kosten van routinewerk, niet de capaciteit op de agentic taken waarvoor SpaceXAI het model afstemde. Vijf beperkingen:

  1. De gelijke score is een plafondeffect, geen bewijs dat 4.6 niet slimmer is. Onze taken raakten uitgeput voordat de modellen dat deden, en ze testen geen frontier long-horizon coding.
  2. Twee tot drie pogingen per taak. Genoeg voor een richting en een verhaal over spreiding, niet voor een betrouwbaarheidsinterval.
  3. Gemeten via OpenRouter, niet via SpaceXAI's eigen endpoint. Routing voegt latency toe die niet aan het model ligt, en daarom dragen de providerinafhankelijke tokentellingen het argument.
  4. Eén taak ging tegen de stelling in, constraint_schedule, waarbij 4.6 sneller was op de mediaan.
  5. De Claude-vergelijking raakte ook verzadigd. Vijf codeertaken, alle drie modellen 10/10, dus dat scheidt kosten en latency maar zegt niets over welk model sterker is aan het plafond.

We hebben ook niet getest wat SpaceXAI daadwerkelijk claimt: sterkere eerste pogingen bij visuele en interactieve projecten. Daar bestaat geen deterministische beoordelaar voor, dus we betwisten dat niet. We hebben geen commerciële relatie met SpaceXAI en hebben elke call zelf betaald.

Wie moet upgraden, en wie moet op 4.5 blijven?

Upgrade als je verkeer bestaat uit long-horizon agentwerk; blijf op 4.5 als het gaat om korte gestructureerde calls op volume. Op de indexas die elk ander lanceerdag-artikel gebruikt, wint 4.6 bij identieke tarieven. Op gemeten kosten per correct antwoord slaat grok 4.6 vs grok 4.5 de andere kant op.

Jouw workloadKeuzeWat het kantelt
Gestructureerde of JSON-calls met hoog volumeGrok 4.5een taak waarbij 4.5 daadwerkelijk faalt
Long-horizon agentic codingGrok 4.6niets wat wij maten; dit is zijn sterke kant
Latency-gevoelige gebruikerspadenGrok 4.5de 81.61 s-staartcall, totdat je effort begrenst
Sessies met zwaar cache-hergebruikreken het na$0.50 vs $0.30 per M kan het tokenverschil overstemmen
Al op 4.6blijf, maar stel effort inniet instellen kost 49% meer output

Grok 4.5 is nog steeds de goedkopere manier om hetzelfde antwoord te krijgen bij routinematig gestructureerd werk. Dat betekent niet dat 4.6 slechter is: het koopt zijn winst door langer na te denken, en bij alledaagse productiecalls is die ruil een kostenstijging zonder meetbare winst in nauwkeurigheid. Nog een argument voor een modelversie vastzetten in een agentstack in plaats van latest te volgen.

Drie scripts, één OpenRouter-key en minder dan een dollar aan credit: dat is de totale kostprijs om te checken of jouw verkeer op het onze lijkt.

Veelgestelde vragen

Bestaat er een Grok 5 of Grok 5.6?

Geen van beide bestaat. Vanaf 12 augustus 2026 is Grok 4.6 het nieuwste uitgebrachte model. Grok 4.7 werd aangekondigd voor eind augustus of begin september en was nog niet uitgebracht op het moment dat we dit schreven; alles daarna staat gepland voor eind 2026. De "5.6" is vrijwel zeker GPT-5.6 Sol, een OpenAI-model waartegen Grok 4.6 wordt benchmarkt.

Kost Grok 4.6 meer dan Grok 4.5?

Dezelfde tarieven, $2/M input en $6/M output bij beide. Onze 80 gemeten calls leverden identieke antwoorden op voor 1.38× de totale kosten, omdat 4.6 1.90× de mediane output-tokens genereert. Cached input steeg ook van $0.30 naar $0.50 per miljoen.

Is Grok 4.6 trager dan Grok 4.5?

Op onze mediaan, 1.26× trager: 5.25 s tegenover 4.17 s, over 40 calls elk. Bij onze slechtste call, 2.27×: 81.61 s tegenover 35.98 s. Artificial Analysis, dat apart mat, rapporteert een tijd tot eerste token van 32.30 s tegenover 8.68 s. Let op: wij maten via OpenRouter, dus routing voegt latency toe waar het model zelf niet verantwoordelijk voor is.

Wat is het contextvenster van Grok 4.6 en hoe roep ik het aan?

500K tokens, ongewijzigd ten opzichte van Grok 4.5. De slug is x-ai/grok-4.6 op OpenRouter en grok-4.6 op de SpaceXAI API, met een snelle variant tegen het dubbele standaardtarief. Stel reasoning_effort expliciet in in plaats van de default over te nemen; de default is high, en bij onze vier controletaken halveerde het overzetten naar low de output-tokens zonder ook maar één correct antwoord te kosten.

Moet ik op Grok 4.5 blijven?

Voor gestructureerd werk met hoog volume, ja: het leverde over alle 80 calls dezelfde antwoorden op voor minder geld. Voor long-horizon agentic coding, de workload waarvoor SpaceXAI 4.6 afstemde, geven onze taken geen uitsluitsel en hebben we het niet getest. Meet je eigen mix.

Tags

grok 4.6grok 4.5spacexaillm costopenrouter

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.