ai-machine-learning

Grok 4.6 vs Grok 4.5: Vi kjørte 80 API-kall på lanseringsdagen – samme 40/40, 1.38× regningen

Skrevet av Gokay Yilmaz
Oppdatert Aug 12, 2026
10 lesing
Grok 4.6 vs Grok 4.5: Vi kjørte 80 API-kall på lanseringsdagen – samme 40/40, 1.38× regningen

Grok 4.6 vs Grok 4.5: Vi kjørte 80 API-kall på lanseringsdagen – samme 40/40, 1.38× regningen

Grok 4.6 kostet oss $0.2992 for å fullføre 40 gradede oppgaver. Grok 4.5 kostet $0.2174 for de samme 40, og ga tilbake de samme svarene.

Vi målte det 12. august 2026, timer etter at SpaceXAI (tidligere xAI) lanserte modellen. Samme prisliste: $2 per million input-tokens, $6 output. Samme score: 40/40 mot 40/40. Gapet er 1.90× medianen av output-tokens på 4.6, som lander på en 38 % større regning.

Hva SpaceXAI lanserte 12. august

SpaceXAI ga ut Grok 4.6 12. august 2026 til $2 per million input-tokens og $6 output, samme prisliste som Grok 4.5. Den gikk ut klokken 08:56 PT ifølge 9to5Mac, og den offisielle kunngjøringen (hentet 2026-08-12) leder med agentisk koding uten å publisere noe eneste tall for driftskostnad, latens eller token-forbruk.

  1. Tilgjengelig samme dag som grok-4.6 på SpaceXAI sitt API og x-ai/grok-4.6 på OpenRouter.
  2. Et kontekstvindu på 500K tokens, uendret fra Grok 4.5.
  3. $2/M input, $6/M output, pluss en rask variant til det dobbelte.
  4. En Artificial Analysis Intelligence Index-score på 61, fremstilt av leverandøren som på linje med GPT-5.6 Sol.
  5. Én kvalitativ sammenligning med 4.5: sterkere førsteutkast på visuelle og interaktive prosjekter.

Cursors lanseringsdag-artikkel leser ut som en uavhengig tredjeparts-bekreftelse, men er det ikke: SpaceX ble enige om å kjøpe Cursor-skaperen Anysphere for $60B i aksjer 16. juni 2026.

Bør du bytte til Grok 4.6?

Bli på 4.5 for rutinemessig strukturert arbeid: våre 80 kall ga identiske svar for 1.38× pengene. Prislisten er byte-for-byte identisk på begge OpenRouter-modellsidene, så ingen prisside kan advare deg. Token-tallene kan.

MetricGrok 4.6Grok 4.5
AA Intelligence Index6156
Pris per M (input / output)$2 / $6$2 / $6
Cachet input per M$0.50$0.30
Bestått oppgaver (våre, 80 kall)40/4040/40
Median output-tokens (våre)409215
Kost for samme svar (målt)$0.2992$0.2174
Median latens (våre)5.25 s4.17 s
Velg denne hvislangvarig agent-arbeidkorte strukturerte kall i volum

Rader merket «våre» er våre, målt på lanseringsdagen; indeks- og cache-radene er Artificial Analysis sine, hentet 2026-08-12.

Identisk prisliste, 1.90× tokens, dermed omtrent 1.38× regningen for de samme svarene. Det er grok 4.6 vs grok 4.5-spørsmålet for det meste av produksjonstrafikk: samme pris per token, en annen regning.

Hva 80 API-kall på lanseringsdagen faktisk viste

På tvers av 80 lanseringsdag-kall ved temperatur null scoret begge modellene 40/40, mens 4.6 brukte 1.90× medianen av output-tokens.

Vi sendte hver prompt to ganger, én gang til x-ai/grok-4.6 og én gang til x-ai/grok-4.5, målt gjennom OpenRouter ved temperature: 0. Runde 1 (24 kall) var enkel: JSON-skjema-oppgavene vi gradert, en prisberegning, en Python-feilretting, en begrenset skriveoppgave. Runde 2 (24 kall) ble vanskeligere etter at runde 1 var mettet: et planleggingspuslespill, en enhetskonverteringsfelle, en 402-linjers nålefinning med en REVOKED-avledningsoppgave, og en spesifikasjonsoppgave der retry_on må inneholde 429 og 503, men ikke 500. Runde 3 (32 kall) er kontrollen under. Hver gradering er deterministisk; ingenting er LLM-vurdert. Skript grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; rådata i benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Totalt forbruk, $0.52.

python
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
    r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
        headers={"Authorization": f"Bearer {KEY}"},
        json={"model": model, "temperature": 0,
              "messages": [{"role": "user", "content": PROMPT}]}).json()
    u = r["usage"]
    print(model, u["completion_tokens"],
          u["completion_tokens_details"]["reasoning_tokens"])
Default-effort rundeGrok 4.6Grok 4.5
1, enkel (24 kall)12/12, 468 median output tok12/12, 241 tok
2, vanskelig (24 kall)12/12, 493 median output tok12/12, 332 tok

Konsensusen før lansering, et X-innlegg fra @haider1 datert 11. august og kopiert på tvers av aggregator-blogger, sa at 4.6 ville beholde 4.5 sin hastighet og token-effektivitet. SpaceXAI hevdet aldri det; kunngjøringen deres inneholder ingen token-påstand overhodet. Unite.AI noterte på lanseringsdagen at «ingen uavhengig evaluering har ennå bekreftet» modellens påstander, så her er én. Grok 4.6 brukte 409 median output-tokens mot Grok 4.5 sine 215 på identiske prompter ved temperatur null, 365 median reasoning-tokens mot 200, og 27,565 totalt mot 13,929. Uansett hva 4.6 vinner, betaler den for det med 1.90× medianen av output-tokens.

Der halen gjør vondt

Samme prompt, temperature: 0, tre forsøk av unit_trap i default-effort-rundene:

ForsøkGrok 4.6Grok 4.5
112.25 s / 726 tok8.38 s / 414 tok
223.20 s / 1,400 tok15.32 s / 750 tok
381.61 s / 4,770 tok10.08 s / 480 tok

Et 6.6× spenn på 4.6 mot 1.8× på 4.5, på byte-for-byte identiske input. Ved dimensjonering av en timeout eller et per-forespørsel token-budsjett betyr den halen mer enn medianen, og det taler for når den nyere modellen er feil standardvalg.

Oppgaven som gikk motsatt vei

constraint_schedule var 4.6 raskere ved medianen i default-effort-rundene: 26.38 s mot 34.21 s, på færre output-tokens også (1,644 mot 1,710). Å bare rapportere tallene som passer en tese er noe lesere og Google trekker fra.

Er det modellen, eller er det standardvalget?

Å låse reasoning_effort til samme verdi på begge modellene lukker ikke gapet; det utvider det, fra 1.51× til 2.91×. docs.x.ai (hentet 2026-08-12) lister fire nivåer (low, medium, high, xhigh), og runde 1 og 2 satte aldri et, så gapet kunne ha vært et fabrikkstandardvalg. Runde 3 låste det eksplisitt på tvers av 32 kall.

Matchet effort4.6 median output4.5 median outputRatioNøyaktighet
low222 tok147 tok1.51×8/8 vs 8/8
high606 tok208 tok2.91×8/8 vs 8/8

Hadde gapet kollapset ved matchet effort, ville den ærlige overskriften vært «it's just a default». Det gjorde det ikke.

Hvordan kutter du Grok 4.6 sin token-regning?

Sett reasoning_effort til low, og 4.6 sin median output faller fra 438 til 222 tokens, med uendret nøyaktighet på 8/8. Samme fire oppgaver begge veier: default-tallet samler tolv kall fra de to første rundene, low-tallet åtte fra kontrollen.

json
{
  "model": "x-ai/grok-4.6",
  "messages": [{"role": "user", "content": "..."}],
  "temperature": 0,
  "reasoning": {"effort": "low"}
}

Det er en 49 % reduksjon, verdt omtrent $1.30 per tusen kall av denne typen ved $6 per million output-tokens. Én forespørselsparameter halverer omtrent Grok 4.6 sin output-regning på rutinemessig strukturert arbeid, uten at vi kunne måle noe tap. Fire oppgaver er et signal, ikke en policy: test det på din egen miks først.

Hva andres målere viser

Artificial Analysis, på sin egen evalueringspakke, ble fakturert $1,068.47 for å score Grok 4.6 mot $579.21 for Grok 4.5. Deres tall, ikke våre, fra deres Grok 4.6- og Grok 4.5-modellsider på artificialanalysis.ai, hentet 2026-08-12.

Metric (Artificial Analysis)Grok 4.6 (high)Grok 4.5 (high)Ratio
Intelligence Index6156+5 pts
Output-tokens for å kjøre indeksen72M60M1.20×
Kost for å kjøre indeksen$1,068.47$579.211.84×
Tid til første token32.30 s8.68 s3.72×
Cache-treff pris per M$0.50$0.301.67×

Deres 1.84× og våre 1.38× er uenige, og grunnen er informativ: oppgavemiksen deres er tyngre, og totalen deres inkluderer input-tokens der vår isolerer output. To meters, samme retning.

Cache-raden ble først flagget av HN-brukeren pzo i lanseringstråden (kommentar 49275740) og bekreftes på begge sidene: opp 67 %, og det koster mest på de langvarige agent-arbeidsmengdene 4.6 er rettet mot, der cache-gjenbruk er hele poenget.

Er Grok 4.6 bedre enn Claude på koding?

På korrekthet er de like: Grok 4.6, Claude Sonnet 5 og Claude Opus 4.8 bestod alle 10 av 10 utførte kodetester. Det er hovedsaken, og for Grok en reell fremgang.

Vi sluttet å gradere tekst for denne testen. Fem oppgaver med skjulte enhetstester, to forsøk hver, 30 kall: semver-matching inkludert ^0.x-tilfellet, en LRU-cache med TTL på eksplisitt klokke, intervallsammenslåing med berørende grenser, en varighetsparser som må avvise 1m30h og 1.5h, og grapheme-trygg avkorting som ikke skal foreldreløsgjøre et kombinerende tegn eller splitte en emoji. Hvert svar kjøres i en subprosess og består bare hvis alle assertions holder. Skript grok_vs_claude_coding.py, rådata i benchmark-coding-raw.json.

python
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout   # the model never sees the tests
ModellBeståttMedian-latensMedian output-tokOutput $/MTotal kost
Grok 4.610/1026.82 s2,016$6$0.1169
Claude Sonnet 510/106.76 s500$10$0.0596
Claude Opus 4.810/104.96 s411$25$0.1006

Korrekthetslikheten er nyheten. Regningen er fella: Grok 4.6 kjørte 4.0× tregere enn Sonnet 5 og 5.4× tregere enn Opus 4.8, på 4.0× og 4.9× medianen for output-tokens. Den token-appetitten spiser opp hele prisfordelen. Grok 4.6 kostet mer enn Claude Opus 4.8 på disse fem oppgavene til tross for at output-tokenene dens er 4.2× billigere, fordi den brukte 18,345 output-tokens mot Opus 4.8 sine 3,630. Mot Sonnet 5 kostet den 1.96× så mye, og Sonnet 5 sin pris per output-token er den høyeste av de to. En billigere prisliste er ikke en billigere modell, som er den samme lærdommen tallene for 4.6 mot 4.5 lærer ett avsnitt lenger opp.

Én vurdering, merket som vurdering og ikke måling: for medie- og innholdsautomatiserings-pipeliner har vi historisk sett valgt Grok fremfor Claude, hovedsakelig på grunn av dens X-native inntak og løsere håndtering av markedsføringstekst. Vi har ingen benchmark for det, og presenterer ingen. På kodearbeidet vi kan gradere deterministisk, er de tre like på korrekthet, og Grok betaler fire til fem ganger tokenene.

Hva vi ikke testet

Oppgavene våre ble mettet ved 40/40, så dette måler kostnad på rutinearbeid, ikke kapasitet på de agentiske jobbene SpaceXAI har finjustert for. Fem begrensninger:

  1. Nøyaktighetslikheten er en takeffekt («ceiling effect»), ikke et bevis på at 4.6 ikke er smartere. Oppgavene våre gikk tomme for vanskelighetsgrad før modellene gjorde det, og de tester ikke frontlinje langvarig agent-koding.
  2. To til tre forsøk per oppgave. Nok til en retning og en variansfortelling, ikke et konfidensintervall.
  3. Målt gjennom OpenRouter, ikke SpaceXAI sitt eget endepunkt. Ruting legger til latens som ikke er modellens, som er grunnen til at de leverandøruavhengige token-tellingene bærer argumentet.
  4. Én oppgave gikk mot tesen, constraint_schedule, der 4.6 var raskere ved medianen.
  5. Claude-sammenligningen ble også mettet. Fem kodeoppgaver, alle tre modellene 10/10, så den skiller kostnad og latens, men sier ingenting om hvilken modell som er sterkest ved taket.

Vi testet heller ikke det SpaceXAI faktisk hevder: sterkere førsteutkast på visuelle og interaktive prosjekter. Ingen deterministisk gradering finnes for det, så vi bestrider det ikke. Vi har ikke noe kommersielt forhold til SpaceXAI og betalte for hvert kall selv.

Hvem bør oppgradere, og hvem bør bli på 4.5?

Oppgrader hvis trafikken din er langvarig agent-arbeid; bli på 4.5 hvis det er korte strukturerte kall i volum. På indeksaksen som alle andre lanseringsdag-artikler bruker, vinner 4.6 til en identisk prisliste. På målt kostnad per riktig svar snur grok 4.6 vs grok 4.5 den andre veien.

Din arbeidsmengdeVelgHva snur det
Høyvolum strukturerte eller JSON-kallGrok 4.5en oppgave 4.5 faktisk feiler
Langvarig agentisk kodingGrok 4.6ingenting vi målte; dette er dens sak
Latensfølsomme brukerløpGrok 4.581.61 s-halekallet, inntil du setter et effort-tak
Sesjoner med tung cache-gjenbrukregn på det$0.50 vs $0.30 per M kan overstige token-gapet
Allerede på 4.6bli, men sett effortå la det stå usatt koster 49 % mer output

Grok 4.5 er fortsatt den billigste veien til det identiske svaret på rutinemessig strukturert arbeid. Det er ikke det samme som at 4.6 er dårligere: den kjøper gevinstene sine ved å tenke lenger, og på hverdagslige produksjonskall er den byttehandelen en kostnadsøkning uten noen nøyaktighetsgevinst vi kunne måle. Enda et argument for å låse en modellversjon i en agent-stack i stedet for å følge latest.

Tre skript, én OpenRouter-nøkkel og under en dollar i kreditt er hele kostnaden ved å sjekke om trafikken din ligner vår.

Ofte stilte spørsmål

Finnes det en Grok 5 eller Grok 5.6?

Ingen av dem finnes. Per 12. august 2026 er Grok 4.6 den nyeste lanserte modellen. Grok 4.7 var signalisert til sent i august eller tidlig september, og hadde ikke lansert da vi skrev dette; alt forbi det er siktet mot slutten av 2026. «5.6» er nesten helt sikkert GPT-5.6 Sol, en OpenAI-modell Grok 4.6 er benchmarket mot.

Koster Grok 4.6 mer enn Grok 4.5?

Samme prisliste, $2/M input og $6/M output på begge. Våre 80 målte kall ga identiske svar for 1.38× den totale kostnaden, fordi 4.6 sender ut 1.90× medianen av output-tokens. Cachet input steg også fra $0.30 til $0.50 per million.

Er Grok 4.6 tregere enn Grok 4.5?

Ved vår median, 1.26× tregere: 5.25 s mot 4.17 s på tvers av 40 kall hver. Ved vårt verste kall, 2.27×: 81.61 s mot 35.98 s. Artificial Analysis, som måler separat, rapporterer tid til første token på 32.30 s mot 8.68 s. Merk at vi målte gjennom OpenRouter, så ruting legger til latens modellen selv ikke er ansvarlig for.

Hva er Grok 4.6 sitt kontekstvindu og hvordan kaller jeg det?

500K tokens, uendret fra Grok 4.5. Slugen er x-ai/grok-4.6 på OpenRouter og grok-4.6 på SpaceXAI sitt API, med en rask variant til det dobbelte av standardprisen. Sett reasoning_effort eksplisitt i stedet for å arve det; standarden er high, og på våre fire kontrolloppgaver halverte det å senke den til low output-tokens uten at det kostet et eneste riktig svar.

Bør jeg bli på Grok 4.5?

For høyvolum strukturert arbeid, ja: den ga de samme svarene for mindre penger på tvers av alle 80 kall. For langvarig agentisk koding, arbeidsmengden SpaceXAI finjusterte 4.6 for, avgjør ikke oppgavene våre det, og vi testet det ikke. Mål din egen miks.

Emneord

grok 4.6grok 4.5spacexaillm costopenrouter

Del denne artikkelen

Kom i gang

Klar til å bygge noe ekstraordinært?

La oss gjøre visjonen din til virkelighet. Teamet vårt er klart til å hjelpe deg med å lage programvare som utgjør en forskjell.