
Grok 4.6 vs Grok 4.5: Vi körde 80 API-anrop på lanseringsdagen – samma 40/40, 1.38× notan
Grok 4.6 kostade oss $0.2992 för att slutföra 40 graderade uppgifter. Grok 4.5 kostade $0.2174 för samma 40 och gav samma svar.
Vi mätte det den 12 augusti 2026, timmar efter att SpaceXAI (tidigare xAI) släppte modellen. Samma priskort: $2 per miljon indata-tokens, $6 utdata. Samma poäng: 40/40 mot 40/40. Skillnaden är 1.90× det mediana antalet utdata-tokens på 4.6, vilket ger en faktura som är 38% större.
Vad SpaceXAI släppte den 12 augusti
SpaceXAI släppte Grok 4.6 den 12 augusti 2026 till $2 per miljon indata-tokens och $6 utdata, samma priskort som Grok 4.5. Den gick ut 08:56 PT enligt 9to5Mac, och det officiella tillkännagivandet (hämtat 2026-08-12) fokuserar på agentisk kodning utan att publicera någon siffra för driftskostnad, latens eller tokenförbrukning alls.
- Tillgänglig samma dag som
grok-4.6på SpaceXAI:s API, och somx-ai/grok-4.6på OpenRouter. - Ett kontextfönster på 500K tokens, oförändrat från Grok 4.5.
- $2/M indata, $6/M utdata, plus en snabbare variant till dubbla priset.
- Ett Artificial Analysis Intelligence Index-värde på 61, framställt av leverantören som likvärdigt med GPT-5.6 Sol.
- En kvalitativ jämförelse mot 4.5: starkare första försök på visuella och interaktiva projekt.
Cursors lanseringsdagsartikel läser ut som tredjepartsvalidering men är det inte: SpaceX gick med på att köpa Cursors tillverkare, Anysphere, för $60B i aktier den 16 juni 2026.
Bör du byta till Grok 4.6?
Stanna på 4.5 för rutinmässigt strukturerat arbete: våra 80 anrop gav identiska svar för 1.38× pengarna. Priskortet är byte-identiskt på båda OpenRouter-modellsidorna, så ingen prissida kan varna dig. Antalet tokens kan.
| Mätvärde | Grok 4.6 | Grok 4.5 |
|---|---|---|
| AA Intelligence Index | 61 | 56 |
| Pris per M (indata / utdata) | $2 / $6 | $2 / $6 |
| Cachad indata per M | $0.50 | $0.30 |
| Godkända uppgifter (våra, 80 anrop) | 40/40 | 40/40 |
| Median utdata-tokens (våra) | 409 | 215 |
| Kostnad för samma svar (uppmätt) | $0.2992 | $0.2174 |
| Median latens (våra) | 5.25 s | 4.17 s |
| Välj denna om | långsiktigt agentarbete | korta strukturerade anrop i volym |
Rader märkta "våra" är våra, uppmätta på lanseringsdagen; index- och cache-raderna kommer från Artificial Analysis, hämtade 2026-08-12.
Identiskt priskort, 1.90× fler tokens, alltså ungefär 1.38× fakturan för samma svar. Det är grok 4.6 vs grok 4.5-frågan för de flesta produktionsflöden: samma pris per token, en annan faktura.
Vad 80 API-anrop på lanseringsdagen faktiskt visade
Över 80 anrop på lanseringsdagen vid temperature zero fick båda modellerna 40/40, medan 4.6 använde 1.90× det mediana antalet utdata-tokens.
Vi skickade varje prompt två gånger, en gång till x-ai/grok-4.6 och en gång till x-ai/grok-4.5, uppmätt via OpenRouter vid temperature: 0. Runda 1 (24 anrop) var lätt: JSON-schema-uppgifterna vi graderade, en prisberäkning, en Python-buggfix, en begränsad skrivuppgift. Runda 2 (24 anrop) blev svårare efter att runda 1 mättats: ett schemaläggningspussel, en enhetskonverteringsfälla, en 402-raders needle-hämtning med en REVOKED-lockfågel, samt en spec-uppgift där retry_on måste innehålla 429 och 503 men inte 500. Runda 3 (32 anrop) är kontrollen nedan. Varje gradering är deterministisk; inget bedöms av en LLM. Skript grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; rådata i benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Total kostnad, $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| Runda med standardansträngning | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1, lätt (24 anrop) | 12/12, 468 median utdata-tok | 12/12, 241 tok |
| 2, svår (24 anrop) | 12/12, 493 median utdata-tok | 12/12, 332 tok |
Konsensusen inför lanseringen, ett X-inlägg av @haider1 daterat 11 augusti och kopierat av flera aggregatorbloggar, sa att 4.6 skulle behålla 4.5:s hastighet och tokeneffektivitet. SpaceXAI påstod aldrig det; tillkännagivandet gör inget tokenpåstående alls. Unite.AI noterade på lanseringsdagen att "ingen oberoende utvärdering har ännu bekräftat" modellens påståenden, så här är en. Grok 4.6 använde 409 median utdata-tokens mot Grok 4.5:s 215 på identiska prompter vid temperature zero, 365 median reasoning-tokens mot 200, och 27,565 totalt mot 13,929. Vad 4.6 än vinner betalar den för med 1.90× det mediana antalet utdata-tokens.
Svansen är där det gör ont
Samma prompt, temperature: 0, tre försök av unit_trap i rundorna med standardansträngning:
| Försök | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
En 6.6× spridning på 4.6 mot 1.8× på 4.5, på byte-identiska indata. När du dimensionerar en timeout eller en tokenbudget per anrop väger den svansen tyngre än medianen, och det talar för när den nyare modellen är fel förval.
Den enda uppgiften som gick åt andra hållet
På constraint_schedule var 4.6 snabbare vid medianen i rundorna med standardansträngning: 26.38 s mot 34.21 s, på färre utdata-tokens också (1,644 mot 1,710). Att bara redovisa de siffror som passar en tes är precis det läsare och Google räknar av.
Är det modellen, eller är det förvalet?
Att låsa reasoning_effort till samma värde på båda modellerna sluter inte gapet; det breddar det, från 1.51× till 2.91×. docs.x.ai (hämtat 2026-08-12) listar fyra nivåer (low, medium, high, xhigh) och rundorna 1 och 2 satte aldrig någon, så gapet skulle kunna ha berott på ett förinställt förval. Runda 3 låste det explicit över 32 anrop.
| Matchad ansträngning | 4.6 median utdata | 4.5 median utdata | Kvot | Träffsäkerhet |
|---|---|---|---|---|
| low | 222 tok | 147 tok | 1.51× | 8/8 vs 8/8 |
| high | 606 tok | 208 tok | 2.91× | 8/8 vs 8/8 |
Om gapet hade kollapsat vid matchad ansträngning hade den ärliga rubriken varit "it's just a default". Det gjorde det inte.
Hur sänker du Grok 4.6:s tokenkostnad?
Ställ reasoning_effort till low och 4.6:s median-utdata sjunker från 438 till 222 tokens, med oförändrad träffsäkerhet på 8/8. Samma fyra uppgifter oavsett: standardsiffran samlar tolv anrop från de två första rundorna, low-siffran åtta från kontrollen.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}Det är en minskning på 49%, värt ungefär $1.30 per tusen anrop av den här typen vid $6 per miljon utdata-tokens. En enda request-parameter halverar ungefär Grok 4.6:s utdatakostnad för rutinmässigt strukturerat arbete, utan att ge upp något vi kunde mäta. Fyra uppgifter är ett tecken, inte en policy: testa på din egen mix först.
Vad andras mätare visar
Artificial Analysis, på sin egen utvärderingssvit, fakturerades $1,068.47 för att poängsätta Grok 4.6 mot $579.21 för Grok 4.5. Deras siffror, inte våra, från deras modellsidor för Grok 4.6 och Grok 4.5 på artificialanalysis.ai, hämtade 2026-08-12.
| Mätvärde (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | Kvot |
|---|---|---|---|
| Intelligence Index | 61 | 56 | +5 pts |
| Utdata-tokens för att köra indexet | 72M | 60M | 1.20× |
| Kostnad för att köra indexet | $1,068.47 | $579.21 | 1.84× |
| Tid till första token | 32.30 s | 8.68 s | 3.72× |
| Cache-hit-pris per M | $0.50 | $0.30 | 1.67× |
Deras 1.84× och våra 1.38× stämmer inte överens, och orsaken är talande: deras uppgiftsmix är tyngre, och deras totalsumma inkluderar indata-tokens där våra bara isolerar utdata. Två mätare, samma riktning.
Cache-raden flaggades först av HN-användaren pzo i lanseringstråden (kommentar 49275740) och bekräftas på båda sidorna: upp 67%, och det biter hårdast på de långvariga agent-arbetsbelastningar 4.6 riktar sig mot, där cacheåteranvändning är hela poängen.
Är Grok 4.6 bättre än Claude på kodning?
På korrekthet är de jämbördiga: Grok 4.6, Claude Sonnet 5 och Claude Opus 4.8 klarade alla 10 av 10 exekverade kodningstest. Det är huvudnyheten, och för Grok en verklig förbättring.
Vi slutade betygsätta text för den här. Fem uppgifter med dolda enhetstester, två försök vardera, 30 anrop: semver-matchning inklusive fallet ^0.x, en LRU-cache med explicit-klocka-TTL, sammanslagning av intervall med rörande gränser, en durationsparser som måste förkasta 1m30h och 1.5h, samt grapheme-säker trunkering som inte får isolera ett kombinerande tecken eller dela en emoji. Varje svar körs i en subprocess och godkänns bara om varje assertion håller. Skript grok_vs_claude_coding.py, rådata i benchmark-coding-raw.json.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # modellen ser aldrig testerna| Modell | Godkänt | Median-latens | Median-utdatatokens | Utdata $/M | Totalkostnad |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
Korrekthets-oavgjort är nyheten. Notan är haken: Grok 4.6 körde 4.0× långsammare än Sonnet 5 och 5.4× långsammare än Opus 4.8, på 4.0× respektive 4.9× median-utdatatokens. Det tokenaptit äter upp hela prisfördelen. Grok 4.6 kostade mer än Claude Opus 4.8 på dessa fem uppgifter trots att dess utdatatokens är 4.2× billigare, eftersom den genererade 18,345 utdatatokens mot Opus 4.8:s 3,630. Mot Sonnet 5 kostade den 1.96× så mycket, och Sonnets pris per token är den högre av de två. Ett billigare priskort är inte en billigare modell, samma lärdom som 4.6-mot-4.5-siffrorna lär ut ett avsnitt upp.
Ett omdöme, flaggat som omdöme snarare än mätning: på media- och innehållsautomationspipelines har vi historiskt föredragit Grok framför Claude, huvudsakligen för dess X-native inmatning och lösare hantering av marknadsföringstext. Vi har inget mätvärde för det och presenterar inget sådant. På kodningsarbetet vi kan betygsätta deterministiskt är de tre jämbördiga på korrekthet och Grok betalar fyra till fem gånger så många tokens.
Vad vi inte testade
Våra uppgifter mättades vid 40/40, så det här mäter kostnad på rutinarbete, inte kapacitet på de agentiska jobb SpaceXAI finjusterat för. Fem begränsningar:
- Träffsäkerhetslikheten är en takeffekt, inte ett bevis på att 4.6 inte är smartare. Våra uppgifter tog slut på svårighetsgrad innan modellerna gjorde det, och de testar inte gränserna för långsiktig kodning.
- Två till tre försök per uppgift. Tillräckligt för en riktning och en variansberättelse, inte ett konfidensintervall.
- Uppmätt via OpenRouter, inte SpaceXAI:s egen endpoint. Routing lägger till latens som inte är modellens, vilket är varför de leverantörsoberoende tokenräkningarna bär argumentet.
- En uppgift gick emot tesen,
constraint_schedule, där 4.6 var snabbare vid medianen. - Claude-jämförelsen mättade den också. Fem kodningsuppgifter, alla tre modeller 10/10, så den skiljer ut kostnad och latens men säger inget om vilken modell som är starkast vid taket.
Vi testade inte heller det SpaceXAI faktiskt påstår: starkare första försök på visuella och interaktiva projekt. Ingen deterministisk gradering finns för det, så vi ifrågasätter det inte. Vi har ingen kommersiell relation med SpaceXAI och betalade för varje anrop själva.
Vem bör uppgradera, och vem bör stanna på 4.5?
Uppgradera om din trafik är långsiktigt agentarbete; stanna på 4.5 om det är korta strukturerade anrop i volym. På indexaxeln som alla andra lanseringsdagsartiklar använder vinner 4.6 till ett identiskt priskort. På uppmätt kostnad per korrekt svar vänder grok 4.6 vs grok 4.5 åt andra hållet.
| Din arbetsbelastning | Val | Vad som avgör |
|---|---|---|
| Högvolyms strukturerade anrop eller JSON-anrop | Grok 4.5 | en uppgift 4.5 faktiskt misslyckas med |
| Långsiktig agentisk kodning | Grok 4.6 | inget vi mätte; det är dess styrka |
| Latenskänsliga användarflöden | Grok 4.5 | 81.61 s-svansanropet, tills du begränsar ansträngningen |
| Sessioner med tung cacheåteranvändning | räkna på det | $0.50 mot $0.30 per M kan äta upp tokenskillnaden |
| Redan på 4.6 | stanna, men sätt ansträngning | att lämna den osatt kostar 49% mer utdata |
Grok 4.5 är fortfarande det billigare sättet att få exakt samma svar på rutinmässigt strukturerat arbete. Det är inte samma sak som att 4.6 är sämre: den köper sina vinster genom att tänka längre, och på vardaglig produktionstrafik är den bytesaffären en kostnadsökning utan mätbar träffsäkerhetsvinst vi kunde upptäcka. Ännu ett argument för att låsa en modellversion i en agentstack istället för att följa latest.
Tre skript, en OpenRouter-nyckel och under en dollar i kredit är hela kostnaden för att kolla om din trafik ser ut som vår.
Vanliga frågor
Finns det en Grok 5 eller Grok 5.6?
Ingen av dem existerar. Per den 12 augusti 2026 är Grok 4.6 den senaste lanserade modellen. Grok 4.7 signalerades för slutet av augusti eller början av september och hade inte lanserats när vi skrev detta; allt bortom det är riktat mot slutet av 2026. "5.6" är nästan säkert GPT-5.6 Sol, en OpenAI-modell som Grok 4.6 jämförs mot i benchmarks.
Kostar Grok 4.6 mer än Grok 4.5?
Samma priskort, $2/M indata och $6/M utdata för båda. Våra 80 uppmätta anrop gav identiska svar för 1.38× den totala kostnaden, eftersom 4.6 avger 1.90× det mediana antalet utdata-tokens. Cachad indata steg också från $0.30 till $0.50 per miljon.
Är Grok 4.6 långsammare än Grok 4.5?
Vid vår median, 1.26× långsammare: 5.25 s mot 4.17 s över 40 anrop vardera. Vid vårt sämsta anrop, 2.27×: 81.61 s mot 35.98 s. Artificial Analysis, som mäter separat, rapporterar tid till första token på 32.30 s mot 8.68 s. Notera att vi mätte via OpenRouter, så routing lägger till latens som modellen själv inte ansvarar för.
Vad är Grok 4.6:s kontextfönster och hur anropar jag den?
500K tokens, oförändrat från Grok 4.5. Slugen är x-ai/grok-4.6 på OpenRouter och grok-4.6 på SpaceXAI:s API, med en snabbare variant till dubbla standardpriset. Sätt reasoning_effort explicit istället för att ärva den; förvalet är high, och på våra fyra kontrolluppgifter halverade en sänkning till low utdata-tokens utan att kosta ett enda korrekt svar.
Bör jag stanna på Grok 4.5?
För högvolyms strukturerat arbete, ja: den gav samma svar för mindre pengar över alla 80 anrop. För långsiktig agentisk kodning, arbetsbelastningen SpaceXAI finjusterade 4.6 för, avgör inte våra uppgifter det och vi testade det inte. Mät din egen mix.