
Grok 4.6 vs Grok 4.5: Lansman Gününde 80 API Çağrısı Yaptık, Aynı 40/40, Faturada 1.38× Fark
Grok 4.6, 40 puanlanmış görevi bitirmek için bize $0.2992'ye mal oldu. Grok 4.5 aynı 40 görev için $0.2174 tuttu ve aynı yanıtları döndürdü.
Bunu 12 Ağustos 2026'da, SpaceXAI (eski adıyla xAI) modeli yayına aldıktan birkaç saat sonra ölçtük. Aynı fiyat kartı: milyon input token başına $2, output için $6. Aynı skor: 40/40'a karşı 40/40. Aradaki fark, 4.6'da medyan çıktı token'ında 1.90×, bu da faturada %38 daha büyük bir tutar olarak karşımıza çıkıyor.
SpaceXAI 12 Ağustos'ta ne yayınladı
SpaceXAI, Grok 4.6'yı 12 Ağustos 2026'da milyon input token başına $2 ve output için $6 ile, yani Grok 4.5 ile aynı fiyat kartıyla yayınladı. 9to5Mac'a göre 08:56 PT'de çıktı ve resmi duyuru (erişim: 2026-08-12) ajan tabanlı kodlamayı öne çıkarırken işletme maliyeti, gecikme veya token tüketimine dair hiçbir rakam yayınlamıyor.
grok-4.6olarak SpaceXAI API'sinde ve OpenRouter üzerindex-ai/grok-4.6olarak aynı gün kullanıma açıldı.- 500K token'lık bağlam penceresi, Grok 4.5'ten değişmedi.
- Milyon başına $2 input, $6 output, artı iki katı fiyattan bir hızlı varyant.
- Artificial Analysis Intelligence Index'te 61 puan, satıcı tarafından GPT-5.6 Sol'a denk olarak konumlandırılıyor.
- Tek nitel 4.5 karşılaştırması: görsel ve etkileşimli projelerde daha güçlü ilk denemeler.
Cursor'ın lansman günü yazısı üçüncü taraf bir doğrulama gibi okunuyor ama değil: SpaceX, Cursor'ın yapımcısı Anysphere'i 16 Haziran 2026'da $60B'lik hisse karşılığında satın almayı kabul etti.
Grok 4.6'ya geçmeli misiniz?
Rutin yapılandırılmış işler için 4.5'te kalın: 80 çağrımız 1.38×'lik paraya karşılık aynı yanıtları döndürdü. Fiyat kartı her iki OpenRouter model sayfasında byte-identical, yani hiçbir fiyatlandırma sayfası sizi uyaramaz. Token sayıları uyarabilir.
| Metrik | Grok 4.6 | Grok 4.5 |
|---|---|---|
| AA Intelligence Index | 61 | 56 |
| Milyon başına fiyat (input / output) | $2 / $6 | $2 / $6 |
| Milyon başına cache'lenmiş input | $0.50 | $0.30 |
| Geçilen görev (bizim, 80 çağrı) | 40/40 | 40/40 |
| Medyan çıktı token'ı (bizim) | 409 | 215 |
| Aynı yanıtın maliyeti (ölçülen) | $0.2992 | $0.2174 |
| Medyan gecikme (bizim) | 5.25 s | 4.17 s |
| Şunun için seçin | uzun soluklu ajan işleri | hacimli kısa yapılandırılmış çağrılar |
"Bizim" işaretli satırlar lansman günü ölçtüğümüz kendi verilerimiz; index ve cache satırları Artificial Analysis'e ait, erişim: 2026-08-12.
Aynı fiyat kartı, 1.90×'lik token, dolayısıyla aynı yanıtlar için kabaca 1.38×'lik fatura. Çoğu üretim trafiği için grok 4.6 vs grok 4.5 sorusu tam olarak bu: token başına aynı fiyat, farklı bir fatura.
80 API çağrısı lansman gününde gerçekte neyi gösterdi
Sıcaklık sıfırda yapılan 80 lansman günü çağrısında, iki model de 40/40 skor alırken 4.6 medyan çıktı token'ının 1.90×'ini harcadı.
Her prompt'u iki kez gönderdik, biri x-ai/grok-4.6'ya biri x-ai/grok-4.5'e, OpenRouter üzerinden ölçtük, temperature: 0 ile. Round 1 (24 çağrı) kolaydı: puanladığımız JSON-schema görevleri, bir fiyatlandırma hesaplaması, bir Python hata düzeltmesi, kısıtlı bir yazma görevi. Round 2 (24 çağrı) round 1 doyuma ulaştıktan sonra zorlaştı: bir planlama bulmacası, bir birim dönüşüm tuzağı, REVOKED bir yem içeren 402 satırlık bir iğne arama (needle retrieval) ve retry_on'ın 429 ile 503'ü içermesi ama 500'ü içermemesi gereken bir spesifikasyon görevi. Round 3 (32 çağrı) aşağıdaki kontrol grubu. Her puanlayıcı deterministik; hiçbiri LLM tarafından değerlendirilmiyor. Betikler grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; ham çıktı benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json dosyalarında. Toplam harcama, $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| Varsayılan-effort round | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1, kolay (24 çağrı) | 12/12, 468 medyan çıktı tok | 12/12, 241 tok |
| 2, zor (24 çağrı) | 12/12, 493 medyan çıktı tok | 12/12, 332 tok |
Lansman öncesi konsensüs, 11 Ağustos tarihli ve agregatör bloglara kopyalanmış @haider1'in bir X gönderisi, 4.6'nın 4.5'in hızını ve token verimliliğini koruyacağını söylüyordu. SpaceXAI bunu hiç iddia etmedi; duyurusu hiçbir token iddiası taşımıyor. Unite.AI lansman günü "modelin iddialarını henüz bağımsız bir değerlendirmenin doğrulamadığını" belirtti, biz de burada bir tane sunuyoruz. Grok 4.6, özdeş prompt'larda sıcaklık sıfırda Grok 4.5'in 215'ine karşılık 409 medyan çıktı token'ı kullandı, 200'e karşılık 365 medyan reasoning token'ı, 13,929'a karşılık 27,565 toplam token. 4.6 ne kazanıyorsa, bunun bedelini medyan çıktı token'ının 1.90×'ini ödeyerek karşılıyor.
Kuyruk asıl acıtan yer
Aynı prompt, temperature: 0, varsayılan-effort round'larda unit_trap'ın üç denemesi:
| Deneme | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
Byte-identical girdilerde 4.6'da 6.6×'lik bir yayılma, 4.5'te ise 1.8×. Bir zaman aşımı ya da istek başına token bütçesi belirlerken kuyruk medyandan daha çok önem taşıyor ve bu da yeni modelin ne zaman yanlış varsayılan olduğu sorusunu güçlendiriyor.
Tezin tersine giden tek görev
constraint_schedule'da, 4.6 varsayılan-effort round'larda medyanda daha hızlıydı: 34.21 s'ye karşılık 26.38 s, hem de daha az çıktı token'ıyla (1,710'a karşılık 1,644). Yalnızca bir tezi destekleyen rakamları raporlamak, okurların ve Google'ın gözden düşürdüğü bir şey.
Bu model mi yoksa varsayılan mı?
reasoning_effort'u her iki modelde de aynı değere sabitlemek farkı kapatmıyor, aksine genişletiyor: 1.51×'ten 2.91×'e. docs.x.ai (erişim: 2026-08-12) dört seviye listeliyor (low, medium, high, xhigh) ve round 1 ile round 2 hiçbirini ayarlamadı, yani fark bir fabrika ayarından kaynaklanmış olabilirdi. Round 3, 32 çağrı boyunca bunu açıkça sabitledi.
| Eşleştirilmiş effort | 4.6 medyan çıktı | 4.5 medyan çıktı | Oran | Doğruluk |
|---|---|---|---|---|
| low | 222 tok | 147 tok | 1.51× | 8/8 vs 8/8 |
| high | 606 tok | 208 tok | 2.91× | 8/8 vs 8/8 |
Eşleştirilmiş effort'ta fark kapansaydı, dürüst başlık "it's just a default" olurdu. Kapanmadı.
Grok 4.6'nın token faturasını nasıl düşürürsünüz?
reasoning_effort'u low'a ayarlayın, 4.6'nın medyan çıktısı 438'den 222 token'a düşer, doğruluk 8/8'de değişmeden kalır. İki durumda da aynı dört görev: varsayılan rakam ilk iki round'dan on iki çağrıyı, low rakamı ise kontrol grubundan sekiz çağrıyı havuzluyor.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}Bu %49'luk bir azalma, milyon çıktı token başına $6 fiyattan bu şekildeki bin çağrı için kabaca $1.30 değerinde. Tek bir istek parametresi, Grok 4.6'nın rutin yapılandırılmış işlerdeki çıktı faturasını kabaca yarıya indiriyor ve ölçebildiğimiz hiçbir şeyden ödün vermiyor. Dört görev bir sinyaldir, bir politika değil: önce kendi trafik karışımınızda test edin.
Diğer insanların sayaçları ne gösteriyor
Artificial Analysis, kendi değerlendirme paketinde, Grok 4.6'yı puanlamak için $1,068.47 ödedi, Grok 4.5 için ise $579.21. Bunlar bizim değil onların rakamları, artificialanalysis.ai'daki Grok 4.6 ve Grok 4.5 model sayfalarından, erişim: 2026-08-12.
| Metrik (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | Oran |
|---|---|---|---|
| Intelligence Index | 61 | 56 | +5 puan |
| Index'i çalıştırmak için çıktı token'ı | 72M | 60M | 1.20× |
| Index'i çalıştırma maliyeti | $1,068.47 | $579.21 | 1.84× |
| İlk token'a kadar geçen süre | 32.30 s | 8.68 s | 3.72× |
| Milyon başına cache-hit fiyatı | $0.50 | $0.30 | 1.67× |
Onların 1.84×'ü ile bizim 1.38×'imiz uyuşmuyor ve bunun nedeni bilgilendirici: onların görev karışımı daha ağır, toplamları input token'larını da içeriyor, bizimki ise yalnızca çıktıyı izole ediyor. İki ayrı ölçüm aleti, aynı yönü gösteriyor.
Cache satırını ilk fark eden lansman thread'inde (yorum 49275740) HN kullanıcısı pzo oldu ve her iki sayfada da doğrulanıyor: %67 artış, ve bu en çok 4.6'nın hedeflediği uzun soluklu ajan iş yüklerinde acıtıyor, çünkü cache yeniden kullanımı zaten işin bütün amacı.
Grok 4.6, kodlamada Claude'dan daha mı iyi?
Doğrulukta eşleşiyor: Grok 4.6, Claude Sonnet 5 ve Claude Opus 4.8, çalıştırılan kodlama testlerinin her birinde 10 üzerinden 10'unu geçti. Manşet bu, ve Grok için gerçek bir kazanım.
Bu seferlik metni puanlamayı bıraktık. Gizli birim testleri olan beş görev, her biri iki deneme, 30 çağrı: ^0.x durumunu da içeren semver eşleştirmesi, açık saatli TTL'e sahip bir LRU cache, dokunan sınırlarla aralık birleştirme, 1m30h ve 1.5h'i reddetmesi gereken bir süre ayrıştırıcı, ve bir birleşen işareti (combining mark) yetim bırakmaması veya bir emoji'yi bölmemesi gereken grapheme-safe kırpma. Her yanıt bir subprocess içinde çalışıyor ve yalnızca her assertion sağlandığında geçiyor. Betik grok_vs_claude_coding.py, ham veri benchmark-coding-raw.json içinde.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # the model never sees the tests| Model | Geçti | Medyan gecikme | Medyan çıktı tok | Çıktı $/M | Toplam maliyet |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
Doğruluktaki beraberlik haber değeri taşıyan kısım. Fatura ise asıl yakalanan nokta: Grok 4.6, Sonnet 5'ten 4.0× daha yavaş, Opus 4.8'ten ise 5.4× daha yavaş çalıştı, medyan çıktı token'ının 4.0× ve 4.9×'i üzerinden. Bu token iştahı fiyat avantajını tamamen yiyor. Grok 4.6, çıktı token'ları 4.2× daha ucuz olmasına rağmen bu beş görevde Claude Opus 4.8'den daha pahalıya mal oldu, çünkü Opus 4.8'in 3,630 çıktı token'ına karşılık 18,345 çıktı token'ı üretti. Sonnet 5'e karşı ise 1.96×'i kadar tuttu, üstelik Sonnet'in token başına çıktı fiyatı ikisi arasında daha yüksek olanı. Ucuz bir fiyat kartı ucuz bir model demek değil, tıpkı 4.6'nın 4.5'e karşı rakamlarının bir bölüm yukarıda öğrettiği gibi.
Bir yargı, ölçüm değil yargı olarak işaretlenmiş: medya ve içerik otomasyonu hatlarında tarihsel olarak Claude yerine Grok'a yöneldik, esasen X-native veri alımı ve pazarlama metnine karşı daha gevşek tutumu nedeniyle. Bunun için bir kıyaslamamız yok ve bir tane sunmuyoruz. Deterministik olarak puanlayabildiğimiz kodlama işinde üçü doğrulukta eşleşiyor ve Grok dört ila beş kat daha fazla token'a mal oluyor.
Neyi test etmedik
Görevlerimiz 40/40'ta doyuma ulaştı, yani bu ölçüm rutin işlerdeki maliyeti gösteriyor, SpaceXAI'nin ince ayar yaptığı ajan işlerindeki yeteneği değil. Beş sınır:
- Doğruluk eşitliği bir tavan etkisi, 4.6'nın daha akıllı olmadığının kanıtı değil. Görevlerimiz modellerden önce zorluk tükendi ve frontier düzeyinde uzun soluklu kodlamayı test etmiyor.
- Görev başına iki ila üç deneme. Bir yön ve varyans hikâyesi için yeterli, bir güven aralığı için değil.
- OpenRouter üzerinden ölçüldü, SpaceXAI'nin kendi endpoint'i üzerinden değil. Routing, modelin kendisine ait olmayan bir gecikme ekliyor, bu yüzden sağlayıcıdan bağımsız token sayıları asıl argümanı taşıyor.
- Bir görev tezin tersine gitti,
constraint_schedule, burada 4.6 medyanda daha hızlıydı. - Claude karşılaştırması da doyuma ulaştı. Beş kodlama görevi, üç modelin de 10/10'u, yani bu maliyeti ve gecikmeyi ayırıyor ama tavan noktasında hangi modelin daha güçlü olduğu hakkında hiçbir şey söylemiyor.
SpaceXAI'nin gerçekte iddia ettiği şeyi de test etmedik: görsel ve etkileşimli projelerde daha güçlü ilk denemeler. Bunun için deterministik bir puanlayıcı yok, bu yüzden bunu tartışmıyoruz. SpaceXAI ile hiçbir ticari ilişkimiz yok ve her çağrının bedelini kendimiz ödedik.
Kim yükseltmeli, kim 4.5'te kalmalı?
Trafiğiniz uzun soluklu ajan işiyse yükseltin; hacimli kısa yapılandırılmış çağrılarsa 4.5'te kalın. Her lansman günü yazısının kullandığı index eksenine göre 4.6, aynı fiyat kartıyla önde. Doğru yanıt başına ölçülen maliyette ise grok 4.6 vs grok 4.5 sorusu tersine dönüyor.
| İş yükünüz | Seçim | Neyi tersine çeviriyor |
|---|---|---|
| Yüksek hacimli yapılandırılmış veya JSON çağrıları | Grok 4.5 | 4.5'in gerçekten başarısız olduğu bir görev |
| Uzun soluklu ajan tabanlı kodlama | Grok 4.6 | ölçtüğümüz hiçbir şey değil; bu zaten onun alanı |
| Gecikmeye duyarlı kullanıcı akışları | Grok 4.5 | effort sınırlamadığınız sürece 81.61 s'lik kuyruk çağrısı |
| Ağır cache yeniden kullanımlı oturumlar | hesabı yapın | milyon başına $0.50'ye karşı $0.30, token farkını yutabilir |
| Zaten 4.6'da olanlar | kalın ama effort belirleyin | ayarsız bırakmak çıktıyı %49 daha pahalı yapıyor |
Grok 4.5, rutin yapılandırılmış işlerde aynı yanıtı almanın hâlâ daha ucuz yolu. Bu, 4.6'nın daha kötü olduğu anlamına gelmiyor: kazanımlarını daha uzun düşünerek satın alıyor ve günlük üretim çağrılarında bu takas, tespit edebildiğimiz hiçbir doğruluk getirisi olmayan bir maliyet artışı. Bir ajan yığınında model sürümünü sabitlemek için bir gerekçe daha, latest'i takip etmek yerine.
Üç betik, bir OpenRouter anahtarı ve bir doların altında kredi, trafiğinizin bizimkine benzeyip benzemediğini kontrol etmenin toplam maliyeti.
Sıkça Sorulan Sorular
Grok 5 ya da Grok 5.6 diye bir şey var mı?
Hiçbiri yok. 12 Ağustos 2026 itibarıyla, Grok 4.6 yayınlanmış en yeni model. Grok 4.7, Ağustos sonu veya Eylül başı için işaret edilmişti ve bunu yazdığımız sırada henüz çıkmamıştı; ondan sonrası 2026 sonu için hedefleniyor. "5.6" hemen hemen kesinlikle GPT-5.6 Sol, Grok 4.6'nın kıyaslandığı bir OpenAI modeli.
Grok 4.6, Grok 4.5'ten daha mı pahalı?
Aynı fiyat kartı, ikisinde de milyon başına $2 input ve $6 output. Ölçtüğümüz 80 çağrı aynı yanıtları toplam maliyetin 1.38×'i karşılığında döndürdü, çünkü 4.6 medyan çıktı token'ının 1.90×'ini üretiyor. Cache'lenmiş input da milyon başına $0.30'dan $0.50'ye yükseldi.
Grok 4.6, Grok 4.5'ten daha mı yavaş?
Medyanımızda, 1.26× daha yavaş: her biri 40 çağrı üzerinden 4.17 s'ye karşılık 5.25 s. En kötü çağrımızda, 2.27×: 35.98 s'ye karşılık 81.61 s. Artificial Analysis, ayrı ölçerek, ilk token'a kadar geçen süreyi 8.68 s'ye karşılık 32.30 s olarak raporluyor. OpenRouter üzerinden ölçtüğümüzü unutmayın, yani routing modelin kendisinin sorumlu olmadığı bir gecikme ekliyor.
Grok 4.6'nın bağlam penceresi nedir ve nasıl çağrılır?
500K token, Grok 4.5'ten değişmedi. OpenRouter'da slug x-ai/grok-4.6, SpaceXAI API'sinde grok-4.6, ayrıca standart fiyatın iki katında bir hızlı varyant var. reasoning_effort'u miras almak yerine açıkça belirleyin; varsayılan high ve bizim dört kontrol görevimizde bunu low'a düşürmek tek bir doğru yanıttan bile ödün vermeden çıktı token'ını yarıya indirdi.
Grok 4.5'te kalmalı mıyım?
Yüksek hacimli yapılandırılmış işler için evet: 80 çağrının tamamında aynı yanıtları daha az paraya döndürdü. SpaceXAI'nin 4.6'yı ince ayarladığı uzun soluklu ajan tabanlı kodlama için ise görevlerimiz bunu kesinleştirmiyor ve biz de bunu test etmedik. Kendi karışımınızı ölçün.