ai-machine-learning

Grok 4.6 vs Grok 4.5: Lansman Gününde 80 API Çağrısı Yaptık, Aynı 40/40, Faturada 1.38× Fark

Yazan Gokay Yilmaz
Güncellendi Aug 12, 2026
9 okuma
Grok 4.6 vs Grok 4.5: Lansman Gününde 80 API Çağrısı Yaptık, Aynı 40/40, Faturada 1.38× Fark

Grok 4.6 vs Grok 4.5: Lansman Gününde 80 API Çağrısı Yaptık, Aynı 40/40, Faturada 1.38× Fark

Grok 4.6, 40 puanlanmış görevi bitirmek için bize $0.2992'ye mal oldu. Grok 4.5 aynı 40 görev için $0.2174 tuttu ve aynı yanıtları döndürdü.

Bunu 12 Ağustos 2026'da, SpaceXAI (eski adıyla xAI) modeli yayına aldıktan birkaç saat sonra ölçtük. Aynı fiyat kartı: milyon input token başına $2, output için $6. Aynı skor: 40/40'a karşı 40/40. Aradaki fark, 4.6'da medyan çıktı token'ında 1.90×, bu da faturada %38 daha büyük bir tutar olarak karşımıza çıkıyor.

SpaceXAI 12 Ağustos'ta ne yayınladı

SpaceXAI, Grok 4.6'yı 12 Ağustos 2026'da milyon input token başına $2 ve output için $6 ile, yani Grok 4.5 ile aynı fiyat kartıyla yayınladı. 9to5Mac'a göre 08:56 PT'de çıktı ve resmi duyuru (erişim: 2026-08-12) ajan tabanlı kodlamayı öne çıkarırken işletme maliyeti, gecikme veya token tüketimine dair hiçbir rakam yayınlamıyor.

  1. grok-4.6 olarak SpaceXAI API'sinde ve OpenRouter üzerinde x-ai/grok-4.6 olarak aynı gün kullanıma açıldı.
  2. 500K token'lık bağlam penceresi, Grok 4.5'ten değişmedi.
  3. Milyon başına $2 input, $6 output, artı iki katı fiyattan bir hızlı varyant.
  4. Artificial Analysis Intelligence Index'te 61 puan, satıcı tarafından GPT-5.6 Sol'a denk olarak konumlandırılıyor.
  5. Tek nitel 4.5 karşılaştırması: görsel ve etkileşimli projelerde daha güçlü ilk denemeler.

Cursor'ın lansman günü yazısı üçüncü taraf bir doğrulama gibi okunuyor ama değil: SpaceX, Cursor'ın yapımcısı Anysphere'i 16 Haziran 2026'da $60B'lik hisse karşılığında satın almayı kabul etti.

Grok 4.6'ya geçmeli misiniz?

Rutin yapılandırılmış işler için 4.5'te kalın: 80 çağrımız 1.38×'lik paraya karşılık aynı yanıtları döndürdü. Fiyat kartı her iki OpenRouter model sayfasında byte-identical, yani hiçbir fiyatlandırma sayfası sizi uyaramaz. Token sayıları uyarabilir.

MetrikGrok 4.6Grok 4.5
AA Intelligence Index6156
Milyon başına fiyat (input / output)$2 / $6$2 / $6
Milyon başına cache'lenmiş input$0.50$0.30
Geçilen görev (bizim, 80 çağrı)40/4040/40
Medyan çıktı token'ı (bizim)409215
Aynı yanıtın maliyeti (ölçülen)$0.2992$0.2174
Medyan gecikme (bizim)5.25 s4.17 s
Şunun için seçinuzun soluklu ajan işlerihacimli kısa yapılandırılmış çağrılar

"Bizim" işaretli satırlar lansman günü ölçtüğümüz kendi verilerimiz; index ve cache satırları Artificial Analysis'e ait, erişim: 2026-08-12.

Aynı fiyat kartı, 1.90×'lik token, dolayısıyla aynı yanıtlar için kabaca 1.38×'lik fatura. Çoğu üretim trafiği için grok 4.6 vs grok 4.5 sorusu tam olarak bu: token başına aynı fiyat, farklı bir fatura.

80 API çağrısı lansman gününde gerçekte neyi gösterdi

Sıcaklık sıfırda yapılan 80 lansman günü çağrısında, iki model de 40/40 skor alırken 4.6 medyan çıktı token'ının 1.90×'ini harcadı.

Her prompt'u iki kez gönderdik, biri x-ai/grok-4.6'ya biri x-ai/grok-4.5'e, OpenRouter üzerinden ölçtük, temperature: 0 ile. Round 1 (24 çağrı) kolaydı: puanladığımız JSON-schema görevleri, bir fiyatlandırma hesaplaması, bir Python hata düzeltmesi, kısıtlı bir yazma görevi. Round 2 (24 çağrı) round 1 doyuma ulaştıktan sonra zorlaştı: bir planlama bulmacası, bir birim dönüşüm tuzağı, REVOKED bir yem içeren 402 satırlık bir iğne arama (needle retrieval) ve retry_on'ın 429 ile 503'ü içermesi ama 500'ü içermemesi gereken bir spesifikasyon görevi. Round 3 (32 çağrı) aşağıdaki kontrol grubu. Her puanlayıcı deterministik; hiçbiri LLM tarafından değerlendirilmiyor. Betikler grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; ham çıktı benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json dosyalarında. Toplam harcama, $0.52.

python
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
    r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
        headers={"Authorization": f"Bearer {KEY}"},
        json={"model": model, "temperature": 0,
              "messages": [{"role": "user", "content": PROMPT}]}).json()
    u = r["usage"]
    print(model, u["completion_tokens"],
          u["completion_tokens_details"]["reasoning_tokens"])
Varsayılan-effort roundGrok 4.6Grok 4.5
1, kolay (24 çağrı)12/12, 468 medyan çıktı tok12/12, 241 tok
2, zor (24 çağrı)12/12, 493 medyan çıktı tok12/12, 332 tok

Lansman öncesi konsensüs, 11 Ağustos tarihli ve agregatör bloglara kopyalanmış @haider1'in bir X gönderisi, 4.6'nın 4.5'in hızını ve token verimliliğini koruyacağını söylüyordu. SpaceXAI bunu hiç iddia etmedi; duyurusu hiçbir token iddiası taşımıyor. Unite.AI lansman günü "modelin iddialarını henüz bağımsız bir değerlendirmenin doğrulamadığını" belirtti, biz de burada bir tane sunuyoruz. Grok 4.6, özdeş prompt'larda sıcaklık sıfırda Grok 4.5'in 215'ine karşılık 409 medyan çıktı token'ı kullandı, 200'e karşılık 365 medyan reasoning token'ı, 13,929'a karşılık 27,565 toplam token. 4.6 ne kazanıyorsa, bunun bedelini medyan çıktı token'ının 1.90×'ini ödeyerek karşılıyor.

Kuyruk asıl acıtan yer

Aynı prompt, temperature: 0, varsayılan-effort round'larda unit_trap'ın üç denemesi:

DenemeGrok 4.6Grok 4.5
112.25 s / 726 tok8.38 s / 414 tok
223.20 s / 1,400 tok15.32 s / 750 tok
381.61 s / 4,770 tok10.08 s / 480 tok

Byte-identical girdilerde 4.6'da 6.6×'lik bir yayılma, 4.5'te ise 1.8×. Bir zaman aşımı ya da istek başına token bütçesi belirlerken kuyruk medyandan daha çok önem taşıyor ve bu da yeni modelin ne zaman yanlış varsayılan olduğu sorusunu güçlendiriyor.

Tezin tersine giden tek görev

constraint_schedule'da, 4.6 varsayılan-effort round'larda medyanda daha hızlıydı: 34.21 s'ye karşılık 26.38 s, hem de daha az çıktı token'ıyla (1,710'a karşılık 1,644). Yalnızca bir tezi destekleyen rakamları raporlamak, okurların ve Google'ın gözden düşürdüğü bir şey.

Bu model mi yoksa varsayılan mı?

reasoning_effort'u her iki modelde de aynı değere sabitlemek farkı kapatmıyor, aksine genişletiyor: 1.51×'ten 2.91×'e. docs.x.ai (erişim: 2026-08-12) dört seviye listeliyor (low, medium, high, xhigh) ve round 1 ile round 2 hiçbirini ayarlamadı, yani fark bir fabrika ayarından kaynaklanmış olabilirdi. Round 3, 32 çağrı boyunca bunu açıkça sabitledi.

Eşleştirilmiş effort4.6 medyan çıktı4.5 medyan çıktıOranDoğruluk
low222 tok147 tok1.51×8/8 vs 8/8
high606 tok208 tok2.91×8/8 vs 8/8

Eşleştirilmiş effort'ta fark kapansaydı, dürüst başlık "it's just a default" olurdu. Kapanmadı.

Grok 4.6'nın token faturasını nasıl düşürürsünüz?

reasoning_effort'u low'a ayarlayın, 4.6'nın medyan çıktısı 438'den 222 token'a düşer, doğruluk 8/8'de değişmeden kalır. İki durumda da aynı dört görev: varsayılan rakam ilk iki round'dan on iki çağrıyı, low rakamı ise kontrol grubundan sekiz çağrıyı havuzluyor.

json
{
  "model": "x-ai/grok-4.6",
  "messages": [{"role": "user", "content": "..."}],
  "temperature": 0,
  "reasoning": {"effort": "low"}
}

Bu %49'luk bir azalma, milyon çıktı token başına $6 fiyattan bu şekildeki bin çağrı için kabaca $1.30 değerinde. Tek bir istek parametresi, Grok 4.6'nın rutin yapılandırılmış işlerdeki çıktı faturasını kabaca yarıya indiriyor ve ölçebildiğimiz hiçbir şeyden ödün vermiyor. Dört görev bir sinyaldir, bir politika değil: önce kendi trafik karışımınızda test edin.

Diğer insanların sayaçları ne gösteriyor

Artificial Analysis, kendi değerlendirme paketinde, Grok 4.6'yı puanlamak için $1,068.47 ödedi, Grok 4.5 için ise $579.21. Bunlar bizim değil onların rakamları, artificialanalysis.ai'daki Grok 4.6 ve Grok 4.5 model sayfalarından, erişim: 2026-08-12.

Metrik (Artificial Analysis)Grok 4.6 (high)Grok 4.5 (high)Oran
Intelligence Index6156+5 puan
Index'i çalıştırmak için çıktı token'ı72M60M1.20×
Index'i çalıştırma maliyeti$1,068.47$579.211.84×
İlk token'a kadar geçen süre32.30 s8.68 s3.72×
Milyon başına cache-hit fiyatı$0.50$0.301.67×

Onların 1.84×'ü ile bizim 1.38×'imiz uyuşmuyor ve bunun nedeni bilgilendirici: onların görev karışımı daha ağır, toplamları input token'larını da içeriyor, bizimki ise yalnızca çıktıyı izole ediyor. İki ayrı ölçüm aleti, aynı yönü gösteriyor.

Cache satırını ilk fark eden lansman thread'inde (yorum 49275740) HN kullanıcısı pzo oldu ve her iki sayfada da doğrulanıyor: %67 artış, ve bu en çok 4.6'nın hedeflediği uzun soluklu ajan iş yüklerinde acıtıyor, çünkü cache yeniden kullanımı zaten işin bütün amacı.

Grok 4.6, kodlamada Claude'dan daha mı iyi?

Doğrulukta eşleşiyor: Grok 4.6, Claude Sonnet 5 ve Claude Opus 4.8, çalıştırılan kodlama testlerinin her birinde 10 üzerinden 10'unu geçti. Manşet bu, ve Grok için gerçek bir kazanım.

Bu seferlik metni puanlamayı bıraktık. Gizli birim testleri olan beş görev, her biri iki deneme, 30 çağrı: ^0.x durumunu da içeren semver eşleştirmesi, açık saatli TTL'e sahip bir LRU cache, dokunan sınırlarla aralık birleştirme, 1m30h ve 1.5h'i reddetmesi gereken bir süre ayrıştırıcı, ve bir birleşen işareti (combining mark) yetim bırakmaması veya bir emoji'yi bölmemesi gereken grapheme-safe kırpma. Her yanıt bir subprocess içinde çalışıyor ve yalnızca her assertion sağlandığında geçiyor. Betik grok_vs_claude_coding.py, ham veri benchmark-coding-raw.json içinde.

python
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout   # the model never sees the tests
ModelGeçtiMedyan gecikmeMedyan çıktı tokÇıktı $/MToplam maliyet
Grok 4.610/1026.82 s2,016$6$0.1169
Claude Sonnet 510/106.76 s500$10$0.0596
Claude Opus 4.810/104.96 s411$25$0.1006

Doğruluktaki beraberlik haber değeri taşıyan kısım. Fatura ise asıl yakalanan nokta: Grok 4.6, Sonnet 5'ten 4.0× daha yavaş, Opus 4.8'ten ise 5.4× daha yavaş çalıştı, medyan çıktı token'ının 4.0× ve 4.9×'i üzerinden. Bu token iştahı fiyat avantajını tamamen yiyor. Grok 4.6, çıktı token'ları 4.2× daha ucuz olmasına rağmen bu beş görevde Claude Opus 4.8'den daha pahalıya mal oldu, çünkü Opus 4.8'in 3,630 çıktı token'ına karşılık 18,345 çıktı token'ı üretti. Sonnet 5'e karşı ise 1.96×'i kadar tuttu, üstelik Sonnet'in token başına çıktı fiyatı ikisi arasında daha yüksek olanı. Ucuz bir fiyat kartı ucuz bir model demek değil, tıpkı 4.6'nın 4.5'e karşı rakamlarının bir bölüm yukarıda öğrettiği gibi.

Bir yargı, ölçüm değil yargı olarak işaretlenmiş: medya ve içerik otomasyonu hatlarında tarihsel olarak Claude yerine Grok'a yöneldik, esasen X-native veri alımı ve pazarlama metnine karşı daha gevşek tutumu nedeniyle. Bunun için bir kıyaslamamız yok ve bir tane sunmuyoruz. Deterministik olarak puanlayabildiğimiz kodlama işinde üçü doğrulukta eşleşiyor ve Grok dört ila beş kat daha fazla token'a mal oluyor.

Neyi test etmedik

Görevlerimiz 40/40'ta doyuma ulaştı, yani bu ölçüm rutin işlerdeki maliyeti gösteriyor, SpaceXAI'nin ince ayar yaptığı ajan işlerindeki yeteneği değil. Beş sınır:

  1. Doğruluk eşitliği bir tavan etkisi, 4.6'nın daha akıllı olmadığının kanıtı değil. Görevlerimiz modellerden önce zorluk tükendi ve frontier düzeyinde uzun soluklu kodlamayı test etmiyor.
  2. Görev başına iki ila üç deneme. Bir yön ve varyans hikâyesi için yeterli, bir güven aralığı için değil.
  3. OpenRouter üzerinden ölçüldü, SpaceXAI'nin kendi endpoint'i üzerinden değil. Routing, modelin kendisine ait olmayan bir gecikme ekliyor, bu yüzden sağlayıcıdan bağımsız token sayıları asıl argümanı taşıyor.
  4. Bir görev tezin tersine gitti, constraint_schedule, burada 4.6 medyanda daha hızlıydı.
  5. Claude karşılaştırması da doyuma ulaştı. Beş kodlama görevi, üç modelin de 10/10'u, yani bu maliyeti ve gecikmeyi ayırıyor ama tavan noktasında hangi modelin daha güçlü olduğu hakkında hiçbir şey söylemiyor.

SpaceXAI'nin gerçekte iddia ettiği şeyi de test etmedik: görsel ve etkileşimli projelerde daha güçlü ilk denemeler. Bunun için deterministik bir puanlayıcı yok, bu yüzden bunu tartışmıyoruz. SpaceXAI ile hiçbir ticari ilişkimiz yok ve her çağrının bedelini kendimiz ödedik.

Kim yükseltmeli, kim 4.5'te kalmalı?

Trafiğiniz uzun soluklu ajan işiyse yükseltin; hacimli kısa yapılandırılmış çağrılarsa 4.5'te kalın. Her lansman günü yazısının kullandığı index eksenine göre 4.6, aynı fiyat kartıyla önde. Doğru yanıt başına ölçülen maliyette ise grok 4.6 vs grok 4.5 sorusu tersine dönüyor.

İş yükünüzSeçimNeyi tersine çeviriyor
Yüksek hacimli yapılandırılmış veya JSON çağrılarıGrok 4.54.5'in gerçekten başarısız olduğu bir görev
Uzun soluklu ajan tabanlı kodlamaGrok 4.6ölçtüğümüz hiçbir şey değil; bu zaten onun alanı
Gecikmeye duyarlı kullanıcı akışlarıGrok 4.5effort sınırlamadığınız sürece 81.61 s'lik kuyruk çağrısı
Ağır cache yeniden kullanımlı oturumlarhesabı yapınmilyon başına $0.50'ye karşı $0.30, token farkını yutabilir
Zaten 4.6'da olanlarkalın ama effort belirleyinayarsız bırakmak çıktıyı %49 daha pahalı yapıyor

Grok 4.5, rutin yapılandırılmış işlerde aynı yanıtı almanın hâlâ daha ucuz yolu. Bu, 4.6'nın daha kötü olduğu anlamına gelmiyor: kazanımlarını daha uzun düşünerek satın alıyor ve günlük üretim çağrılarında bu takas, tespit edebildiğimiz hiçbir doğruluk getirisi olmayan bir maliyet artışı. Bir ajan yığınında model sürümünü sabitlemek için bir gerekçe daha, latest'i takip etmek yerine.

Üç betik, bir OpenRouter anahtarı ve bir doların altında kredi, trafiğinizin bizimkine benzeyip benzemediğini kontrol etmenin toplam maliyeti.

Sıkça Sorulan Sorular

Grok 5 ya da Grok 5.6 diye bir şey var mı?

Hiçbiri yok. 12 Ağustos 2026 itibarıyla, Grok 4.6 yayınlanmış en yeni model. Grok 4.7, Ağustos sonu veya Eylül başı için işaret edilmişti ve bunu yazdığımız sırada henüz çıkmamıştı; ondan sonrası 2026 sonu için hedefleniyor. "5.6" hemen hemen kesinlikle GPT-5.6 Sol, Grok 4.6'nın kıyaslandığı bir OpenAI modeli.

Grok 4.6, Grok 4.5'ten daha mı pahalı?

Aynı fiyat kartı, ikisinde de milyon başına $2 input ve $6 output. Ölçtüğümüz 80 çağrı aynı yanıtları toplam maliyetin 1.38×'i karşılığında döndürdü, çünkü 4.6 medyan çıktı token'ının 1.90×'ini üretiyor. Cache'lenmiş input da milyon başına $0.30'dan $0.50'ye yükseldi.

Grok 4.6, Grok 4.5'ten daha mı yavaş?

Medyanımızda, 1.26× daha yavaş: her biri 40 çağrı üzerinden 4.17 s'ye karşılık 5.25 s. En kötü çağrımızda, 2.27×: 35.98 s'ye karşılık 81.61 s. Artificial Analysis, ayrı ölçerek, ilk token'a kadar geçen süreyi 8.68 s'ye karşılık 32.30 s olarak raporluyor. OpenRouter üzerinden ölçtüğümüzü unutmayın, yani routing modelin kendisinin sorumlu olmadığı bir gecikme ekliyor.

Grok 4.6'nın bağlam penceresi nedir ve nasıl çağrılır?

500K token, Grok 4.5'ten değişmedi. OpenRouter'da slug x-ai/grok-4.6, SpaceXAI API'sinde grok-4.6, ayrıca standart fiyatın iki katında bir hızlı varyant var. reasoning_effort'u miras almak yerine açıkça belirleyin; varsayılan high ve bizim dört kontrol görevimizde bunu low'a düşürmek tek bir doğru yanıttan bile ödün vermeden çıktı token'ını yarıya indirdi.

Grok 4.5'te kalmalı mıyım?

Yüksek hacimli yapılandırılmış işler için evet: 80 çağrının tamamında aynı yanıtları daha az paraya döndürdü. SpaceXAI'nin 4.6'yı ince ayarladığı uzun soluklu ajan tabanlı kodlama için ise görevlerimiz bunu kesinleştirmiyor ve biz de bunu test etmedik. Kendi karışımınızı ölçün.

Etiketler

grok 4.6grok 4.5spacexaillm maliyetiopenrouter

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.