
Qwen3.8-Max Geldi: 2,4T Parametre, 1M Bağlam ve Ağırlıklar Hâlâ Yayınlanmadı
$1.4728. Alibaba'nın modeli yayınladığı 2026-08-04 tarihinde, Qwen3.8-Max ve iki önceki neslini kapsayan 40 canlı API çağrısına ödediğimiz tutar bu. Sürpriz olan 2,4 trilyon parametre değildi. Sürpriz şuydu: 3.8-Max, Qwen3.7-Max'a göre token başına 35.6% daha pahalıya mal oluyor ve buna rağmen aşırı düşünmeyi bıraktığı için yanıt başına kabaca 4x daha ucuza geliyordu. Lansman haberciliğinin çoğunun yanlış anladığı bir şey daha var. Bu model açık kaynak değil. Bugün itibarıyla değil.
Bu yazı ilk olarak 2026-07-19'da, Qwen3.8 henüz yayınlanmış bir teknik özelliği olmayan bir önizleme aşamasındayken yayımlandı. 2026-08-04'te GA sürümüne ve kendi API testlerimize göre yeniden yazıldı.
Önemli Çıkarımlar
- 2026-08-04 itibarıyla Qwen3.8-Max yalnızca API üzerinden erişilebiliyor. Alibaba, ağırlıkları Hugging Face ve ModelScope'ta "gelecek hafta", yani 2026-08-10 haftasında yayınlamayı vaat etti.
- Daha yüksek bir token başına fiyata rağmen, kısa bir çağrı için $0.001592 ölçtük; bu rakam Qwen3.7-Max'ta $0.006428'di.
- Alibaba'nın beş benchmark puanı satıcı tarafından bildirildi. 2026-08-04 itibarıyla yayınlanmış bağımsız bir değerlendirme bulamadık.
- Görsel ve video girişi gerçek ve yeni bir özellik. Her ikisini de API üzerinde ve 3.7-Max'ın bunu reddettiğini doğrulayarak test ettik.
Önizleme ile GA Sürümü Arasında Neler Değişti
Qwen3.8-Max, 2026-08-03'te genel kullanıma açıldı (GA) ve bu sürüm, bu sayfanın iki hafta önce listelediği tüm açık soruları yanıtladı. Önizleme döneminde elimizde yalnızca bir parametre sayısı ve bir vaat vardı. GA sürümü ise doğrulanmış 1M tokenlık bir bağlam penceresi, metin artı görsel artı video girişi, beş yayınlanmış benchmark puanı ve token başına bir fiyat ekledi.
İşte çözülmüş eski bilinmeyenler listesi:
| Bu sayfanın 2026-07-19'da söylediği | 2026-08-04'teki durum |
|---|---|
| Yayınlanmış herhangi bir benchmark puanı: yok | Alibaba tarafından bildirilen beş puan yayınlandı |
| Aktif parametreler / MoE yapılandırması: açıklanmadı | Yaygın olarak ~95B aktif, seyrek (sparse) MoE olarak bildiriliyor. Haberler çelişiyor, aşağıya bakın |
| Bağlam penceresi ve maksimum çıktı: duyurulmadı | 1M giriş, 131,072 çıkış, canlı API tarafından doğrulandı |
| Modalite: duyurulmadı | metin + görsel + video giriş, metin çıkış. Bunu kendimiz doğruladık |
| Token başına fiyatlandırma: ayrıştırılmamış | $2.00 / M giriş, $6.00 / M çıkış |
| Açık ağırlık yayın tarihi: "yakında", tarih yok | "Gelecek hafta", Hugging Face ve ModelScope isim olarak belirtildi |
| Qwen3.8-Max-Preview şu anda canlı | Önizleme sona erdi. GA yayınlandı |
Bir madde çözülmedi. Parametre ayrımı hâlâ tartışmalı. MarkTechPost'un lansman yazısı, aktif parametre sayısının Alibaba tarafından açıklanmadığını açıkça belirtirken, SiliconANGLE, The Decoder ve Coursiv hepsi ~95 milyar aktif parametre yazıyor. MarkTechPost makalesini 2026-08-04'te tekrar okuduk ve hâlâ "açıklanmadı" diyor. Birinin kaynağı yanlış ve size söylenebilecek en dürüst şey, bu belirli rakama dair haberciliğin lansman gününde çeliştiği.
Bunu her iki yönde de doğrulayamadık. OpenRouter'ın /models yanıtı hiçbir parametre sayısı alanı içermiyor, bu yüzden testlerimizdeki hiçbir şey 2,4T toplam ya da 95B aktif rakamını ne doğruluyor ne de çürütüyor.
Qwen3.8-Max Açık Kaynak mı? 4 Ağustos İtibarıyla Değil
Hayır. 2026-08-04 itibarıyla Qwen3.8-Max yalnızca API üzerinden erişilebilir. Alibaba, ağırlıkların Hugging Face ve ModelScope'ta "gelecek hafta" yayınlanacağını planladı ve herhangi bir lisans açıklamadı. Haberler "erişilebilir" olanı "açık" ile sürekli birbirine karıştırıyor ve asıl mesele de bu ayrım. Bugün indirilebilecek hiçbir ağırlık yok, bir başlık ne derse desin.
Üç farklı durum tek bir kelimeye sıkıştırılıyor. Bunlar aynı şey değil:
| Durum | Qwen3.8-Max'ın 2026-08-04'teki hâli |
|---|---|
| API üzerinden erişilebilir | Evet. Alibaba Cloud Model Studio, ayrıca bayiler ve router'lar |
| Ağırlıklar indirilebilir | Hayır. "Gelecek hafta" vaat edildi, tarih verilmedi |
| Lisans koşulları | Duyurulmadı. Okunacak herhangi bir metin yok |
Kimsenin sözüne güvenmek yerine elimizdeki en sağlam kanıtı kontrol ettik: Qwen3.8 için bir Hugging Face araması, 2026-08-04'te herhangi bir Alibaba model kartı döndürmüyor. Döndürdüğü şey, Qwen3.8_4B_Distilled ve varyantları adlı dört topluluk yüklemesi; bunlar üçüncü taraf distillasyonlar, amiral gemisi model değil. O sayfayı hızlıca tararsanız, bunları gerçek sürümle karıştırmak kolay.
Lisans konusunda bir not, çünkü emsal sürekli bir taahhüt gibi haber yapılıyor. Qwen 3.5 ve Qwen 3.6, ikisi de Apache 2.0 altında yayınlandı. 2,4T'lik bir modelde kısıtlayıcı bir topluluk lisansı, teknik olarak yine de "açık ağırlıklar" sayılırken, bu ağırlıklarla ne inşa edebileceğinizi değiştirebilir. Lisans metni ortaya çıkana kadar, bu ağırlıklarla ne yapabileceğinizi söyleyen herkes tahmin yürütüyor demektir. Qwen3.8-Max'ın 2026'da çalıştırmaya değer açık kaynaklı LLM'ler derlememizde yer almamasının nedeni de bu: henüz bu tanıma uymuyor.
Ölçtüklerimiz: 35.6% Fiyat Artışına Rağmen Çağrı Başına 4x Daha Ucuz
2026-08-04'te OpenRouter üzerinden qwen3.8-max, qwen3.7-max ve qwen3-max'a karşı 40 faturalandırılmış çağrı yaptık, toplam harcama $1.4728. Aşağıdaki her maliyet, dönen usage nesnesinden hesaplandı ve OpenRouter'ın kendi faturalandırma rakamıyla çapraz kontrol edildi. Hepsi eşleşti. Manşet bulgu, fiyat değişikliğinin tam tersi yönde.
Fiyattan başlayalım. GET /models'ten 2026-08-04 itibarıyla alınan canlı fiyatlandırma, 3.8-Max'ı milyon token başına $2.00 giriş / $6.00 çıkış olarak gösteriyor; 3.7-Max ise $1.475 / $4.425. Bu, her iki tarafta da 35.6% artış anlamına geliyor ve oran her iki durumda da aynı (2.000/1.475 = 6.000/4.425 = 1.3559). Güncel rakamları OpenRouter'ın model sayfasında çapraz kontrol edebilirsiniz.
Şimdi üç modelin tümüne gönderilen aynı basit istem, her biri için üç çalıştırma, temperature: 0, akış (streaming) halinde:
| Model | İlk token (3 çalıştırma) | İlk görünür içerik | Duvar saati süresi (3 çalıştırma) | Tamamlama tokenları | bunun akıl yürütme kısmı | Medyan maliyet/çağrı |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | asla / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
İki ayrı ilk-token sütunu gerekli, çünkü her iki akıl yürütme modeli de herhangi bir yanıt metninden önce gizli akıl yürütmeyi akış halinde gönderiyor. 3.8-Max'ta üç çalıştırmanın ikisinde bir token bir saniyeden kısa sürede geliyor, ama kullanıcının gerçekten okuyabileceği ilk kelime dört ila beş saniye sonra ulaşıyor. 3.7-Max'ın 1. çalıştırmasında ise hiç gelmedi. Bir akıl yürütme modeline karşı akış tabanlı bir arayüz inşa ediyorsanız, bağlantının canlı olduğu kanıtlandıktan çok sonra bile yükleme animasyonu dönmeye devam eder.
Akıl yürütme sütununu iki kez okuyun. Bir Bloom filtresini üç cümleyle açıklamayı isteyen bir istemde, 3.7-Max 1,174 ile 1,500 arasında akıl yürütme tokenı harcadı. 3.8-Max ise 156 ila 194 harcadı. Bu, aynı yanıt için kabaca 7x daha az düşünme anlamına geliyor ve akıl yürütme tokenları çıktı fiyatından faturalandırılıyor. Sonuç: 3.8-Max, çağrı başına yaklaşık 4x daha ucuz ve makinemizden ölçülen duvar saatinde, ağ gidiş-dönüş süresi dahil, 4 ila 5 kat daha hızlı; bunu da token başına 35.6% daha pahalıya mal olarak yapıyor. Etiket fiyatı yükseldi, fatura düştü.
İstemler büyüdükçe bu durum tersine dönüyor. Ölçülmüş değil, canlı fiyatlandırmadan modellenmiş bir hesapla, 500 çıktı tokenlı 30,000 tokenlık bir çağrı, bin çağrı başına 3.8-Max'ta $63.00'a, 3.7-Max'ta $46.46'ya mal oluyor. 100,000 giriş tokeninde bu $203.00'a karşı $149.71 oluyor. Tokenlarınızın çoğu giriş olduğunda, akıl yürütme verimliliği avantajı fiyat artışını karşılamayı bırakıyor ve 3.8-Max üçü arasında en pahalısı hâline geliyor. Hangi modelin en ucuz olduğu gerçekten giriş-çıktı oranınıza bağlı; bu da LLM API fiyatlandırma karşılaştırmamızın sürekli vurguladığı aynı ders.
reasoning_effort Yeni Bir Parametre ve 3.7-Max Onu Sessizce Görmezden Geliyor
reasoning_effort, 3.8-Max'ın desteklenen parametreleri arasında yer alıyor, 3.7-Max'ınkilerde ise yok. 3.8-Max'ta ölçülü bir etkisi var: her biri üç çalıştırma üzerinden, minimal 67, 108 ve 124 akıl yürütme tokenı üretirken high 163, 136 ve 173 üretti. Aynı istemde, sıcaklık 0'da, medyanlar 108'e karşı 163.
Paraya mal olan bulgu ise eski modelde. reasoning_effort: "low" parametresini 3.7-Max'a göndermek reddedilmek yerine kabul ediliyor, ardından görmezden geliniyor: o çağrı yine de 1,401 akıl yürütme tokenı harcadı ve kaydettiğimiz aynı şekildeki çağrıyla aynı $0.006689'u faturalandırdı. Hata yok, uyarı yok, etki yok. Akıl yürütme çabasını düşürerek maliyeti ayarlıyorsanız, bunun gerçekten çağırdığınız modelde bir işe yaradığını doğrulayın, çünkü desteklenmeyen bir parametre burada gürültülü değil sessizce başarısız oluyor.
Geçiş Yapmadan Önce Kontrol Etmeniz Gereken Boş Yanıt Tuzağı
İlk test çalıştırmamız max_tokens: 400 kullandı ve kendi betiğimizi çökertti. Nedeni, testin kendisinden daha değerli çıktı. Qwen3.7-Max, tüm token bütçesini akıl yürütmeye harcayıp boş bir dize döndürebiliyor, finish_reason: "length" ile birlikte ve tam olarak faturalandırılarak.
Bunu üç ayrı defa yaşadık. max_tokens: 400'de: 402 tamamlama tokenı, bunun 400'ü akıl yürütme, sıfır yanıt karakteri, $0.001822 faturalandırıldı. max_tokens: 1500'de: 1,502 token, 1,500'ü akıl yürütme, sıfır karakter, hiçbir şey için $0.006689. Ve daha sonraki bir çağrıda bir kez daha, $0.006735. Hata yok, istisna yok, sadece boş bir içerik dizesine sahip akıcı görünümlü bir yanıt nesnesi.
Mevcut bir 3.7-Max entegrasyonundan geçiş yapıyorsanız ve kodunuz mütevazı bir max_tokens belirliyorsa, bu yolu test etmek için zaman ayırın. 3.8-Max'ın çok daha kısa akıl yürütmesi onu bu riske anlamlı ölçüde daha az maruz bırakıyor. Ama bağışık değil.
Kimsenin Bahsetmediği Küçük Bir Token Ek Yükü
Aynı 12 kelimelik istem, her çalıştırmada tutarlı şekilde 3.8-Max'ta 67 istem tokenı ve 3.7-Max'ta 29 istem tokenı olarak sayıldı (qwen3-max'ta 27). Bu, muhtemelen daha büyük bir sistem veya sohbet şablonundan kaynaklanan kabaca 38 tokenlık sabit bir ek yük. 100,000 tokenlık bir RAG çağrısında bu, sıfıra yuvarlanır. Kısa istemler gönderen yüksek hacimli bir sınıflandırıcıda ise siz daha bir kelime bile yazmadan giriş faturanızı iki kattan fazla artırır.
Qwen3.8-Max Gerçekten Görsel ve Video Kabul Ediyor mu?
Evet ve çoklu-modal (multimodal) giriş bu nesilde gerçekten yeni bir özellik, sadece bir yeniden adlandırma değil. API, 3.8-Max için text+image+video->text bildiriyor, 3.7-Max için ise sadece metin. Aynı görseli her ikisine göndererek farkı doğruladık ve eski model onu yönlendirme (routing) katmanında reddetti.
Test görselini, gerçek değerin baştan bilinmesi için elle yazdığımız bir PNG kodlayıcıyla yerel olarak ürettik: 750x270 piksel, beyaz zemin üzerinde siyah blok rakamlar 4739 ve üstte kırmızı yatay bir çubuk. Base64 kodlanmış olarak gönderildiğinde qwen3.8-max, DIGITS: 4739 ve TOPBAR: red döndürdü. Her iki açıdan da doğru, 6.99s, $0.002146. Aynı istek qwen3.7-max'a gönderildiğinde HTTP 404 {"error":{"message":"No endpoints found that support image input"}} olarak döndü.
Video da çalışıyor, ancak neredeyse bir başarısızlık olarak raporlayacağımız bir çekince var. Denediğimiz üç genel MP4 URL'sinden ikisi HTTP 400 "Failed to download multimodal content" döndürdü. Bu, rotanın videoyu reddetmesi değil, Alibaba'nın dosyayı çekememesi. Çekebildiği bir URL ile 3.8-Max, karakteri isimlendirmek dahil bir Big Buck Bunny klibini doğru şekilde tanımladı, 24.24s'de, $0.006528'e.
Bunun üzerine bir şey inşa etmeden önce iki pratik not. Video, kabaca 10 saniyelik bir klip için 696 sıradan istem tokenı olarak faturalandırıldı ve usage.prompt_tokens_details.video_tokens 0 bildirdi, yani video maliyetini bu alandan ayrıştıramazsınız. Ayrıca hatalı biçimlendirilmiş bir içerik parçası sessizce başarısız oluyor: video_url yerine {"type": "video", "video": [url]} göndermek, modelin nazikçe hiçbir video göremediğini söylediği bir HTTP 200 döndürdü, üstelik bir fatura ile birlikte. video_url'i kullanın.
Bilmekte fayda var: 3.8-Max'a kendi yeteneklerini tanımlamasını istediğimizde, Input modalities: text yanıtını verdi. Bu yanlış, kendi çalıştırmamızdaki bir sonraki test bunu gösterdi. Bir modelin kendini tanımlaması, bir teknik özellik sayfası değil, bir dil modeli çıktısıdır.
1M Tokenlık Bağlam Penceresi Ne Kadar İyi Dayanıyor?
Üretilmiş dolgu metin içine 10%, 50% ve 90% derinliğe üç benzersiz gerçek yerleştirdik ve tek bir çağrıda üçünü de istedik. İki modelde altı çalıştırma boyunca 18 iğnenin 18'i de doğru geldi, 5,723'ten 247,911 tokene kadar değişen istem boyutlarında; yanıtları okuyarak değil, kod içinde tam alt dize eşleşmesiyle değerlendirildi.
qwen3.8-max çalıştırmalarımız (83,380 ve 247,873 tokendeki iki qwen3.7-max çalıştırması ve 78,255 tokendeki bir qwen3-max çalıştırması da her iğneyi doğru döndürdü):
| İstem tokenları (qwen3.8-max) | Gecikme | Maliyet | Bulunan iğneler |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3/3 |
| 25,703 | 13.43s | $0.05453 | 3/3 |
| 83,418 | 17.63s | $0.16965 | 3/3 |
| 247,911 | 38.54s | $0.49828 | 3/3 |
Gecikme alt-doğrusal şekilde ölçekleniyor ki pratikte işe yarayan kısım da bu: 43x daha fazla giriş tokenı, yalnızca 4.2x daha fazla duvar saati süresine mal oluyor.
Şimdi dürüst sınırlar, çünkü bu, uzun bağlam değerlendirmesinin kolay tarafı. Kelimesi kelimesine yerleştirilmiş bir gerçeği geri getirmek, büyük bir belge boyunca akıl yürütme hakkında çok az şey söyler ve her boyutu yalnızca bir kez test ettik. 1M tokenlık bir çağrı çalıştırmadık. Milyon giriş tokeni başına $2.00'dan, bir tanesi yaklaşık $2.00'a mal olurdu; bu, tüm bu test çalışmasından daha fazla ve tek bir örneklem bize pek bir şey söylemezdi. Reklamı yapılan 1M tavan bu yüzden bizim tarafımızdan doğrulanmamış durumda. Ve 3.7-Max, karşılaştırdığımız her iki boyutta da 3.8-Max'a tam olarak eşleşti, yani uzun bağlamda geri getirme bu neslin ayrıştığı nokta değil.
Burada lansman haberciliğinin tamamen kaçırdığı bir fiyatlandırma tuzağı ortaya çıktı. qwen3-max, kademeli fiyatlandırma geçersiz kılmaları taşıyor; 32,000 istem tokenının üzerinde oranını iki katına çıkarıyor ve 128,000'in üzerinde tekrar artırıyor, oysa 3.8-Max ve 3.7-Max her uzunlukta sabit oranlı. Kademeyi gerçek faturalandırmadan doğruladık: qwen3-max'a yaptığımız 78,255 tokenlık çağrı, manşet oran olan $0.78/M değil, $1.56/M oranından $0.12227 olarak faturalandırıldı. Bu uzunlukta neredeyse tam olarak 3.7-Max'ın maliyetine ($0.12523) eşit. Manşet fiyatı bunun yarısından az. 80 bin tokendeki gerçek fiyatı ise bir yuvarlama hatası kadar yakın.
Alibaba'nın Beş Benchmark Puanı ve Hiçbirinin Neden Doğrulanmadığı
Alibaba, GA sürümüyle birlikte beş benchmark puanı yayınladı. Bunların her biri Alibaba'nın kendi iç çalıştırmalarından geliyor ve 2026-08-04 itibarıyla yayınlanmış bağımsız bir değerlendirme bulamadık. Bu cümle, rakamların üç paragraf altında değil, hemen yanında yer almayı hak ediyor.
| Benchmark | Alibaba'nın bildirdiği puan | Bağımsız bir üçüncü taraf tarafından doğrulandı mı? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Hayır, 2026-08-04 itibarıyla |
| GPQA Diamond | 92.6 | Hayır, 2026-08-04 itibarıyla |
| PaperBench | 93.0 | Hayır, 2026-08-04 itibarıyla |
| OSWorld-Verified | 86.1 | Hayır, 2026-08-04 itibarıyla |
| DeepSWE 1.1 | 56.6 (önceki nesil: 21.6) | Hayır, 2026-08-04 itibarıyla |
Alibaba ayrıca 0.474'ten 0.725'e yükselen bir iç toplu puan bildirdi ve modeli Claude Opus 4.8, Fable 5 ve GPT-5.6 Sol'a yakın veya üzerinde konumlandırdı. Arena sıralamaları da dolaşıma girdi: Text Arena'da 5., Vision Arena'da 2. sıra, Alibaba'nın kendi 2026-08-03 duyurusuna göre, ki bunu canlı liderlik tablosunda yeniden teyit etmedik. Arena sıralamaları günlük olarak değişiyor. Bu hafta okuduğunuz herhangi bir sıralamayı üzerinde tarih olan bir anlık görüntü olarak değerlendirin.
Biz dahil kimsenin henüz ölçmediği şeyler: eşzamanlılık altında verim (throughput), İngilizce dışı performans, güvenlik ve hizalama değerlendirmeleri ve araç çağırma güvenilirliği. Kendi rakamlarımız tek bir rota üzerinde gecikme, maliyet, modalite ve uzun bağlamda geri getirmeyi kapsıyor, başka hiçbir şeyi değil. Bloomberg'in lansman haberi, benchmark iddialarını bağımsız test yapmadan tekrarladı; şu anda hemen hemen tüm haberciliğin durduğu nokta da bu.
Kontrol edilmiş rakamlar için Qwen vs DeepSeek vs GLM karşılaştırmamız daha iyi bir referans ve kabaca 2.8T ile Kimi K3, herkesin bu modeli karşılaştırdığı boyut rakibi.
Qwen3.8 ile Qwen3-8B Karşılaştırması ve Bu Sürümün Arkasındaki Açık Ağırlık Dönüşü
Qwen3.8, Alibaba'nın 2,4 trilyon parametreli amiral gemisi modelidir. Qwen3-8B ise Qwen3 serisinden, 2025'ten beri indirilebilen, yoğun (dense) 8 milyar parametreli bir modeldir. Benzer görünen isimler, boyut olarak aralarında kabaca 300x fark var. Arama motorları hâlâ ikisini birbirine karıştırıyor, şaşırtıcı sayıda forum yanıtı da öyle.
İsimlendirme sorunu bu hafta daha iyi değil, daha kötü hâle geldi. Şu anda Hugging Face'te "Qwen3.8" adını taşıyan tek şey topluluk 4B distillasyonları. Ağırlık arayıp bunlardan birini alırsanız, 2,4T model ile hiçbir ilişkisi olmayan bir şey indiriyorsunuz demektir.
Önce İki Kapalı Amiral Gemisi, Sonra Bu
Buradaki asıl haber açık ağırlık vaadi ve aile geçmişini gördüğünüzde farklı okunuyor. Alibaba iki nesil boyunca bilinçli bir ayrımı sürdürdü: herkes için açık ağırlıklı iş atları, en tepede kapalı bir amiral gemisi.
| Nesil | Ağırlıklar | Notlar |
|---|---|---|
| Qwen 3.5 (0.8B - 397B-A17B) | Açık, Apache 2.0 | Tüm aile kamuya açık şekilde yayınlandı |
| Qwen 3.6 (27B dense, 35B-A3B MoE) | Açık, Apache 2.0 | Aynı desen korundu |
| Qwen3.7-Max | Kapalı | Yalnızca API. GGUF yok, Hugging Face checkpoint yok |
| Qwen3.8-Max | Açık olması vaat edildi, henüz yayınlanmadı | 2026-08-03 itibarıyla "gelecek hafta". Lisans açıklanmadı |
Alibaba amiral gemisi katmanını art arda iki nesil boyunca kapalı tuttu ve şimdi şimdiye kadar inşa ettiği en büyük modeli açacağını söylüyor. Ağırlıklar vaat edildiği gibi gelirse, bu gerçek bir dönüş olur ve "sınır (frontier) katman kapalı kalır" görüşünü yerleşik bir norm olarak ele alan her laboratuvarın üzerinde baskı yaratır. Eğer gecikirse, bu art arda üçüncü kapalı Max sürümü olur. Her iki sonuç da 2026-08-04 itibarıyla hâlâ mümkün. Aynı dinamiği GLM 5.2 ile de gördük; orada yayınlanan lisans, duyurudan daha önemli çıkmıştı.
Qwen3.8-Max'ı Kendiniz Çalıştırabilir misiniz? (Hâlâ Hayır)
Hayır ve GA teknik özellikleri bunu daha az değil daha net hâle getiriyor. 2,4 trilyon toplam parametreyle, bu, ağırlıklar yayınlansa bile kendi donanımınızda sunacağınız bir model değil. 685B'lik DeepSeek-V3.2'yi bile bunu yapmış olanlar ciddi bir altyapı projesi olarak tanımlıyor. Bu ise onun birkaç katı.
Peki açık ağırlıklı 2,4T bir model size gerçekte ne kazandırıyor?
- Çıkarım (inference) sağlayıcıları bunu barındırabilir, bu da fiyat rekabeti, bu da token başına maliyetinizin düşmesi demek
- Egemen (sovereign), düzenlenmiş ve hava boşluklu (air-gapped) dağıtımlar bu katmanda ilk kez mümkün hâle geliyor
- Araştırmacılar ve fine-tuning yapanlar, üzerinde çalışacak sınır ölçekli bir temel model kazanıyor
- Bunun makinenizde, tek bir A100'ünüzde ya da startup'ınızın GPU bütçesinde çalışacağı anlamına gelmiyor
Büyük açık ağırlıklı modelleri çalıştırmanın gerçekte ne gerektirdiğine dair hesabı istiyorsanız, LLM VRAM gereksinimleri rehberimiz bu hesabı düzgünce yapıyor. Bu model için kısa cevap: yapmayın.
Geçiş mi Yapmalısınız, Test mi Etmelisiniz, Yoksa Beklemeli misiniz?
| Durumunuz | 2026-08-04'te bizim yapacağımız şey |
|---|---|
| Prodüksiyonda Qwen3.7-Max çalıştırıyorsanız | Önce kısa istemli trafikte 3.8-Max'ı test edin. 4x'lik maliyet farkımız burada ortaya çıktı. Ardından boş yanıt durumu için max_tokens işlemenizi kontrol edin |
| Uzun bağlamlı veya yoğun RAG iş yükü | Şimdilik olduğunuz yerde kalın. 3.8-Max token başına 35.6% daha pahalı ve geri getirme testimizde 3.7-Max'a tam olarak eşleşti |
| Görsel veya video girişine ihtiyacınız var | Geçiş yapmanız için sebep bu. 3.7-Max hiçbir şekilde görsel kabul edemiyor ve 404'ü doğruladık |
| Açık ağırlıkları bekliyorsanız | 2026-08-10'u takviminize işaretleyin. Okunacak bir model kartı ve lisans olana kadar yapacak bir şey yok |
| Claude veya GPT'den memnunsanız | Bugün hiçbir şey değişmiyor. Alibaba'nın benchmark puanları doğrulanmamış durumda ve doğrulanmamış rakamlar bir geçiş gerekçesi oluşturmaz |
Yöntem, sonuçtan daha önemli. Prodüksiyonda test ettiğimiz her model, liderlik tablosundaki konumundan farklı davrandı, çünkü sizin istemleriniz, kod tabanınız ve yeniden deneme toleransınız hiçbir kişinin benchmarkında yer almıyor. Çalıştırmamızdaki iki kodlama görevi bu noktayı gösteriyor: 3.8-Max ve 3.7-Max, bir dize genişliği kırpma görevinde ikisi de 11 üzerinden 11 puan aldı ve tarih aritmetiğinde 5,000 üzerinden 5,000 fuzz test senaryosunu geçti. Doğruluk açısından ikisini birbirinden ayıramadık. Ölçtüğümüz fark, zor istemlerdeki yetenekte değil, kolay istemlerdeki gecikme ve token harcamasında yaşıyor.
Bir geçişi tartıyor ve maliyet modeline ikinci bir göz atılmasını mı istiyorsunuz? Ekibimiz bunu kendi iş yükünüzde stres testine tabi tutsun.
Tüm rakamlar 2026-08-04'te doğrulandı. Fiyatlandırma, arena sıralamaları ve ağırlık takvimi sık sık değişiyor. Ölçümlerimiz tek bir rotadan (OpenRouter üzerinden Alibaba'ya), tek bir makineden, tek bir günden geliyor; gecikme için n=3, çoğu işlevsel test için n=1 ile.
Sıkça Sorulan Sorular
Qwen3.8-Max açık kaynak mı?
2026-08-04 itibarıyla değil. Yalnızca API üzerinden erişilebilir. Alibaba, ağırlıkların Hugging Face ve ModelScope'ta "gelecek hafta" yayınlanacağını planladı ve herhangi bir lisans açıklamadı. Buna açık kaynak diyen başlıklar gerçeklerin önünde. Bir Hugging Face araması yalnızca üçüncü taraf 4B distillasyonları döndürüyor, bir Alibaba model kartı değil.
Qwen3.8-Max ne kadara mal oluyor?
Milyon giriş tokeni başına $2.00 ve milyon çıktı tokeni başına $6.00; önbelleğe alınmış giriş için $0.25 bildiriliyor. Bu, her iki tarafta da Qwen3.7-Max'tan 35.6% daha fazla. Kısa bir çağrı için medyan $0.001592 ölçtük; aynı istemde 3.7-Max'tan kabaca 4x daha ucuz, çünkü çok daha az akıl yürütme tokenı üretiyor.
Qwen3.8-Max'ın kaç parametresi var?
Alibaba'nın duyurusuna ve konuyu ele alan her yayın organına göre toplamda 2,4 trilyon. Aktif sayı tartışmalı: SiliconANGLE, The Decoder ve Coursiv ~95 milyar aktif parametre bildirirken, MarkTechPost Alibaba'nın bunu açıklamadığını belirtiyor. API hiçbir parametre alanı sunmuyor, bu yüzden her iki rakamı da doğrulayamadık.
Qwen3.8-Max'ın bağlam penceresi ne kadar?
Canlı API, 1,000,000 tokenlık bir bağlam ve 131,072 maksimum tamamlama tokenı bildiriyor. 247,911 tokene kadar geri getirmeyi hiçbir başarısızlık olmadan test ettik. 1M tokenlık bir çağrı çalıştırmadık, çünkü bir tanesi yaklaşık $2.00'a mal olur ve test bütçemizi aşardı; dolayısıyla o pencerenin tepesi bizim tarafımızdan doğrulanmamış durumda.
Qwen3.8-Max görsel ve video girişini destekliyor mu?
İkisine de evet, ve bunları doğruladık. Yerel olarak üretilen bir PNG'den rakamları ve bir rengi doğru şekilde okudu, Alibaba'nın çekebildiği bir URL verildiğinde bir videoyu doğru şekilde tanımladı. Qwen3.7-Max, görselleri doğrudan bir 404 ile reddediyor. Üç test video URL'imizden ikisi sağlayıcının indirme adımında başarısız oldu.
Qwen3.8-Max'ın benchmark puanları bağımsız olarak doğrulandı mı?
Hayır. Terminal-Bench 2.1'de 86.6, GPQA Diamond'da 92.6, PaperBench'te 93.0, OSWorld-Verified'da 86.1 ve DeepSWE 1.1'de 56.6 — hepsi Alibaba'nın iç çalıştırmalarından geliyor. 2026-08-04 itibarıyla bunların hiçbiri için yayınlanmış üçüncü taraf bir değerlendirme bulamadık.
Qwen3.8-Max'ı yerel olarak çalıştırabilir miyim?
Gerçekçi olarak hayır, ağırlıklar yayınlansa bile. 2,4 trilyon parametreyle, kendi sunucusunda barındırılması zaten gerçek bir altyapı projesi olan DeepSeek-V3.2'nin birkaç katı büyüklüğünde. Bir veri merkezi işletmiyorsanız, bunu kendi GPU'larınız yerine çıkarım sağlayıcıları üzerinden tüketmeyi bekleyin.
Qwen3.7-Max'tan Qwen3.8-Max'a geçiş yapmalı mıyım?
Token karışımınıza bağlı. Kısa istemlerde 3.8-Max'ı yaklaşık maliyetin dörtte biri ve dört ila beş kat hızda ölçtük. Uzun girişli iş yüklerinde ise 35.6% daha pahalı ve geri getirme testimizde aynı performansı gösterdi. Görsel veya video girişine ihtiyacınız varsa, 3.7-Max bunu hiç yapamıyor.
Qwen3.8-Max ağırlıkları ne zaman yayınlanacak?
Alibaba, 2026-08-03 duyurusunda "gelecek hafta" dedi ve hedef olarak Hugging Face ile ModelScope'u isimlendirdi. Kesin bir tarih yok, lisans metni yok. Beraberinde açık ağırlıklı bir yardımcı model olan Qwen3.8-27B'nin de yayınlanacağı bildiriliyor. 2026-08-10'da yeniden kontrol etmeyi planlıyoruz.