
GPT-5.5 Pro Benchmark Sonuçları: OpenAI'ın Yayımladıkları (ve Yayımlamadıkları)
OpenAI, GPT-5.5 Pro'yu 23 Nisan 2026'da piyasaya sürdü ve fiyatını milyonda $30 giriş, $180 çıkış token olarak belirledi. Bu, temel GPT-5.5'in $5/$30 fiyatının tam 6 katı. Bu ücret karşılığında BrowseComp'ta %90,1 gibi bir skor elde eden, daha yüksek hesaplama gücüyle çalışan bir model alıyorsunuz. Ama kimsenin manşete taşımadığı şu var: OpenAI'ın kendi değerlendirme tablosunda GPT-5.5 Pro'nun kodlama satırı boş. Bilgisayar kullanımı da öyle. Uzun bağlam da. Yani modelin SWE-Bench Pro skorunu aradığınızda, ortada bir skor yok. OpenAI'ın yayımladığı tabloyu çektik ve her rakamı kendimiz doğruladık.
Kısa yanıt:
- GPT-5.5 Pro, 23 Nisan 2026'da piyasaya çıkan GPT-5.5'in yüksek hesaplama güçlü versiyonudur; yeni bir model değildir.
- Tarama (BrowseComp %90,1) ve ileri düzey matematik testlerinde öne geçiyor; ancak OpenAI kodlama, bilgisayar kullanımı ve uzun bağlam satırlarını boş bıraktı.
- Var olan kodlama satırlarında temel GPT-5.5, Claude Fable 5'in gerisinde kalıyor (SWE-Bench Pro %58,6'ya karşı %80,3).
- Claude Fable 5 şu an askıya alınmış durumda (ABD ihracat kontrol direktifi, yaklaşık 12 Haziran 2026), dolayısıyla bu galibiyetin yanında "şu an satın alınamıyor" notu var.
Doğruluk, bir benchmark yazısında hızdan daha önemli olduğu için yönteme kısaca değinelim: aşağıdaki rakamlar OpenAI'ın ve Anthropic'in yayımladığı tablolar ile SWE-Bench Pro makalesi (arXiv 2509.16941) üzerinden çapraz doğrulandı. Yalnızca bir sağlayıcının aktardığı değerlerde bunu açıkça belirtiyoruz. OpenAI'ın Pro skoru hiç yayımlamadığı yerlerde ise temel modelin sayısını sessizce koymak yerine "yayımlanmadı" yazıyoruz.
GPT-5.5 Pro Benchmark Sonuçları: OpenAI'ın Gerçekte Yayımladıkları
GPT-5.5 Pro'nun yayımlanan benchmark sonuçları dar bir dilimi kapsıyor: tarama, ileri düzey matematik, profesyonel bilgi işi, genetik ve genel muhakeme. OpenAI tüm değerlendirmeleri araştırma ortamında xhigh akıl yürütme çabasıyla çalıştırdı; bu, ChatGPT'nin varsayılan üretim ayarından farklı. Öne çıkan rakam BrowseComp %90,1 ve temel GPT-5.5'in %84,4'ünün oldukça üzerinde.
Her test için OpenAI'ın ayrı bir Pro skoru yayımlayıp yayımlamadığını gösteren sütunla birlikte ana tablo:
| Benchmark | Ne test ediyor | GPT-5.5 Pro | GPT-5.5 temel | Pro yayımlandı mı? | Notlar |
|---|---|---|---|---|---|
| BrowseComp | Zor web tarama / bilgi bulma | %90,1 | %84,4 | Evet | Pro'nun temel modele karşı en net galibiyeti |
| FrontierMath T1-3 | Zor matematik | %52,4 | %51,7 | Evet | Raporlanan Opus 4.7'yi (%43,8) geçiyor |
| FrontierMath T4 | İleri düzey matematik | %39,6 | %35,4 | Evet | En zor matematik seviyesi |
| GDPval | Profesyonel bilgi işi | %82,3 (iddia) | %84,9 | Evet (atıfla) | OpenAI'ın tablosu Pro'yu temel modelin altında gösteriyor |
| GeneBench | Çok aşamalı genetik | %33,2 (iddia) | %25,0 | Evet (atıfla) | OpenAI büyük bir sıçramayı "raporluyor" |
| HLE (araçsız) | Genel zor muhakeme | %43,1 | %41,4 | Evet | Raporlanan Opus 4.7'nin (%46,9) altında |
| HLE (araçlarla) | Araç destekli muhakeme | %57,2 (iddia) | %52,2 | Kısmi | Temel %52,2 onaylı; Pro %57,2 iddia |
| Yatırım Bankacılığı Modellemesi | Finansal modelleme | %88,6 (dahili) | %88,5 | Dahili değerlendirme | OpenAI bunu DAHİLİ olarak işaretledi; yumuşak bir rakam olarak değerlendirin |
| SWE-Bench Pro | Otonom kodlama | yayımlanmadı | %58,6 | Hayır | Ana boşluk |
| OSWorld-Verified | Bilgisayar kullanımı | yayımlanmadı | %78,7 | Hayır | Pro için boş |
| Siber güvenlik | Güvenlik görevleri | yayımlanmadı | gösterilmedi | Hayır | Pro için boş |
| Uzun bağlam | Uzun belge hatırlama | yayımlanmadı | gösterilmedi | Hayır | Pro için boş |
Alt bloğu dikkatle okuyun. OpenAI GPT-5.5 Pro için tarama ve matematik skorları yayımladı; ama kodlama, bilgisayar kullanımı, siber güvenlik ve uzun bağlam satırlarını boş bıraktı. BrowseComp, FrontierMath ve GDPval-temel rakamları ikincil takip platformlarıyla onaylandı; GDPval-Pro %82,3, GeneBench %33,2 ve Yatırım Bankacılığı rakamı ise OpenAI tarafından raporlanıyor ama bağımsız olarak doğrulanmadı, bu yüzden bunları kesin gerçek olarak değil, kaynağa atıfla aktarıyoruz.
"Pro" Ne Anlama Geliyor: Yeni Bir Model Değil, Paralel Test Süresi Hesabı
GPT-5.5 Pro, farklı bir mimari değil; çok daha fazla akıl yürütme çabasıyla çalışan aynı GPT-5.5 modelidir. Bunu yeni bir motor olarak değil, yanıt vermeden önce daha uzun süre ve paralel olarak çalışan aynı motor olarak düşünün. OpenAI bu ayara akıl yürütme çabası diyor; Pro ise bunu en üst kademedeki xhigh değere sabitleniyor.
GPT-5.5 Pro, GPT-5.5'ten farklı bir model mi?
Hayır. Aynı ağırlıklar, aynı eğitim. gpt 5.5 pro vs gpt 5.5 thinking veya vs xhigh arayanlar aslında tek bir parametreyi sorguluyor: modelin yanıtlamadan önce ne kadar düşündüğünü. "Paralel test süresi hesabı", modelin yanıtlamadan önce birden fazla akıl yürütme yolunu keşfedip en iyisini seçmesi demek; bu da daha fazla token ve daha fazla gerçek zamana mal oluyor. 6 katı ödediğiniz şey bu ekstra hesap kapasitesi.
Diğer özellikler ortaktır. GPT-5.5 Pro, yaklaşık 1,1 milyon token giriş ve 128 bin token çıkış bağlam penceresine sahip. Daha büyük bir bellek ya da daha akıllı bir temel model satın almıyorsunuz; zaten tanıdığınız model için daha fazla düşünme süresi satın alıyorsunuz.
GPT-5.5 Pro ile GPT-5.5 (Standart) Karşılaştırması: 6 Kat Fiyatın Karşılığı Nerede?
GPT-5.5 Pro, en zor görevlerde — tarama, ileri düzey matematik ve genetik — temel modeli geride bırakıyor; rutin işlerde ise kazanım en azdır. En belirgin artış BrowseComp %90,1'e karşı %84,4, yani derin web araştırmasında 5,7 puanlık bir sıçrama. FrontierMath Seviye 4'te ise %35,4'ten %39,6'ya çıkıyor.
Ama daha fazla hesap her zaman daha yüksek skor anlamına gelmiyor. GDPval'da OpenAI'ın tablosu Pro'yu temel modelin altında gösteriyor (iddia edilen %82,3'e karşı onaylanan %84,9). Bu sezgiyle çelişiyor ve Pro'nun bazı ham kazanımları kalibrasyon lehine feda ettiği şeklinde raporlanıyor. Sonuç değişmiyor: daha fazla ödeme garanti değil.
Pro'nun öne çıktığı alanlar:
- BrowseComp: %90,1 vs %84,4 (+5,7)
- FrontierMath T4: %39,6 vs %35,4 (+4,2)
- GeneBench: %33,2 vs %25,0 (OpenAI'ın iddiası)
- HLE araçlarla: %57,2 (iddia) vs %52,2 (onaylanan temel)
Fark yok ya da geride kaldığı alanlar:
- GDPval: %82,3 (iddia) vs %84,9 temel
- HLE araçsız: %43,1 vs %41,4, neredeyse kıpırdamadı
İşinizin büyük bölümü günlük taslak hazırlama, kod inceleme ve özetlerden oluşuyorsa 6 kat ek ücret karşılamak zor. Matematik ancak görev gerçekten zorlu olduğunda lehine döner. Maliyet bir sorunsa, LLM API maliyetlerini düşürme rehberimiz kolay %80'i ucuz modellerle yönlendirmeyi ve Pro'yu zor %20 için saklayıp saklamayı ele alıyor.
GPT-5.5 Pro ile Claude Fable 5 Karşılaştırması
Her iki sağlayıcının da raporladığı kodlama benchmark'larında Claude Fable 5, temel GPT-5.5'i açık farkla geçiyor. Ama Fable 5 şu an askıya alınmış durumda, yani bu galibiyet bir yıldız işaretiyle geliyor. Üstelik karşılaştırma göründüğünden daha karmaşık; OpenAI, GPT-5.5 Pro için kodlama skoru hiç yayımlamadı. Dolayısıyla dürüst karşılaştırma şu: kodlamada Fable 5 vs temel GPT-5.5 ve Pro yok.
Üçlü tablo aşağıda. Fable 5 rakamları Anthropic'in yayımladığı tabloya atıfla verilmiştir; boş Pro hücreleri tam anlamıyla öyle:
| Test | GPT-5.5 temel | GPT-5.5 Pro | Claude Fable 5 | Kazanan |
|---|---|---|---|---|
| SWE-Bench Pro | %58,6 | yayımlanmadı | %80,3 | Fable 5 |
| FrontierCode Diamond | %5,7 | yayımlanmadı | %29,3 | Fable 5 |
| Terminal-Bench | %83,4 (v2.1) | yayımlanmadı | %88,0 (v2.1) | Fable 5 |
| OSWorld-Verified | %78,7 | yayımlanmadı | %85,0 | Fable 5 |
| HLE (araçsız) | %41,4 | %43,1 | %56,8-%59,0 | Fable 5 |
| HLE (araçlarla) | %52,2 | %57,2 (iddia) | %64,5 | Fable 5 |
| BrowseComp | %84,4 | %90,1 | yayımlanmadı | GPT-5.5 Pro |
| FrontierMath T4 | %35,4 | %39,6 | raporlanmadı | GPT-5.5 Pro |
| GDPval-AA | 1769 | yayımlanmadı | 1932 | Fable 5 |
Bu tabloda iki uyarı var. Birincisi Terminal-Bench: temel GPT-5.5, v2.0'da %82,7 ve v2.1'de %83,4 alırken Fable'ın %88,0'ı v2.1 üzerinden. Fark ilan etmeden önce aynı versiyonu okuduğunuzdan emin olun. İkincisi GDPval-AA bir yüzde değil. Fable için 1932, temel GPT-5.5 için 1769 olan Elo tarzı bir skor — tamamen farklı bir ölçek, yüzde satırlarıyla zihinsel olarak eşleştirmeyin. HLE araçsız Fable rakamı da kaynağa göre değişiyor: CodingFleet %56,8 gösterirken diğer özetlerde %59,0 var, bu yüzden aralık olarak veriyoruz.
Otonom kodlama için kıyaslama noktası SWE-Bench Pro. 41 aktif depoda 1.865 problem içeriyor (arXiv 2509.16941) ve görevler kıdemli bir mühendise saatler ya da günler alıp çok dosyalı yamalar gerektiriyor. Bu testte Fable 5'in %80,3'ü ile temel GPT-5.5'in %58,6'sı arasındaki fark geniş.
Yıldız işaretine gelelim. Claude Fable 5, Haziran 2026'da bir ABD ihracat kontrol direktifi kapsamında askıya alındı (yaklaşık 12 Haziran). Yani "Fable kodlamada kazanıyor" rakamlara göre doğru ama şu an satın alma ekranında anlamsız. Anthropic tarafının daha derin bir incelemesi için Claude Fable 5 tam analizimize bakabilirsiniz. GPT-5.5'in matematik karşılaştırmasında temel aldığı model için Claude Opus 4.8 yazımıza göz atın.
OpenAI'ın Pro İçin Yayımlamadığı Benchmark'lar
OpenAI, kodlama (SWE-Bench Pro), bilgisayar kullanımı (OSWorld-Verified), siber güvenlik, uzun bağlam hatırlama veya soyut muhakeme için GPT-5.5 Pro skoru hiç yayımlamadı. Bu satırlar resmi tabloda boş. Boş olmak modelin bu alanlarda kötü olduğu anlamına gelmez. Yayımlanmış bir rakam olmadığı anlamına gelir; bu rakamları aktaran herkes ya tahmin yapıyor ya da yanlışlıkla temel model skorunu kullanıyor.
Bu önemli çünkü en çok aranan boşluk bu. GPT-5.5 Pro'nun SWE-Bench Pro skorunu aradıysanız, ortada böyle bir skor yok. OpenAI bunu hiç yayımlamadı. GPT-5.5 ailesinde bu benchmark için mevcut tek rakam temel modelin %58,6'sı; ve bu temel model rakamı, Pro rakamı değil. Bunu böyle işaretliyoruz, kasıtlı olarak.
Sorumlu biçimde söyleyebileceklerimiz:
- Kodlama (SWE-Bench Pro): Pro yayımlanmadı. Temel GPT-5.5 = %58,6 (temel, Pro değil).
- Bilgisayar kullanımı (OSWorld-Verified): Pro yayımlanmadı. Temel = %78,7 (temel, Pro değil).
- Siber güvenlik: Pro yayımlanmadı, tabloda kullanılabilir bir temel proxy da yok.
- Uzun bağlam: Pro yayımlanmadı, kullanılabilir temel proxy yok.
- Soyut muhakeme: Pro yayımlanmadı.
Pro'nun paralel hesabı bu temel rakamları yükseltir mi? Tarama ve matematteki örüntü göz önüne alındığında muhtemelen evet. Ama "muhtemelen" bir benchmark değildir ve OpenAI'ın yayımlamadığı bir sayıyı biz burada yazmıyoruz. Bu itinayı göstermek için bu bölüm var.
Fiyatlandırma: $5/$30'a karşı $30/$180'e karşı $10/$50 — Pro 6 Kata Değer mi?
GPT-5.5 Pro, temel GPT-5.5'in yaklaşık 6 katına mal oluyor: milyonda $30 giriş ve $180 çıkış; temel modelde bu $5/$30. Claude Fable 5 ise $10/$50 ile aralarında bir yerde. Zor araştırma ve ileri düzey matematik için değer; günlük iş için nadiren.
| Model | Giriş / 1M | Çıkış / 1M | Göreli maliyet |
|---|---|---|---|
| GPT-5.5 temel | $5 | $30 | 1× (referans) |
| Claude Fable 5 | $10 | $50 | ~2× giriş, ~1,7× çıkış |
| GPT-5.5 Pro | $30 | $180 | ~6× temel |
Peki kimin premi gerçekten ödemesi gerekiyor? İşe göre kaba bir değerlendirme:
- Zor araştırma, ileri düzey matematik, derin çok adımlı tarama: GPT-5.5 Pro bu ücretin hakkını veriyor. Benchmark kazanımları gerçek ve görev değeri yüksek.
- Büyük depolarda otonom kodlama: Erişebildiysek Fable 5, aksi halde bir kodlama iskeleti içinde temel GPT-5.5. Yayımlanmamış bir kodlama skoru için Pro fiyatı ödemek kötü bir bahis.
- Günlük taslak hazırlama, özetler, kod inceleme, destek: Temel GPT-5.5. 6 kat ek ücret burada neredeyse hiçbir şey satın almıyor.
Tuzak, her şeyi "güvende olmak için" varsayılan olarak Pro'ya yönlendirmek. Çıkış ağırlıklı iş yüklerinde o $180 rakamı hızla birikiyor. Zorluğa göre yönlendirirseniz, faturanın çok küçük bir bölümüyle kalitenin büyük bölümünü koruursunuz (bununla ilgili daha fazlası LLM API maliyet rehberimizde).
Bu Rakamları Nasıl Doğruladık (ve Kaynaklar Nerede Anlaşmazlık İçinde)
Bu rakamların herhangi birini yazıya girmeden önce sıkıcı kısmı yaptık: OpenAI'ın yayımladığı GPT-5.5 değerlendirme tablosunu çektik ve tek bir ekran görüntüsüne güvenmek yerine her Pro satırını bağımsız takip platformlarıyla karşılaştırdık. Çapraz referans aldığımız kaynaklar: llm-stats, BenchLM, DataCamp'ın Fable 5 yazısı, CodingFleet ve arXiv SWE-Bench Pro makalesi (2509.16941). İşte nelerin tuttuğu ve nelerin tutmadığı.
Öne çıkan Pro rakamlarının çoğu temiz bir şekilde örtüşüyor. BrowseComp %90,1, FrontierMath Seviye 1-3 %52,4 ve Seviye 4 %39,6 ile $30/$180 fiyatlandırması kontrol ettiğimiz her kaynakta eşleşti. Fable 5 için SWE-Bench Pro %80,3 ile temel GPT-5.5 için %58,6 ve FrontierCode Diamond %29,3 ile %5,7 de tuttu — SWE-Bench Pro görev sayısı (41 depoda 1.865 problem) ise sağlayıcı bloglarından değil, doğrudan makaleden geliyor.
Üç şey örtüşmedi; bunları bilmeniz gerekiyor:
- Fable 5 için araçlarla Humanity's Last Exam, kaynağa bağlı olarak %56,8 ile %59,0 arasında değişiyor. Favori seçmek yerine aralığı aktarıyoruz.
- Terminal-Bench rakamları OpenAI'ın ve Anthropic'in tablolarında v2.0 ile v2.1 arasında gidip geliyor; dolayısıyla GPT-5.5 (%83,4) ile Fable (%88,0) farkı temiz bir elma-elma karşılaştırması değil.
- Yatırım Bankacılığı Modellemesi skoru (Pro %88,6), OpenAI tarafından "dahili" olarak etiketlenmiş; yani hiçbir bağımsız platform bunu teyit edemiyor. Göründüğü her yerde sağlayıcı iddiası olarak işaretliyoruz.
Dürüst versiyonu bu. Gerçek olarak sunduğumuz rakamlar en az iki bağımsız kaynakla örtüştü; geri kalan her şey kimin raporladığına atıfla aktarıldı. GPT-5.5 Pro'yu biz çalıştırmadık — milyonda $30/$180 ile ciddi bir baş başa test sahte değil gerçek sonuçlar gerektiriyor ve elimizde olmayan lab sonuçları üretmeyeceğiz.
Sağlayıcıların Raporladığı Gerçek Dünya Sonuçları
Bunlar bağımsız lab sonuçları değil sağlayıcı iddiaları; bu yüzden onları pazarlama yakınlıklı kanıt olarak okuyun. OpenAI ve Anthropic, olumlayıcı bir tablo çizen vaka çalışmaları yayımladı. Bunları atıfla, herhangi birini bizzat doğrulamadığımız uyarısıyla listeliyoruz.
OpenAI tarafında şirket, bir finans ekibinin 24.771 K-1 vergi formunu (71.637 sayfa) GPT-5.5 ile Codex kullanarak geçen yılın sürecinden yaklaşık iki hafta önce bitirdiğini söylüyor. OpenAI ayrıca 11 dakikada tek bir prompttan çalışan bir cebirsel geometri uygulaması ve 62 örnek ile yaklaşık 28.000 gen kapsayan bir gen ifadesi veri setinin GPT-5.5 Pro ile analizini de raporluyor.
Anthropic tarafında Stripe (Anthropic'ten aktarılan), Fable 5'i 50 milyon satırlık bir Ruby kod tabanında tek günde tüm kapsamlı geçiş için kullandı; elle yapıldığında 2 ayın üzerinde süreceği tahmin ediliyor. Anthropic ayrıca Fable 5'in önceki Claude modellerinin ekstra iskelet araçlara ihtiyaç duyduğu yerde ham ekran görüntülerinden Pokémon FireRed'i tamamladığını ve kalıcı dosya tabanlı bellekle Slay the Spire'ı Opus 4.8'den yaklaşık 3 kat daha iyi oynadığını bildiriyor.
Etkileyici demolar, hepsi. Sadece sağlayıcılar tarafından seçildiğini ve yalnızca basın bülteninden tekrar üretilemeyeceğini unutmayın.
Hangi Modeli Gerçekten Kullanmalısınız?
Modeli işe göre seçin, hype'a göre değil. Kodlama ajanları ve büyük depolar için — erişilebiliyorsa Claude Fable 5; yoksa bir kodlama iskeleti içinde temel GPT-5.5. Araştırma, ileri düzey matematik ve derin tarama için GPT-5.5 Pro öne çıkıyor. Günlük iş ve maliyet verimliliği için temel GPT-5.5 neredeyse her zaman değer açısından kazanıyor.
Tek bir çağrı yerine bir yığın seçiyorsanız birkaç ipucu. Gerçekten otonom bir kodlama sistemi istiyorsanız ham bir model değil bir araç lazım; 2026'nın en iyi yapay zeka kodlama ajanları ile Codex ve Devin bağlamı için arka plan coding agent karşılaştırması ile başlayın. Serinin bundan sonra nereye gittiğini merak ediyorsanız, GPT-5.6 hakkında sızdırılanlar burada.
Techsy'de ajan pipeline'larımız boyunca göreve göre yönlendirme yapıyoruz; zor kararlar için üst düzey muhakeme modelleri, geri kalanı için daha ucuz olanlar — her isteği premium fiyatlarla çalıştırmak yerine. Kendi model karışımınız için ikinci bir görüş isterseniz ücretsiz danışma alın.
Yazar Hakkında
Mert Batur, Techsy.io'nun kurucu ortağıdır. Ekip, B2B müşteriler için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştiriyor. Mert, Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını üzerine yazılar kaleme alıyor. LinkedIn'den bağlantı kurun.
Sıkça Sorulan Sorular
GPT-5.5 Pro buna değer mi?
İşe bağlı. Zor araştırma, ileri düzey matematik ve derin taramada GPT-5.5 Pro'nun temel modele göre kazanımları (BrowseComp %90,1'e karşı %84,4), milyonda $30/$180 olan yaklaşık 6 kat fiyatı karşılıyor. Günlük taslak hazırlama, kod inceleme ve özetler için temel GPT-5.5 neredeyse aynı kaliteyi altıda bir maliyetle sunuyor.
GPT-5.5 Pro, Claude Fable 5'ten daha iyi mi?
Yayımlanan kodlama benchmark'larında hayır: Claude Fable 5, SWE-Bench Pro'da temel GPT-5.5'i geçiyor (%80,3'e karşı %58,6) ve OpenAI hiç Pro kodlama skoru yayımlamadı. GPT-5.5 Pro tarama ve ileri düzey matematikte kazanıyor. Bir uyarı: Fable 5 şu an bir ABD ihracat kontrol direktifi kapsamında askıya alınmış durumda, dolayısıyla erişilebilirlik benchmark kadar önemli.
GPT-5.5 Pro kodlamada ne kadar iyi?
Açıkçası, OpenAI'ın rakamlarından söyleyemeyiz; çünkü OpenAI bir GPT-5.5 Pro kodlama skoru yayımlamadı. Ailede var olan tek kodlama rakamı, temel GPT-5.5'in SWE-Bench Pro sonucu olan %58,6; bu da Claude Fable 5'in %80,3'ünün gerisinde kalıyor. "Pro kodlama benchmark'ı" aktaran herkes muhtemelen yanlışlıkla temel modelin rakamını kullanıyor.
GPT-5.5 Pro mu, GPT-5.5 standart mı kullanmalıyım?
Paralel hesabının 6 kat fiyatı hak ettiği zor araştırma, ileri düzey matematik ve derin çok adımlı tarama için GPT-5.5 Pro'yu tercih edin. Günlük iş, kod inceleme ve özetler için premi neredeyse hiçbir şey satın almadığından temel GPT-5.5'e geçin. GDPval gibi bazı testlerde OpenAI'ın tablosu Pro'yu temel modelin biraz altında bile gösteriyor.
GPT-5.5 Pro ne kadar tutuyor?
GPT-5.5 Pro, milyonda $30 giriş ve $180 çıkış token tutarında; bu temel GPT-5.5'in $5/$30'unun yaklaşık 6 katı. Karşılaştırma için Claude Fable 5 $10/$50 seviyesinde. Çıkış ağırlıklı iş yüklerinde Pro primi hızla biriktiğinden, Pro'ya varsayılan olarak yönlendirmek yerine görev zorluğuna göre yönlendirmek ciddi tasarruf sağlıyor.
"xhigh" akıl yürütme çabası ne demek?
Akıl yürütme çabası, GPT-5.5'in yanıtlamadan önce ne kadar düşüneceğini kontrol eden parametredir. "xhigh", modelin paralel test süresi hesabını kullanarak birden fazla akıl yürütme yolunu keşfedip en iyisini seçtiği en üst kademedir. OpenAI, yayımladığı GPT-5.5 Pro değerlendirmelerini araştırma ortamında xhigh ile çalıştırdı; bu, ChatGPT'nin varsayılan üretim ayarından farklı.
GPT-5.5 Pro Codex'te kullanılabilir mi?
Evet. gpt-5.5-pro model dizesini kullanarak GPT-5.5 Pro'yu Codex CLI'da çağırabilir ve en yüksek hesaplama davranışı için akıl yürütme çabasını xhigh olarak ayarlayabilirsiniz. Temel GPT-5.5'e göre belirgin biçimde daha yüksek gecikme ve daha yüksek token maliyeti bekliyoruz; bu yüzden varsayılan kodlama modeliniz olarak çalıştırmak yerine gerçekten zor görevler için saklayın.
GPT-5.5 Pro yeni bir model mi?
Hayır. GPT-5.5 Pro, xhigh ayarında daha fazla akıl yürütme çabası ve paralel test süresi hesabıyla çalışan aynı GPT-5.5 modelidir; ayrı bir mimari değildir. Aynı ağırlıkları ve yaklaşık 1,1 milyon giriş, 128 bin çıkış token bağlam penceresini paylaşıyor. Daha akıllı bir temel model için değil, daha fazla düşünme süresi için ödüyorsunuz.
GPT-5.5 Pro'nun bağlam penceresi ne kadar?
GPT-5.5 Pro, temel GPT-5.5 ile aynı şekilde yaklaşık 1,1 milyon token giriş ve 128 bin token çıkış bağlam penceresine sahip. Bu, büyük kod tabanlarını veya uzun belgeleri tek bir çağrıda yükleyecek kadar geniş. Pro ile temel model arasındaki fark bellek boyutu değil; modelin yanıtlamadan önce harcadığı akıl yürütme hesap kapasitesidir.