
Claude Opus 5 Geldi: Fable 5'e Yakın Zeka, Yarı Fiyata
Anthropic, 24 Temmuz 2026'da Claude Opus 5'i yayınladı ve mesaj net: Fable 5'in sınır zekasına yakın bir performans, yarı fiyatına. Bunun en somut kanıtı Frontier-Bench v0.1; Opus 5 burada %43,3 alıyor ve Opus 4.8'in %21,1'ini ikiye katlıyor. Ama her zaman bir "ama" vardır: her şeyi kazanamıyor. GPT-5.6 Sol, ajantik kodlama testlerinden birinde hâlâ önde; sağlık ve biyolojide ise taç Mythos 5'in. İşte gerçekte ne değişti, tam benchmark tablosu ve varsayılan modelinizi bugün değiştirip değiştirmemeniz gerektiği.
Öne çıkanlar:
- Claude Opus 5, 24 Temmuz 2026'da Claude API, Claude.ai, Claude Code ve Claude Cowork üzerinde
claude-opus-5model kimliğiyle kullanıma açıldı. - Anthropic'in yayınladığı benchmark'ların çoğunda önde (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench) ancak birkaç kodlama, hukuk ve bilim testinde geride kalıyor.
- Fiyatlandırma Opus 4.8 ile aynı: milyon token başına $5/$25. Yaklaşık 2,5 kat hız için 2 kat fiyat ödediğiniz bir Fast modu da var.
Bugün Ne Yayınlandı: Bir Dakikada Claude Opus 5
Claude Opus 5, Anthropic'in 24 Temmuz 2026'da çıkardığı yeni sınır modeli ve aynı gün API, Claude.ai, Claude Code ve Claude Cowork üzerinde erişilebilir oldu. Model kimliği claude-opus-5. Anthropic'in duyuruya göre çerçevesi şu: "Claude Fable 5'in sınır zekasına yarı fiyatına yaklaşıyor." Standart fiyatlandırma milyon token başına $5 giriş / $25 çıkış olarak kaldı; Opus 4.8 ile aynı.
Bu, ajan işleri için gerçek bir nesil sıçraması; küçük bir güncelleme değil. Claude Opus 4.8'den geliyorsanız API yapısı ve Claude Code entegrasyonu aynen devam ediyor, yani geçiş sadece model kimliği değişikliği. Farklı olan tavan: Frontier-Bench v0.1'de Anthropic, Opus 5'in 4.8'in skorunu ikiye katladığını ve görev başına daha düşük maliyetle GDPval-AA ve ARC-AGI-3'te en iyi sonuçları verdiğini söylüyor.
Konumlandırma önemli. Fable 5, Anthropic'in en pahalı sınır modeli. Ona Opus fiyatıyla bu kadar yaklaşmak, bu sürümün tüm hikâyesi ve Anthropic'in "yarı fiyat" ifadesini öne çıkarmasının nedeni de bu.
Opus 5'te 4.8'e Göre Gerçekte Ne Yeni?
4.8'den 5'e en büyük geçiş muhakeme: Opus 5, kendi çıktısını doğrulamakta ve bir görev gerçekten bitene kadar yinelemekte belirgin şekilde daha iyi; sadece "makul görünüyor" noktasında durmuyor. Anthropic ayrıca daha güçlü yazılım mühendisliği, bilgi işi ve bilimsel araştırma performansı ile geliştirilmiş görsel çıktıdan söz ediyor. Fiyatlandırma ve temel API değişmedi.
Daha iyi muhakeme ve öz-doğrulama
En belirgin davranış değişikliği, Opus 5'in kendini kontrol etmesi. Anthropic, teknik ekip üyesi Zimu Li'nin modeli "dalları doğrulayan, şablonları kontrol eden" şeklinde tanımladığını aktarıyor. Üretimde kendi hatalarını yakalayan bir ajana güvenen herkes için asıl fark yaratan özellik bu. Aynı zamanda benchmark grafiğinde satması en zor şey, dolayısıyla bunu kendi görevlerinizde test etmeniz gereken bir iddia olarak görün.
Opus maliyetine sınır zeka
Cursor'un kurucu ortağı Sualeh Asif, sürümü "Opus hızı ve maliyetinde Fable 5'e yakın zeka" diye özetledi. Pratik okuma şu: Fable 5 sınıfı muhakeme isteyen ama fiyatı gerekçelendiremeyen ekipler artık bir ara seçeneğe sahip. OSWorld 2.0'da Anthropic, Opus 5'in Fable 5'i yaklaşık üçte bir maliyetle geçtiğini söylüyor; bu da değer argümanının en temiz tek örneği.
Hizalama ve güvenlik duruşu
Anthropic, Opus 5'in bugüne kadarki en düşük uyumsuz davranış skoruna (2,3) sahip olduğunu ve Constitution'a en uyumlu model olduğunu belirtiyor. Güvenlik tarafında siber güvenlik sınıflandırıcıları, Fable 5'inkilere göre yaklaşık %85 daha az kısıtlayıcı olarak tanımlanıyor ve ihtiyacı olan ekipler için kurumsal bir Cyber Verification Program mevcut. Her satıcı güvenlik iddiasında olduğu gibi: bilmek faydalı, yine de kendi kırmızı takım senaryolarınızla doğrulamaya değer.
Opus 5 Benchmark'ları: Nerede Kazanıyor (ve Nerede Kaybediyor)
Opus 5, Anthropic'in yayınladığı benchmark'ların çoğunda önde ve ajan geliştiricileri için önemli olan farklar ezici: Frontier-Bench v0.1 (%43,3), GDPval-AA (1861 Elo), ARC-AGI-3 (%30,2), OSWorld 2.0 (%70,6) ve Zapier'ın AutomationBench'i (%26,0). Dürüst istisnalar: GPT-5.6 Sol DeepSWE v1.1'i kazanıyor, Fable 5 FrontierCode ve hukuk testlerinde kıl payı önde, sağlık ve biyolojide ise Mythos 5 birinci.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Ajantik terminal kodlama, Frontier-Bench v0.1 | %43,3 | %33,7 | %21,1 | %34,4 |
| Bilgi işi, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Yeni problem çözme, ARC-AGI-3 | %30,2 | — | %1,5 | %7,8 |
| Ajantik arama, BrowseComp | %90,8 | %87,4 | %84,3 | %90,4 |
| Çok disiplinli muhakeme, Humanity's Last Exam (araçlarla) | %64,7 | %63,9 | %57,9 | — |
| Ajantik bilgisayar kullanımı, OSWorld 2.0 | %70,6 | %66,1 | %55,7 | %62,6 |
| Ajantik kodlama, DeepSWE v1.1 | %68,8 | %69,7 | %59,0 | %72,7 |
| Ajantik kodlama, FrontierCode v1.1 (Main) | %53,4 | %53,5 | %46,5 | %47,5 |
| İş akışları, AutomationBench | %26,0 | %17,4 | %17,0 | %18,1 |
| Hukuk Ajanı Benchmark'ı (held-out) | %11,7 | %13,3 | %10,4 | %2,5 |
| Sağlık, HealthBench Professional | %59,8 | %66,0 | %57,4 | %60,5 |
| Biyoloji, BioMysteryBench (zor) | %49,4 | %46,5 | %42,4 | — |

Mutlak skorlara değil, farklara bakın. Frontier-Bench, Opus 4.8'e göre +22,2 puan sıçradı (21,1'den 43,3'e); bu, en büyük tek sıçrama ve Anthropic'in bunu bir kodlama-ve-ajan sürümü olarak adlandırmasının nedeni. GDPval-AA +268 Elo kazandı (1593'ten 1861'e) ve tablodaki tüm modelleri bilgi işinde geride bıraktı. ARC-AGI-3 en çarpıcı olanı: GPT-5.6 Sol'un %7,8'ine ve Opus 4.8'in %1,5'ine karşılık %30,2; Anthropic bunu yeni problem çözmede bir sonraki en iyi herkese açık modelin yaklaşık 3 katı olarak çerçeveliyor. AutomationBench'te %26,0, alanın yaklaşık 1,5 katı; iş süreci ajanları geliştiren herkes için doğrudan bir sinyal.
Kayıplara dair iki dürüst not. Birincisi, sağlık (%66,0) ve biyoloji insan-çözüm ayrımında Fable 5 sütunundaki lider aslında Mythos 5, Anthropic'in bilime özelleşmiş modeli; Fable 5 değil. Yani bunlar eşdeğer genel model karşılaştırmaları değil. İkincisi, kodlama tablosu gerçekten bölünmüş: GPT-5.6 Sol DeepSWE v1.1'i alıyor (%72,7'ye karşı %68,8) ve Fable 5 FrontierCode'u kıl payı kazanıyor (%53,5'e karşı %53,4). İşiniz saf SWE-bench tarzı kodlamaysa, "genel en iyi" etiketi otomatik olarak Opus 5'i seçmez.
Opus 5 Ne Kadar? Fiyatlandırma ve Fast Modu
Standart Opus 5 fiyatlandırması milyon giriş token'ı başına $5 ve milyon çıkış token'ı başına $25; Anthropic'in yayınladığı fiyatlara göre Opus 4.8 ile birebir aynı, yani yükseltme için fiyat artışı yok. "Yarı fiyat" iddiası Fable 5'e göre, 4.8'e göre değil: Fable 5 tarifesi ödemeden Fable 5'e yakın zeka alıyorsunuz. Fast modu, varsayılan hızın yaklaşık 2,5 katı için taban fiyatın yaklaşık 2 katına çalışıyor ve API yedek yönlendirmeyi destekliyor.
Peki bu görev başına ne anlama geliyor? Standart fiyatlandırmada 4.8'e kıyasla ekstra bir şey ödemiyorsunuz ve büyük bir yetenek sıçraması alıyorsunuz; bu da yükseltmeyi çoğu iş yükü için neredeyse bedava yapıyor. Fast modu, interaktif oturum kolu: aynı modelde yaklaşık 2,5 kat daha hızlı akan çıktı için 2 kat fiyat primi ödüyorsunuz; bu, başında beklerken işe yarıyor ama duvar saati süresinin önemsiz olduğu gece toplu işlerinde can yakıyor. Hız sınırları asıl kısıtınızsa, Claude kullanım limitleri rehberimiz katmanların maliyetle nasıl etkileşime girdiğini anlatıyor.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Opus 5 Üretim Ajanları İçin Nereye Oturuyor?
Kazanımlar tam da üretim ajanlarının yaşadığı yerde kümeleniyor: terminal kodlama (Frontier-Bench), bilgisayar kullanımı (OSWorld 2.0), ajantik arama (BrowseComp) ve çok adımlı iş akışları (AutomationBench). Bu dördü, gerçek dağıtımlarda en sık kırılan iş yükleri; dolayısıyla dördünde birden sıçrayan bir model, neyin yayınlanabilir olduğunu değiştiriyor.
Üzerinde durulması gereken kısım bu. AutomationBench gibi bir benchmark, bir ajanın gerçek bir çok-araçlı iş akışını uçtan uca tamamlayıp tamamlayamadığını ölçüyor ve Opus 5'in %26,0'ı, alanın yaklaşık %17'sine karşı "demoda iyi çalışıyor" ile "dağınık bir CRM'le temasta hayatta kalıyor" arasındaki fark. OSWorld 2.0 sonucu (%70,6, Fable 5'i üçte bir maliyetle geçiyor) aynı şeyi gerçek yazılımda tıklayan bilgisayar kullanımı ajanları için söylüyor. Müşteriye dönük AI ajanları yayınlayan ekipler için bunlar, gece 2'deki arızaların azalmasına çevrilen rakamlar.
Aynı zamanda güvendiğimiz bir tasarım deseninin maliyetini düşürüyor: ucuz öz-doğrulama. Model kendi dallarını gerçekten daha iyi kontrol ettiğinde, ayrı bir eleştirmen geçişi için daha az token harcayıp aynı hataları yakalayabilirsiniz. Bu, ajanları toplu çalıştıran herkes için gerçek bir bütçe kalemi.
Opus 5'i Yığınımıza Nasıl Entegre Ediyoruz?
Techsy'de Claude yığını üzerinde üretim AI ajanları kuruyor ve çalıştırıyoruz, dolayısıyla bir sınır modeli sürümü bizim için aynı gün değerlendirmesi; okuyup geçtiğimiz bir manşet değil. İşte dürüst ilk okumamız: temiz önce/sonra rakamlarımız olmayan yerlerde nitel, olan yerlerde spesifik.
Geçişin kendisi önemsiz ve mesele de bu. İçerik ve otomasyon hatlarımız yapılandırmada varsayılan bir model sabitliyor; claude-opus-4-8'i claude-opus-5 yapıp oturumu yeniden başlatmak sıfır ek değişiklik gerektirdi, son Opus güncellemelerinin hepsinde olduğu gibi. Sağlayıcılar arası yönlendirme yapıyorsanız ve Opus 5'i kendi görevlerinizde Fable 5 veya GPT-5.6 Sol ile A/B test etmek istiyorsanız, bir proxy uygulamanızı yeniden yazmadan model değiştirmenizi sağlıyor.
İlk izlediğimiz şey öz-doğrulama iddiası, çünkü mimarimizi gerçekten değiştirecek olan bu. Mevcut ajanlarımız, kötü düzenlemeler yerine geçmeden önce yakalamak için açık bir eleştirmen adımı çalıştırıyor; Opus 5 kendi zayıf dallarını güvenilir şekilde işaretlerse, o adımı inceltip token tasarrufu yapabiliriz. Bunu tekrarlanabilir bir görev setinde çalıştırana kadar bir rakam yayınlamıyoruz; ajan metrikleri veren herkesten bekleyeceğimiz disiplin de bu. Yöntemi isterseniz, üretimde AI ajanlarını değerlendirme rehberimizdeki yöntem: aynı promptlar, aynı repo durumu, yanlış dönüşleri sayın, hisleri değil.
Opus 4.8'den Geçmeli misiniz? (Geç / Bekle / Kal)
Geçip geçmemeniz iş yükünüze bağlı, hangi modelin "genel kazandığına" değil. Ajantik ve bilgi işi sıçramaları büyük ve gerçek, dolayısıyla çoğu ekip geçmeli. GPT veya Fable hattı olan saf kodlama atölyelerinin taahhüt etmeden önce test etmesi için neden var ve ucuz görevlerde tavana yakın kullanıcılar neredeyse hiçbir şey kaybetmeden yerinde kalabilir.
Şimdi geçin, eğer: işiniz ajantik görevlere, bilgisayar kullanımına, iş süreci otomasyonuna veya bilgi işine dayanıyorsa. Frontier-Bench (4.8'e göre +22,2), AutomationBench (alanın ~1,5 katı) ve GDPval-AA (+268 Elo) en büyük gerçek kazanımlar ve fiyatlandırma değişmedi, yani yükseltmenin maliyet cezası yok.
Bekleyin, eğer: iş akışınız saf ajantik kodlamaysa ve bunun için zaten GPT-5.6 Sol veya Fable 5 kullanıyorsanız. GPT-5.6 Sol hâlâ DeepSWE v1.1'de önde ve Fable 5 FrontierCode'da kıl payı üstün, dolayısıyla yönlendirmeyi değiştirmeden önce kendi kodlama değerlendirmenizi çalıştırın. Ayrıca proje ortasındaysanız ve model değişikliği zaten yürüttüğünüz bir değerlendirmeyi bulanıklaştıracaksa da bekleyin.
4.8'de kalın, eğer: sizin için zaten tavana yakın olan görevlerde maliyete duyarlıysanız ve Opus 5'in öne geçtiği ajantik iş yüklerine dokunmuyorsanız. Hissetmeyeceğiniz bir fark için geçiş maliyeti ödersiniz. Daha geniş alan için modellerin nasıl sıralandığını Claude Sonnet 5 analizimiz ve Fable 5 ile Mythos 5 özetimizde görebilirsiniz.
Her hafta müşteri ajan kurulumları için bu şekilde model seçiyor ve bağlıyoruz. Üretim ajanı için hangi modeli standartlaştıracağınıza karar veriyorsanız, ücretsiz danışmanlık alın; modeli pazarlamaya değil, iş yüküne göre eşleştirmenize yardımcı olalım.
Yazar Hakkında
Mert Batur Gurbuz, Techsy.io'nun Kurucu Ortağıdır; ekip burada B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR hatları geliştiriyor. University of Birmingham'da eğitim görüyor ve Techsy ekibinin üretimde gerçekten çalıştırdığı LLM araç yığını hakkında yazıyor.
Kurucu Ortak, Techsy.io, University of Birmingham · LinkedIn
Sıkça Sorulan Sorular
Claude Opus 5 nedir?
Claude Opus 5, Anthropic'in 24 Temmuz 2026'da claude-opus-5 model kimliğiyle yayınladığı sınır modelidir. Anthropic, onu Fable 5'in zekasına yarı fiyatına yakın olarak konumlandırıyor ve Frontier-Bench, GDPval-AA ve ARC-AGI-3 dahil yayınlanan benchmark'ların çoğunda önde. Claude API, Claude.ai, Claude Code ve Claude Cowork üzerinde kullanılabilir.
Claude Opus 5 ne zaman yayınlandı?
Claude Opus 5, 24 Temmuz 2026'da yayınlandı. Aynı gün Claude API, Claude.ai, Claude Code ve Claude Cowork genelinde kullanıma açıldı; kademeli dağıtım yok, dolayısıyla varsayılan modelinizi hemen claude-opus-5'e yönlendirebilirsiniz.
Claude Opus 5, Opus 4.8'den iyi mi?
Çoğu iş için evet. Opus 5, Frontier-Bench v0.1'de Opus 4.8'i ikiye katlıyor (%43,3'e karşı %21,1), GDPval-AA'da 268 Elo kazanıyor ve ARC-AGI-3'te %1,5'ten %30,2'ye sıçrıyor. Fiyatlandırma değişmedi, yani maliyet cezası yok. İstisnalar, GPT-5.6 Sol, Fable 5 veya Mythos 5'in hâlâ önde olduğu birkaç kodlama ve bilim testi.
Claude Opus 5 ne kadar?
Standart fiyatlandırma milyon giriş token'ı başına $5 ve milyon çıkış token'ı başına $25; Opus 4.8 ile birebir aynı. "Yarı fiyat" ifadesi Fable 5'e atıfta bulunuyor, 4.8'e değil: Opus 5, Opus tarifesiyle Fable 5'e yakın zeka sunuyor. Fast modu taban fiyatın yaklaşık 2 katına mal oluyor ve aynı modelde yaklaşık 2,5 kat daha hızlı çalışıyor.
Claude Opus 5, Fable 5'i geçiyor mu?
Her alanda değil. Opus 5; OSWorld 2.0, BrowseComp, GDPval-AA ve Frontier-Bench'te Fable 5'i geçiyor ve bunu Fable 5'in fiyatının çok altında yapıyor. Ama Fable 5 hâlâ FrontierCode ve hukuk benchmark'ında kıl payı önde; Mythos 5 (Anthropic'in bilim modeli) ise sağlık ve biyolojide lider. Mesaj "yarı fiyata Fable 5'e yakın", "her şeyde Fable 5'ten iyi" değil.
Opus 5 nerede kaybediyor?
GPT-5.6 Sol, DeepSWE v1.1'de ajantik kodlamayı kazanıyor (%72,7'ye karşı %68,8), Fable 5 FrontierCode v1.1'i 0,1 puanla ve held-out hukuk benchmark'ını kazanıyor (%13,3'e karşı %11,7) ve Mythos 5 HealthBench Professional ile biyoloji testlerinde önde. İş yükünüz bunlardan herhangi birine ağırlık veriyorsa, geçmeden önce benchmark yapın.
Claude Opus 5, AI ajanları geliştirmek için iyi mi?
Bunun için tasarlanmış. En büyük kazanımlar ajantik terminal kodlama (Frontier-Bench), bilgisayar kullanımı (OSWorld 2.0), ajantik arama (BrowseComp) ve çok adımlı iş akışlarında (AutomationBench); bunlar üretim ajanlarının çalıştırdığı iş yükleri. Güçlenen öz-doğrulaması ayrıca ayrı bir eleştirmen geçişine daha az token harcamanıza olanak tanıyor.
Claude Code ve API'de Opus 5'e nasıl geçerim?
Modelinizi claude-opus-5 olarak ayarlayın (Claude Code'da /model claude-opus-5 kullanın) ve çoğu ekip için işiniz biter. API'de model alanını claude-opus-5 olarak değiştirin; istek yapısı Opus 4.8'den değişmedi, dolayısıyla başka kod değişikliği gerekmez.
Claude Opus 5'te Fast modu nedir?
Fast modu, Opus 5'i varsayılan hızın yaklaşık 2,5 katında, standart fiyatın yaklaşık 2 katına çalıştıran daha yüksek hızlı bir katmandır. Sizi tam claude-opus-5 modelinde tutar, daha küçük bir modele yönlendirmez; bu da çıktıyı beklediğiniz interaktif oturumlar için faydalı, gecikmeye duyarsız toplu işler için ise gereksiz kılar.