
Claude Opus 5 Resmi Hadir: Kecerdasan Setara Fable 5 dengan Harga Separuhnya
Anthropic merilis Claude Opus 5 pada 24 Juli 2026, dan pesannya lugas: kecerdasan frontier yang mendekati Fable 5, dengan harga separuhnya. Bukti utamanya adalah Frontier-Bench v0.1, di mana Opus 5 mencetak skor 43,3% dan menggandakan lebih dari dua kali skor Opus 4.8 yang 21,1%. Masalahnya—dan selalu ada masalah—model ini tidak memenangkan semuanya. GPT-5.6 Sol masih mengunggulinya di satu uji pengodean agentik, dan di bidang kesehatan serta biologi mahkotanya jatuh ke Mythos 5. Inilah yang benar-benar berubah, tabel benchmark lengkapnya, dan apakah Anda perlu mengganti model default hari ini.
Poin-poin penting:
- Claude Opus 5 diluncurkan 24 Juli 2026 di Claude API, Claude.ai, Claude Code, dan Claude Cowork, dengan ID model
claude-opus-5. - Model ini memimpin sebagian besar benchmark yang dipublikasikan Anthropic (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), tetapi tertinggal di beberapa uji pengodean, hukum, dan sains.
- Harga tidak berubah dari Opus 4.8, yaitu $5/$25 per juta token, dengan mode Fast sekitar 2x harga untuk kecepatan sekitar 2,5x.
Yang Dirilis Hari Ini: Claude Opus 5 dalam Satu Menit
Claude Opus 5 adalah model frontier terbaru Anthropic, dirilis 24 Juli 2026, dan tersedia di hari yang sama melalui API, Claude.ai, Claude Code, dan Claude Cowork. ID modelnya adalah claude-opus-5. Kerangka yang Anthropic sampaikan, menurut pengumuman resminya, adalah model ini "mendekati kecerdasan frontier Claude Fable 5 dengan harga separuhnya." Harga standar tetap $5 input / $25 output per juta token, sama seperti Opus 4.8.
Ini adalah lompatan generasi nyata untuk kerja agentik, bukan sekadar rilis minor. Jika Anda beralih dari Claude Opus 4.8, bentuk API dan integrasi Claude Code tetap sama persis, jadi migrasinya cukup tukar ID model. Yang berbeda adalah batas atasnya: di Frontier-Bench v0.1, Anthropic menyatakan Opus 5 menggandakan lebih dari dua kali skor 4.8 dengan biaya per tugas yang lebih rendah, dan mencetak angka state-of-the-art di GDPval-AA dan ARC-AGI-3.
Posisi ini penting. Fable 5 adalah model frontier termahal Anthropic. Mendekati levelnya dengan harga Opus adalah inti cerita rilis ini, dan itulah mengapa kalimat "harga separuhnya" yang Anthropic tonjolkan.
Apa yang Benar-Benar Baru di Opus 5 vs 4.8?
Perubahan terbesar dari 4.8 ke 5 adalah penilaian: Opus 5 jauh lebih baik dalam memverifikasi pekerjaannya sendiri dan beriterasi sampai tugas benar-benar selesai, bukan sekadar terlihat selesai. Anthropic juga menyebutkan rekayasa perangkat lunak, pekerjaan pengetahuan, dan riset ilmiah yang lebih kuat, plus output visual yang lebih baik. Harga dan API inti tidak berubah.
Penilaian dan verifikasi diri yang lebih baik
Perubahan perilaku paling jelas adalah Opus 5 memeriksa dirinya sendiri. Anthropic mengutip Zimu Li, seorang technical staff member, yang menggambarkan model ini sebagai yang "memverifikasi cabang, memeriksa template" alih-alih langsung menerjang. Bagi siapa pun yang mengandalkan agen untuk menangkap kesalahannya sendiri di produksi, sifat inilah yang benar-benar mengubah keadaan. Ini juga hal yang paling sulit dijual lewat grafik benchmark, jadi perlakukan sebagai klaim yang perlu diuji di tugas Anda sendiri.
Kecerdasan frontier dengan biaya Opus
Sualeh Asif, co-founder Cursor, merangkum rilis ini sebagai "kecerdasan mendekati Fable 5 dengan kecepatan dan biaya Opus." Itulah pembacaan praktisnya: tim yang menginginkan penalaran kelas Fable 5 tapi tidak bisa membenarkan harganya kini punya opsi tengah. Di OSWorld 2.0, Anthropic menyatakan Opus 5 melampaui Fable 5 dengan biaya sekitar sepertiganya, yang merupakan contoh paling bersih dari argumen nilainya.
Postur keselarasan dan keamanan
Anthropic melaporkan Opus 5 memiliki skor perilaku tidak selaras terendah sejauh ini (2,3) dan menyebutnya model yang paling selaras dengan Konstitusinya. Di sisi keamanan, classifier keamanan siber digambarkan sekitar 85% kurang restriktif dibanding milik Fable 5, dengan Cyber Verification Program untuk enterprise bagi tim yang membutuhkannya. Seperti klaim keamanan vendor mana pun, berguna untuk diketahui, tapi tetap layak divalidasi terhadap kasus red-team Anda sendiri.
Benchmark Opus 5: Di Mana Menang (dan Di Mana Kalah)
Opus 5 memimpin sebagian besar benchmark yang dipublikasikan Anthropic, dan kemenangan yang penting bagi pembangun agen sangat timpang: Frontier-Bench v0.1 (43,3%), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2%), OSWorld 2.0 (70,6%), dan AutomationBench milik Zapier (26,0%). Pengecualian jujurnya: GPT-5.6 Sol memenangkan DeepSWE v1.1, Fable 5 unggul tipis di uji FrontierCode dan hukum, dan Mythos 5 mengambil kesehatan dan biologi.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Pengodean terminal agentik, Frontier-Bench v0.1 | 43,3% | 33,7% | 21,1% | 34,4% |
| Pekerjaan pengetahuan, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Pemecahan masalah baru, ARC-AGI-3 | 30,2% | — | 1,5% | 7,8% |
| Pencarian agentik, BrowseComp | 90,8% | 87,4% | 84,3% | 90,4% |
| Penalaran multidisiplin, Humanity's Last Exam (dengan alat) | 64,7% | 63,9% | 57,9% | — |
| Penggunaan komputer agentik, OSWorld 2.0 | 70,6% | 66,1% | 55,7% | 62,6% |
| Pengodean agentik, DeepSWE v1.1 | 68,8% | 69,7% | 59,0% | 72,7% |
| Pengodean agentik, FrontierCode v1.1 (Main) | 53,4% | 53,5% | 46,5% | 47,5% |
| Alur kerja bisnis, AutomationBench | 26,0% | 17,4% | 17,0% | 18,1% |
| Legal Agent Benchmark (held-out) | 11,7% | 13,3% | 10,4% | 2,5% |
| Kesehatan, HealthBench Professional | 59,8% | 66,0% | 57,4% | 60,5% |
| Biologi, BioMysteryBench (sulit) | 49,4% | 46,5% | 42,4% | — |

Baca deltanya, bukan hanya skor absolutnya. Frontier-Bench melonjak +22,2 poin dibanding Opus 4.8 (21,1 ke 43,3), lompatan tunggal terbesar dan alasan Anthropic menyebut ini rilis pengodean-dan-agen. GDPval-AA naik +268 Elo (1593 ke 1861), melampaui semua model di tabel untuk pekerjaan pengetahuan. ARC-AGI-3 yang paling mencolok: 30,2% versus 7,8% untuk GPT-5.6 Sol dan 1,5% untuk Opus 4.8, yang Anthropic bingkai sebagai sekitar 3x model publik terbaik berikutnya dalam pemecahan masalah baru. Di AutomationBench, 26,0% sekitar 1,5x dari lapangan, sinyal langsung bagi siapa pun yang membangun agen proses bisnis.
Dua catatan jujur soal kekalahan. Pertama, pemimpin di kolom Fable 5 untuk kesehatan (66,0%) dan pembagian biologi yang dipecahkan manusia sebenarnya adalah Mythos 5, model khusus sains Anthropic, bukan Fable 5, jadi itu bukan kemenangan model umum yang sebanding. Kedua, gambaran pengodean benar-benar terbelah: GPT-5.6 Sol mengambil DeepSWE v1.1 (72,7% vs 68,8%), dan Fable 5 memenangkan FrontierCode dengan selisih tipis (53,5% vs 53,4%). Jika pekerjaan Anda murni pengodean gaya SWE-bench, label "terbaik secara keseluruhan" tidak otomatis memilih Opus 5.
Berapa Harga Opus 5? Harga dan Mode Fast
Harga standar Opus 5 adalah $5 per juta token input dan $25 per juta token output, identik dengan Opus 4.8 menurut harga yang dipublikasikan Anthropic, jadi tidak ada kenaikan harga untuk peningkatan ini. Klaim "harga separuhnya" relatif terhadap Fable 5, bukan terhadap 4.8: Anda mendapat kecerdasan mendekati Fable 5 tanpa membayar tarif Fable 5. Mode Fast berjalan sekitar 2x harga dasar untuk kecepatan sekitar 2,5x dari default, dan API mendukung fallback routing.
Jadi apa artinya per tugas? Dengan harga standar Anda tidak membayar tambahan dibanding 4.8 dan mendapat lompatan kapabilitas besar, yang membuat peningkatan ini hampir gratis untuk sebagian besar beban kerja. Mode Fast adalah tuas sesi interaktif: Anda menukar premi harga 2x untuk output yang streaming sekitar 2,5x lebih cepat di model yang sama, yang menguntungkan saat Anda duduk menunggu dan merugikan saat menjalankan batch semalaman di mana waktu nyata tidak relevan. Jika rate limit adalah kendala nyata Anda, panduan kami tentang batas penggunaan Claude membahas bagaimana tier berinteraksi dengan biaya.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Di Mana Opus 5 Mendarat untuk Agen Produksi
Keuntungannya berkumpul persis di tempat agen produksi hidup: pengodean terminal (Frontier-Bench), penggunaan komputer (OSWorld 2.0), pencarian agentik (BrowseComp), dan alur kerja bisnis multi-langkah (AutomationBench). Keempatnya adalah beban kerja yang paling sering rusak di deployment nyata, jadi model yang melonjak di keempatnya sekaligus mengubah apa yang bisa dikirim.
Itulah bagian yang perlu direnungkan. Benchmark seperti AutomationBench mengukur apakah agen bisa menyelesaikan alur kerja multi-tool nyata dari awal sampai akhir, dan 26,0% Opus 5 versus sekitar 17% untuk lapangan adalah perbedaan antara "bagus di demo" dan "bertahan menghadapi CRM yang berantakan." Hasil OSWorld 2.0 (70,6%, mengalahkan Fable 5 dengan sepertiga biaya) mengatakan hal yang sama untuk agen penggunaan komputer yang mengklik perangkat lunak sungguhan. Bagi tim yang mengirim agen AI面向 pelanggan, angka-angka itu yang berarti lebih sedikit kegagalan jam 2 pagi.
Ini juga menurunkan biaya pola desain yang sering kami andalkan: verifikasi diri murah. Ketika model benar-benar lebih baik memeriksa cabangnya sendiri, Anda bisa menghabiskan lebih sedikit token untuk langkah kritik terpisah dan tetap menangkap kesalahan yang sama. Itu pos anggaran nyata bagi siapa pun yang menjalankan agen dalam volume besar.
Bagaimana Kami Memasukkan Opus 5 ke Stack Kami
Kami membangun dan menjalankan agen AI produksi di stack Claude di Techsy, jadi rilis frontier adalah evaluasi hari yang sama, bukan berita yang kami baca lalu lewatkan. Berikut pembacaan pertama jujur kami, kualitatif di mana kami belum punya angka sebelum/sesudah yang bersih, spesifik di mana kami punya.
Pertukaran itu sendiri sepele, dan memang itu intinya. Pipeline konten dan otomasi kami menetapkan model default di config; mengubah claude-opus-4-8 menjadi claude-opus-5 dan memulai ulang sesi tidak memerlukan perubahan lain, sama seperti setiap kenaikan Opus terbaru. Jika Anda merutekan lintas penyedia dan ingin A/B Opus 5 melawan Fable 5 atau GPT-5.6 Sol di tugas Anda sendiri, proxy memungkinkan Anda mengganti model tanpa menulis ulang aplikasi.
Yang pertama kami pantau adalah klaim verifikasi diri, karena itu yang benar-benar akan mengubah arsitektur kami. Agen kami saat ini menjalankan langkah kritik eksplisit untuk menangkap edit buruk sebelum masuk; jika Opus 5 secara andal menandai cabang lemahnya sendiri, kami bisa menipiskan langkah itu dan menghemat token. Kami tidak mempublikasikan angka untuk itu sampai kami menjalankannya di seluruh set tugas yang bisa diulang, disiplin yang sama yang kami harapkan dari siapa pun yang mengutip metrik agen. Jika Anda ingin metodenya, itu yang ada di panduan kami untuk mengevaluasi agen AI di produksi: prompt sama, status repo sama, hitung belokan salah, bukan suasana.
Haruskah Anda Beralih dari Opus 4.8? (Ganti / Tunggu / Tetap)
Apakah perlu pindah tergantung beban kerja Anda, bukan model mana yang "menang" secara keseluruhan. Lompatan agentik dan pekerjaan pengetahuan besar dan nyata, jadi sebagian besar tim harus beralih. Toko pengodean murni dengan pipeline GPT atau Fable punya alasan untuk menguji sebelum berkomitmen, dan pengguna mendekati batas atas di tugas murah bisa tetap dengan hampir tidak ada yang hilang.
Ganti sekarang jika: pekerjaan Anda bergantung pada tugas agentik, penggunaan komputer, otomasi proses bisnis, atau pekerjaan pengetahuan. Frontier-Bench (+22,2 dari 4.8), AutomationBench (~1,5x lapangan), dan GDPval-AA (+268 Elo) adalah keuntungan nyata terbesar, dan harga tidak berubah, jadi tidak ada penalti biaya untuk meningkatkan.
Tunggu jika: alur kerja Anda murni pengodean agentik dan Anda sudah menggunakan GPT-5.6 Sol atau Fable 5 untuk itu. GPT-5.6 Sol masih memimpin DeepSWE v1.1 dan Fable 5 unggul tipis di FrontierCode, jadi jalankan evaluasi pengodean sendiri sebelum mengganti. Tunggu juga jika Anda di tengah proyek dan pertukaran model akan mengaburkan evaluasi yang sedang berjalan.
Tetap di 4.8 jika: Anda sensitif biaya di tugas yang sudah mendekati batas atas untuk Anda dan Anda tidak menyentuh beban kerja agentik di mana Opus 5 unggul. Anda akan membayar biaya perpindahan untuk delta yang tidak akan terasa. Untuk lapangan yang lebih luas, lihat bagaimana model-model ini bertumpuk di rincian Claude Sonnet 5 dan ikhtisar Fable 5 dan Mythos 5.
Kami memilih dan memasang model seperti ini untuk pembangunan agen klien setiap minggu. Jika Anda sedang memutuskan model mana yang akan distandarkan untuk agen produksi, dapatkan konsultasi gratis dan kami akan membantu mencocokkan model dengan beban kerja, bukan dengan pemasaran.
Tentang Penulis
Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirim agen AI, sistem otomasi, dan pipeline suara/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang stack perkakas LLM yang tim Techsy jalankan di produksi.
Co-Founder, Techsy.io, University of Birmingham · LinkedIn
Pertanyaan yang Sering Diajukan
Apa itu Claude Opus 5?
Claude Opus 5 adalah model frontier Anthropic, dirilis 24 Juli 2026, dengan ID model claude-opus-5. Anthropic memposisikannya sebagai yang mendekati kecerdasan Fable 5 dengan harga separuhnya, dan memimpin sebagian besar benchmark yang dipublikasikan, termasuk Frontier-Bench, GDPval-AA, dan ARC-AGI-3. Tersedia di Claude API, Claude.ai, Claude Code, dan Claude Cowork.
Kapan Claude Opus 5 dirilis?
Claude Opus 5 dirilis pada 24 Juli 2026. Model ini langsung aktif di hari yang sama di seluruh Claude API, Claude.ai, Claude Code, dan Claude Cowork, tanpa peluncuran bertahap, jadi Anda bisa langsung mengganti model default ke claude-opus-5.
Apakah Claude Opus 5 lebih baik dari Opus 4.8?
Untuk sebagian besar pekerjaan, ya. Opus 5 menggandakan lebih dari dua kali Opus 4.8 di Frontier-Bench v0.1 (43,3% vs 21,1%), naik 268 Elo di GDPval-AA, dan melompat dari 1,5% ke 30,2% di ARC-AGI-3. Harga tidak berubah, jadi tidak ada penalti biaya. Pengecualiannya adalah beberapa uji pengodean dan sains di mana GPT-5.6 Sol, Fable 5, atau Mythos 5 masih memimpin.
Berapa harga Claude Opus 5?
Harga standar adalah $5 per juta token input dan $25 per juta token output, identik dengan Opus 4.8. Kalimat "harga separuhnya" merujuk ke Fable 5, bukan 4.8: Opus 5 memberikan kecerdasan mendekati Fable 5 dengan tarif Opus. Mode Fast berharga sekitar 2x harga dasar dan berjalan sekitar 2,5x lebih cepat di model yang sama.
Apakah Claude Opus 5 mengalahkan Fable 5?
Tidak di semua bidang. Opus 5 melampaui Fable 5 di OSWorld 2.0, BrowseComp, GDPval-AA, dan Frontier-Bench, dan melakukannya dengan sebagian kecil harga Fable 5. Tapi Fable 5 masih unggul tipis di FrontierCode dan benchmark hukum, dan Mythos 5 (model sains Anthropic) memimpin kesehatan dan biologi. Pesannya adalah "mendekati Fable 5 dengan harga separuhnya," bukan "lebih baik dari Fable 5 di segala hal."
Di mana Opus 5 kalah?
GPT-5.6 Sol memenangkan pengodean agentik di DeepSWE v1.1 (72,7% vs 68,8%), Fable 5 memenangkan FrontierCode v1.1 dengan selisih 0,1 poin dan benchmark hukum held-out (13,3% vs 11,7%), dan Mythos 5 memimpin HealthBench Professional dan uji biologi. Jika beban kerja Anda didominasi salah satunya, benchmark dulu sebelum beralih.
Apakah Claude Opus 5 bagus untuk membangun agen AI?
Model ini memang dibangun untuk itu. Keuntungan terbesar mendarat di pengodean terminal agentik (Frontier-Bench), penggunaan komputer (OSWorld 2.0), pencarian agentik (BrowseComp), dan alur kerja bisnis multi-langkah (AutomationBench), yang merupakan beban kerja agen produksi. Verifikasi dirinya yang lebih kuat juga memungkinkan Anda menghabiskan lebih sedikit token untuk langkah kritik terpisah.
Bagaimana cara beralih ke Opus 5 di Claude Code dan API?
Atur model Anda ke claude-opus-5 (gunakan /model claude-opus-5 di Claude Code) dan selesai untuk sebagian besar tim. Di API, ubah field model menjadi claude-opus-5; bentuk permintaan tidak berubah dari Opus 4.8, jadi tidak perlu perubahan kode lain.
Apa itu mode Fast di Claude Opus 5?
Mode Fast adalah tier kecepatan lebih tinggi yang menjalankan Opus 5 sekitar 2,5x kecepatan default dengan harga sekitar 2x harga standar. Mode ini tetap menggunakan model claude-opus-5 penuh alih-alih merutekan Anda ke model yang lebih kecil, yang membuatnya berguna untuk sesi interaktif di mana Anda menunggu output dan tidak layak untuk pekerjaan batch yang tidak sensitif latensi.