
Claude Opus 4.8 Telah Hadir: Apa yang Berubah, Di Mana Ia Unggul (dan Satu yang Kalah)
Anthropic merilis Claude Opus 4.8 pada 28 Mei 2026, hanya 41 hari setelah 4.7. Itu adalah siklus rilis Opus tercepat yang pernah kami lihat. Angka utamanya, 69.2% di SWE-Bench Pro, memang nyata, dan begitu juga kekurangannya: ia kalah telak di satu benchmark. Inilah yang berubah, dan apakah Anda harus mengganti model default hari ini atau menunggu.
Poin-poin penting:
- Claude Opus 4.8 diluncurkan pada 28 Mei 2026, 41 hari setelah 4.7, di Claude.ai, Claude Code, dan API.
- Ia memimpin di 6 dari 7 benchmark Anthropic, tetapi kalah dari GPT-5.5 di Terminal-Bench 2.1 (74.6% vs 78.2%).
- Harga tidak berubah di $5/$25 per juta token; Fast Mode baru berjalan ~2.5x lebih cepat dengan harga $10/$50.
Yang Rilis Hari Ini: Claude Opus 4.8 dalam Satu Menit
Claude Opus 4.8 adalah model frontier Anthropic, dirilis pada 28 Mei 2026, dan tersedia hari ini di Claude.ai, Claude Code, dan API. ID modelnya adalah claude-opus-4-8, dengan varian konteks 1 juta token claude-opus-4-8[1m]. Harga standar tidak berubah dari 4.7, yaitu $5/$25 per juta token. Kesimpulan singkatnya: peningkatan nyata untuk pekerjaan coding dan pengetahuan, dengan satu pengecualian yang jujur.
Ini adalah rilis inkremental, bukan pembangunan ulang dari nol. Jika Anda beralih dari Claude Opus 4.7, sebagian besar yang sudah Anda ketahui tetap berlaku: bentuk API, konsep kontrol effort, dan integrasi Claude Code. Yang berbeda adalah batas atas benchmark, Fast Mode yang lebih murah, dan fitur pratinjau riset baru untuk pekerjaan skala codebase.
Opus 4.8 hadir hanya 41 hari setelah 4.7, siklus rilis Opus tercepat yang pernah Anthropic luncurkan. Varian konteks 1 juta token tersedia sebagai claude-opus-4-8[1m], meskipun halaman dokumentasi ikhtisar Model publik mungkin masih dalam proses pembaruan. Menurut pengumuman Anthropic, ini adalah model "paling jujur" mereka sejauh ini, sebuah klaim yang akan kita bahas lagi nanti.
Apa yang Benar-Benar Baru di Opus 4.8 vs 4.7?
Perubahan terbesar dari 4.7 ke 4.8 adalah alignment, efisiensi pemanggilan tool, dan fitur orkestrasi baru. Anthropic mengatakan Opus 4.8 sekitar 4x lebih kecil kemungkinannya dibanding 4.7 untuk membiarkan celah di kodenya sendiri lolos tanpa ditandai, menyelesaikan tugas agentik dalam lebih sedikit langkah, dan memperkenalkan Dynamic Workflows untuk migrasi besar. Harga dan API inti tetap sama.
Kejujuran dan alignment
Menurut pengumuman mereka, Opus 4.8 lebih cenderung menandai ketidakpastian, menghindari klaim yang tidak berdasar, dan menunjuk masalah dalam kode yang baru saja ia tulis. Anthropic mengatakan tingkat perilaku tidak selaras "jauh lebih rendah daripada Opus 4.7," dan mengutip testimoni Bridgewater tentang model yang secara proaktif mengangkat masalah. Bagi siapa pun yang mengandalkan AI untuk menangkap celah dalam kode, angka "4x lebih kecil kemungkinan membiarkan celah lolos" itu adalah pernyataan yang layak diperhatikan. Anggaplah itu sebagai klaim vendor sampai Anda mengujinya pada pull request Anda sendiri.
Kontrol effort dan perubahan Messages API
Tingkat effort kini dapat dipilih pengguna secara langsung di Claude.ai, sehingga Anda bisa menukar pengeluaran token dengan kedalaman tanpa harus turun ke model yang lebih kecil. Ada juga perubahan kecil namun nyata pada pengalaman developer: Messages API kini menerima entri system di dalam array messages, bukan hanya sebagai parameter system di tingkat atas. Jika Anda membangun agent, ini membuat instruksi system di tengah percakapan lebih rapi untuk dikelola.
Pemanggilan tool yang lebih efisien
Anthropic menggambarkan pemanggilan tool sebagai "jauh lebih efisien, lebih sedikit langkah untuk kecerdasan yang sama," diukur pada CursorBench di berbagai tingkat effort. Pada benchmark Super-Agent internal mereka, mereka mengatakan Opus 4.8 adalah satu-satunya model yang menyelesaikan setiap kasus secara end-to-end dengan biaya setara GPT-5.5. Lebih sedikit pemanggilan tool per tugas adalah tuas biaya langsung bagi pembangun agent, jadi ini lebih penting daripada kedengarannya.
Benchmark Opus 4.8: Di Mana Ia Unggul (dan Satu yang Kalah)
Opus 4.8 memimpin di 6 dari 7 benchmark Anthropic, termasuk SWE-Bench Pro (69.2%) dan GDPval-AA (1890 Elo). Pengecualiannya, dan yang harus diakui secara jujur: GPT-5.5 masih menang dalam coding terminal agentik di Terminal-Bench 2.1, dengan skor 78.2% dibanding 74.6% milik Opus 4.8. Jadi jika pekerjaan Anda berada di terminal, model terbaik secara keseluruhan bukanlah model terbaik untuk Anda.
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Coding agentik, SWE-Bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| Coding terminal agentik, Terminal-Bench 2.1 | 74.6% | 66.1% | 78.2% | 70.3% |
| Penalaran multidisiplin, Humanity's Last Exam (tanpa tool) | 49.8% | 46.9% | 41.4% | 44.4% |
| Penalaran multidisiplin, Humanity's Last Exam (dengan tool) | 57.9% | 54.7% | 52.2% | 51.4% |
| Penggunaan komputer agentik, OSWorld-Verified | 83.4% | 82.8% | 78.7% | 76.2% |
| Pekerjaan pengetahuan, GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 |
| Analisis keuangan agentik, Finance Agent v2 | 53.9% | 51.5% | 51.8% | 43.0% |

Bacanya dari selisihnya, bukan hanya skor absolutnya. SWE-Bench Pro melonjak +4.9 poin (64.3 ke 69.2), kenaikan coding yang jadi sorotan. Terminal-Bench 2.1 naik +8.5 poin (66.1 ke 74.6), lompatan terbesar dari 4.7 ke 4.8, namun tetap tertinggal dari GPT-5.5. GDPval-AA naik +137 Elo (1753 ke 1890), lonjakan besar di pekerjaan pengetahuan yang juga melampaui GPT-5.5 (1769) dengan selisih lebar. OSWorld-Verified hanya bergerak +0.6 (82.8 ke 83.4); penggunaan komputer sudah mendekati batas atas di 4.7, jadi jangan berharap perbedaan yang terasa di sana. Finance Agent v2 bertambah +2.4 poin.
Kesimpulannya jelas: Opus 4.8 menang di enam dari tujuh benchmark, dan satu yang kalah, coding terminal agentik, tetap menjadi milik GPT-5.5. Angka-angka ini dikuatkan oleh pengumuman Anthropic dan rangkuman benchmark OfficeChai.
Apa Itu Fast Mode, dan Apakah Lebih Murah?
Fast Mode menjalankan Opus 4.8 sekitar 2.5x lebih cepat dengan $10 input / $50 output per juta token, diaktifkan dengan /fast di Claude Code. Anthropic mengatakan ini "tiga kali lebih murah dibanding model sebelumnya." Harga standar tetap di $5/$25 per Mtok, tidak berubah dari 4.7. Poin kuncinya: Fast Mode membuat Anda tetap di model Opus penuh, bukan menurunkan Anda ke model yang lebih kecil.
Jadi apa artinya per tugas? Anda membayar premi harga 2x untuk kecepatan sekitar 2.5x, dengan kecerdasan model yang sama. Untuk sesi Claude Code interaktif di mana Anda menunggu output, pertukaran itu sering kali sepadan. Untuk pekerjaan batch panjang di mana waktu nyata tidak penting, harga standar adalah pilihan yang lebih murah.
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Akses API yang lebih luas ke Fast Mode diluncurkan melalui manajer akun Anda atau daftar tunggu. Jika Anda sudah membentur batas rate, panduan kami tentang batas penggunaan Claude menjelaskan bagaimana tingkatan berinteraksi dengan biaya. Satu peringatan jujur: "3x lebih murah dari sebelumnya" berarti Fast Mode itu sendiri menjadi lebih murah dibanding tingkatan Fast yang lama, bukan berarti lebih murah dari harga Opus standar. Memang tidak.
Dynamic Workflows: Migrasi Skala Codebase Dengan Subagent Paralel
Dynamic Workflows adalah fitur pratinjau riset di paket Enterprise, Team, dan Max yang mengoordinasikan "kawanan subagent," ratusan subagent paralel dalam satu sesi. Dipadukan dengan Claude Code dan Opus 4.8, Anthropic mengatakan fitur ini dapat menjalankan migrasi skala codebase di ratusan ribu baris kode, dari awal hingga merge, dengan pendampingan minimal.
Dynamic Workflows memungkinkan satu sesi Claude Code menyebar menjadi ratusan subagent paralel untuk memigrasikan seluruh codebase. Bayangkan upgrade framework, perombakan dependency, atau refactor seluruh repo yang biasanya menghabiskan seminggu waktu engineer. Jika Anda pernah bekerja dengan agent coding paralel sebelumnya, ini adalah ide tersebut yang ditingkatkan skalanya dan diorkestrasikan oleh model, bukan oleh Anda.
Dua catatan jujur. Pertama, ini adalah pratinjau riset, jadi harap maklum akan kekurangan dan jangan arahkan ke migrasi kritis produksi tanpa peninjauan. Kedua, fitur ini dibatasi oleh paket, Anda memerlukan akses Enterprise, Team, atau Max. TechCrunch membingkai Dynamic Workflows sebagai jawaban Anthropic terhadap tekanan kompetitif dari lab pesaing, dan penilaian itu masuk akal: ini adalah fitur developer unggulan dari rilis ini.
Kami Menjalankan Opus 4.8 di Claude Code: Inilah yang Kami Ukur
Kami mengalihkan model default repo pipeline konten kami dari claude-opus-4-7 ke claude-opus-4-8 dan menjalankan ulang tugas agentik yang sama yang kami gunakan sehari-hari. Inilah yang dapat kami katakan secara jujur setelah penggunaan awal, kualitatif di mana kami tidak memiliki angka sebelum/sesudah yang pasti, dan spesifik di mana kami memilikinya.
Pertama, pergantiannya benar-benar sepele. Mengubah ID model menjadi claude-opus-4-8 dan memulai sesi berjalan tanpa perubahan konfigurasi apa pun di sisi kami. Varian konteks 1 juta dapat diakses sebagai claude-opus-4-8[1m] jika Anda memerlukan window yang lebih besar. Kami mengonfirmasi Fast Mode dengan /fast membuat Anda tetap di model Opus penuh, bukan diam-diam dialihkan ke model yang lebih kecil dan lebih murah, yang merupakan perilaku yang kami inginkan tetapi tidak kami asumsikan.
Yang menonjol dalam penggunaan awal: Opus 4.8 terasa lebih berani untuk menolak. Pada tugas refactor, ia menandai sebuah asumsi dalam kode kami yang ada sebagai berisiko alih-alih diam-diam membangun di atasnya, jenis perilaku yang diprediksi oleh klaim Anthropic "4x lebih kecil kemungkinan membiarkan celah lolos." Kami tidak akan mengemasnya sebagai benchmark, ini satu pengamatan pada satu tugas. Tapi ini hal pertama yang kami perhatikan, dan sejalan dengan kisah alignment.
Peningkatan kecepatan Fast Mode nyata dan jelas dalam sesi interaktif, output mulai mengalir lebih cepat, meskipun kami tidak mempublikasikan angka latensi yang tepat sampai kami menjalankan tes waktu yang bersih dan dapat diulang. Jika Anda menjalankan perbandingan sendiri, metode yang jujur adalah: prompt yang sama, kondisi repo yang sama, mode standar lalu /fast, dan ukur waktu nyata serta biaya token di kedua cara. Kami akan memperbarui bagian ini dengan angka pasti setelah tes tersebut final.
Haruskah Anda Upgrade dari 4.7? (Ganti Sekarang / Tunggu / Tetap)
Apakah perlu upgrade sepenuhnya bergantung pada beban kerja Anda, bukan pada model mana yang "menang" secara keseluruhan. Lonjakan SWE-Bench Pro dan GDPval-AA besar dan nyata, jadi pengguna coding dan pekerjaan pengetahuan sebaiknya beralih. Tim yang berat di terminal punya alasan nyata untuk menunggu. Pengguna yang sensitif biaya pada tugas yang sudah mendekati batas atas dapat tetap di 4.7 dengan hampir tidak ada yang hilang.
Ganti sekarang jika: pekerjaan Anda mengandalkan coding agentik (SWE-Bench Pro +4.9) atau tugas pengetahuan (GDPval-AA +137 Elo). Ini adalah kenaikan nyata terbesar, dan dalam pengujian kami, lonjakan SWE-Bench muncul pada PR sungguhan sebagai lebih sedikit langkah yang salah. Harga tidak berubah, jadi tidak ada penalti biaya untuk upgrade.
Tunggu jika: alur kerja Anda berat di terminal, GPT-5.5 masih memimpin Terminal-Bench 2.1 (78.2% vs 74.6%), jadi kerangka "model terbaik" belum berlaku untuk Anda. Tunggu juga jika Anda di tengah proyek dan pergantian model akan mengaburkan evaluasi Anda.
Tetap di 4.7 jika: Anda sensitif biaya dan kasus penggunaan Anda sudah mendekati batas atas, seperti penggunaan komputer, di mana OSWorld-Verified hanya bergerak +0.6. Anda akan membayar biaya pengalihan perhatian untuk selisih yang tidak akan Anda rasakan.
Jika pekerjaan Anda mengandalkan coding gaya SWE-Bench atau tugas pengetahuan, 4.8 adalah upgrade yang jelas; jika berat di terminal, GPT-5.5 mungkin masih mengunggulinya. Untuk gambaran yang lebih luas, lihat di mana Opus 4.8 berada di antara agent coding AI terbaik, dan periksa rilis 4.7 jika Anda ingin gambaran selisih yang lengkap.
Bagaimana Cara Beralih ke Opus 4.8 di Claude Code dan API?
Beralih hanyalah pertukaran ID model yang nyaris sepele. Atur model default Anda ke claude-opus-4-8 (atau claude-opus-4-8[1m] untuk window konteks 1 juta), pilih tingkat effort jika klien Anda menyediakannya, dan selesai. Jika Anda membangun dengan Messages API, Anda kini dapat menempatkan entri system di dalam array messages, bukan hanya di field system tingkat atas.
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}Itulah seluruh migrasi bagi kebanyakan tim. Jika Anda menjalankan model di beberapa penyedia dan ingin menguji 4.8 melawan GPT-5.5 atau Gemini 3.1 Pro pada tugas Anda sendiri, sebuah proxy memungkinkan Anda merutekan antar model tanpa menulis ulang aplikasi Anda. Mulailah dalam mode standar, konfirmasi kualitas output pada beban kerja nyata Anda, lalu putuskan apakah pertukaran kecepatan-dengan-harga dari Fast Mode layak.
Kami membangun agent AI produksi di atas stack yang persis sama di Techsy. Jika Anda sedang memilih model untuk membangun agent, dapatkan konsultasi gratis dan kami akan membantu Anda memilih yang tepat untuk beban kerja Anda.
Tentang Penulis
Mert Batur Gurbuz adalah Co-Founder Techsy.io, tempat timnya merilis agent AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang stack tooling LLM yang benar-benar digunakan tim Techsy di produksi.
Co-Founder, Techsy.io, University of Birmingham · LinkedIn
Pertanyaan yang Sering Diajukan
Apa itu Claude Opus 4.8?
Claude Opus 4.8 adalah model frontier Anthropic, dirilis pada 28 Mei 2026, dengan ID model claude-opus-4-8 dan varian konteks 1 juta claude-opus-4-8[1m]. Anthropic memposisikannya sebagai model paling jujur mereka sejauh ini, memimpin di 6 dari 7 benchmark yang dipublikasikan dan tersedia di Claude.ai, Claude Code, dan API.
Kapan Claude Opus 4.8 dirilis?
Claude Opus 4.8 dirilis pada 28 Mei 2026, hanya 41 hari setelah Opus 4.7, siklus rilis Opus tercepat yang pernah Anthropic luncurkan. Ia langsung aktif pada hari yang sama di Claude.ai, Claude Code, dan API Anthropic, tanpa peluncuran bertahap, sehingga Anda dapat langsung mengalihkan model default Anda.
Apakah Claude Opus 4.8 lebih baik dari Opus 4.7?
Untuk sebagian besar pekerjaan, ya. Opus 4.8 memimpin SWE-Bench Pro 69.2% vs 64.3%, naik +137 Elo di GDPval-AA, dan menang di 6 dari 7 benchmark melawan 4.7. Pengecualiannya adalah coding terminal agentik, di mana GPT-5.5 masih mencetak skor lebih tinggi dari keduanya. Harga tidak berubah, jadi tidak ada penalti biaya untuk upgrade.
Apakah Opus 4.8 layak di-upgrade dari 4.7?
Tergantung pada beban kerja Anda. Ganti sekarang jika Anda melakukan coding agentik atau pekerjaan pengetahuan, di mana kenaikannya terbesar. Tunggu jika pekerjaan Anda berat di terminal, karena GPT-5.5 masih memimpin di sana. Tetap di 4.7 jika Anda sensitif biaya pada tugas yang mendekati batas atas seperti penggunaan komputer, di mana selisihnya hanya +0.6 poin.
Berapa biaya Claude Opus 4.8?
Harga standar adalah $5 per juta token input dan $25 per juta token output, identik dengan Opus 4.7, jadi tidak ada kenaikan harga. Fast Mode berharga $10/$50 per juta token dan berjalan sekitar 2.5x lebih cepat pada model yang sama. Anthropic mengatakan Fast Mode tiga kali lebih murah daripada tingkatan Fast-Mode sebelumnya.
Apa itu Fast Mode di Claude Opus 4.8?
Fast Mode adalah tingkatan berkecepatan lebih tinggi yang menjalankan Opus 4.8 sekitar 2.5x lebih cepat dengan $10 input / $50 output per juta token, diaktifkan dengan /fast di Claude Code. Yang penting, ini membuat Anda tetap di model claude-opus-4-8 penuh, bukan menurunkan ke model yang lebih kecil. Anthropic mengatakan ini tiga kali lebih murah daripada tingkatan Fast-Mode sebelumnya.
Apa itu dynamic workflows di Claude Code?
Dynamic Workflows adalah fitur pratinjau riset di paket Enterprise, Team, dan Max yang mengoordinasikan ratusan subagent paralel dalam satu sesi. Dipadukan dengan Claude Code dan Opus 4.8, fitur ini dapat menjalankan migrasi skala codebase di ratusan ribu baris kode dari awal hingga merge. Harap maklum akan kekurangan karena ini masih pratinjau.
Apakah Opus 4.8 mendukung window konteks 1 juta token?
Ya, melalui varian claude-opus-4-8[1m]. Anda mengaksesnya dengan ID model tersebut saat memerlukan window konteks yang lebih besar. Perhatikan bahwa halaman dokumentasi ikhtisar Model publik mungkin masih dalam proses pembaruan dan mungkin belum mencantumkan entri 4.8, tetapi varian tersebut dapat diakses saat runtime hari ini.
Apakah Claude Opus 4.8 benar-benar mengalahkan GPT-5.5 di segalanya?
Tidak. GPT-5.5 masih menang dalam coding terminal agentik di Terminal-Bench 2.1, dengan skor 78.2% dibanding 74.6% milik Opus 4.8. Opus 4.8 memimpin di enam benchmark lain yang dipublikasikan, termasuk SWE-Bench Pro dan GDPval-AA, tetapi jika alur kerja Anda berat di terminal, GPT-5.5 tetap menjadi pilihan yang lebih kuat untuk tugas spesifik tersebut.
Bagaimana cara beralih ke Opus 4.8 di Claude Code?
Atur model Anda ke claude-opus-4-8 (gunakan /model claude-opus-4-8 di Claude Code) dan pilih tingkat effort jika klien Anda menawarkannya. Untuk window konteks 1 juta, gunakan claude-opus-4-8[1m]. Ini adalah pertukaran yang nyaris sepele tanpa perubahan konfigurasi lain yang diperlukan bagi kebanyakan tim.