
Claude Opus 4.7: 87,6% di SWE-bench, Apakah Upgrade-nya Sepadan?
Claude Opus 4.7 dirilis pada 16 April 2026 dengan SWE-bench Verified di 87,6%, SWE-bench Pro di 64,3%, dan harga tidak berubah di $5 input / $25 output per juta token. Tiga hal yang akan mengubah minggu Anda: xhigh adalah level effort default baru di Claude Code, /ultrareview adalah slash command code review multi-tahap yang benar-benar baru, dan Mythos Preview, model saudara yang diumumkan 7 April — adalah alasan Opus 4.7 menjadi Claude pertama yang dirilis dengan safety layer post-Mythos baru milik Anthropic. Berikut rekap lengkapnya, angka-angkanya, dan checklist migrasinya.
Ringkasan Cepat, Apa yang Rilis Hari Ini
- Rilis: Tersedia secara umum 16 April 2026 (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
- Harga: Tidak berubah, $5 per juta token input, $25 per juta token output
- SWE-bench Pro: 64,3% (sebelumnya 53,4% di Opus 4.6), mengalahkan GPT-5.4 Pro (57,7%) dan Gemini 3.1 Pro (54,2%)
- SWE-bench Verified: 87,6% (sebelumnya 80,8%)
- CursorBench: 70% (sebelumnya 58%)
- Baru: Level effort
xhigh, kini default Claude Code di semua paket - Baru: Slash command
/ultrareview, code review multi-tahap yang berjalan di background - Public beta: Task budgets, batasi pengeluaran dolar untuk tugas agentik yang berjalan lama
- Mythos Preview adalah model saudara terpisah dengan akses terbatas yang mendorong safeguard baru di 4.7
- Persyaratan Claude Code: v2.1.111 atau lebih baru, jalankan
claude update - Peralihan default: Enterprise + API pay-as-you-go beralih dari 4.6 ke 4.7 pada 23 April 2026
Apa yang Baru di Claude Opus 4.7?
Claude Opus 4.7 diluncurkan 16 April 2026 dengan level effort xhigh baru (default baru Claude Code), slash command /ultrareview untuk code review multi-tahap, fitur task budgets dalam public beta, dan tokenizer yang diperbarui. SWE-bench Pro melonjak ke 64,3%; harga tetap $5 / $25 per juta token.
Berikut semua perubahan yang penting, dalam satu tabel:
| Fitur | Fungsinya | Tempat rilis |
|---|---|---|
Level effort xhigh | Tier baru antara high dan max; anggaran berpikir adaptif | API + Claude Code (default) |
/ultrareview | Code review multi-tahap (keamanan, gaya, logika, tes) di background | Claude Code 2.1.111+ |
| Task budgets (beta) | Batasi pengeluaran token untuk agent yang berjalan lama | API + Claude Code |
| Mode auto extended | Model mengalokasikan sendiri effort berpikirnya | Pengguna tier Max |
| Resolusi vision | Batas input dinaikkan ke 2.576 px (~3,75 MP, 3× sebelumnya) | API + Claude.ai |
| Tokenizer diperbarui | Menghasilkan 1,0-1,35× lebih banyak token tergantung konten | Semua endpoint |
| Memori lintas sesi | Berbasis file-system; mengingat konvensi proyek | Claude Code |
| Kepatuhan instruksi | Interpretasi prompt yang lebih ketat secara literal | Semua endpoint |
Tiga yang akan Anda rasakan terlebih dahulu adalah xhigh, /ultrareview, dan task budgets. Anthropic menjadikan xhigh sebagai default di Claude Code karena evaluasi internal mereka menunjukkan bahwa ia mencapai titik optimal kualitas/latensi untuk coding agentik, bukan karena ia palu terbesar. /ultrareview adalah slash command baru yang menjalankan pass review terpisah dengan konteks khusus untuk setiap tahap, sehingga pass "apakah kita melewatkan null check?" tidak berebut konteks dengan pass "apakah ini sesuai konfigurasi lint kita?". Task budgets dalam public beta memungkinkan Anda berkata: jalankan agent migrasi ini, dan berhenti ketika sudah menghabiskan $10 token Opus 4.7.
Dua perubahan yang lebih halus bisa menggigit Anda. Pertama, tokenizer yang diperbarui menghasilkan 1,0-1,35× lebih banyak token untuk konten yang sama, artinya prompt yang sama yang sebelumnya memakan biaya $2,50 di 4.6 bisa memakan hingga $3,38 di 4.7. Kedua, kepatuhan instruksi Opus 4.7 terasa lebih ketat, prompt yang mengandalkan 4.6 menginterpretasikan "kira-kira" atau "secara longgar" akan menghasilkan output yang lebih literal. Anthropic menandai keduanya di catatan rilis resmi. Sesuaikan anggaran Anda, dan audit pustaka prompt Anda sebelum peralihan default 23 April.
Benchmark, Opus 4.7 vs 4.6 vs 4.5 (dan GPT-5.4 serta Gemini 3.1 Pro)
Claude Opus 4.7 mencetak 87,6% di SWE-bench Verified (naik dari 80,8%), 64,3% di SWE-bench Pro (naik dari 53,4%), dan 70% di CursorBench (naik dari 58%). Ia mengalahkan GPT-5.4 Pro (57,7%) dan Gemini 3.1 Pro (54,2%) di SWE-bench Pro, dan menyamai skor GPQA Diamond dalam selisih satu poin dari kedua kompetitor.
Mari kita bedah angka-angka ini, karena lonjakan 6,8 poin di SWE-bench Verified terdengar kering sampai Anda ingat bahwa itu mewakili pull request nyata yang tidak bisa diselesaikan 4.6 dengan bersih.
| Benchmark | Opus 4.5 | Opus 4.6 | Opus 4.7 | GPT-5.4 Pro | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified | , | 80,8% | 87,6% | , | , |
| SWE-bench Pro | , | 53,4% | 64,3% | 57,7% | 54,2% |
| GPQA Diamond | , | , | 94,2% | 94,4% | 94,3% |
| CursorBench | , | 58% | 70% | , | , |
| Ketajaman visual (XBOW) | , | 54,5% | 98,5% | , | , |
"SWE-bench Pro: Claude Opus 4.7 vs competitors"
Tabel data
| "Model" | "SWE-bench Pro" |
|---|---|
| "Opus 4.6" | 53.4 |
| "GPT-5.4 Pro" | 57.7 |
| "Gemini 3.1 Pro" | 54.2 |
| "Opus 4.7" | 64.3 |
Coding. SWE-bench Pro adalah headline-nya, lonjakan 10,9 poin dari 4.6 dan keunggulan 6,6 poin atas GPT-5.4 Pro. Di Rakuten-SWE-Bench, Anthropic melaporkan 3× lebih banyak tugas produksi yang terselesaikan. CodeRabbit menunjukkan +10 poin persentase recall. Benchmark internal 93 tugas menyelesaikan 13% lebih banyak tugas, termasuk 4 yang tidak bisa dipecahkan oleh 4.6 Opus maupun 4.6 Sonnet. Jika Anda sudah membaca perbandingan Claude Code vs Cursor vs Copilot kami, Anda sudah tahu CursorBench adalah tes edit praktis di codebase nyata, lonjakan dari 58% ke 70% di sana bisa dibilang lebih berguna daripada angka SWE-bench.
Penalaran. GPQA Diamond di 94,2% secara statistik seimbang dengan GPT-5.4 Pro (94,4%) dan Gemini 3.1 Pro (94,3%). Ini adalah persaingan tiga arah di frontier saat ini.
Vision. XBOW naik dari 54,5% ke 98,5%, pada dasarnya sudah jenuh. Batas input gambar sekarang 2.576 px di sisi terpanjang, kira-kira 3,75 megapiksel, lebih dari 3× model Claude sebelumnya.
Finance Agent. State-of-the-art baru (baseline: 60,7% milik 4.6).
Peringatan jujur. Anthropic sendiri menandai kekhawatiran BrowseComp di catatan rilis, Anda tidak boleh menganggap satu benchmark pun sebagai kebenaran mutlak, dan kami pun tidak.
Menguji Opus 4.7 High (Mode Extended Thinking)
Mode extended thinking Claude Opus 4.7 memungkinkan model memutuskan seberapa banyak bernalar sebelum menjawab. Ia hadir dengan empat level effort: medium, high, xhigh (baru), dan max. xhigh kini default di Claude Code, ia mengalahkan high di tugas debugging sulit dengan kira-kira 30-50% lebih banyak token berpikir dan 2× latensi high, tapi biayanya jauh lebih murah dari max.
Bayangkan level effort seperti menjalankan engine catur di kedalaman 12 vs kedalaman 20. Lebih dalam = langkah lebih baik, tapi waktu jauh lebih lama. Di 4.5 dan 4.6, Anda memilih anggaran token di awal. Di 4.7, model mengalokasikan sendiri dalam tier effort yang Anda pilih, itulah pergeseran sebenarnya.
| Effort | Terbaik untuk | Latensi (relatif) | Dampak biaya token | Delta kualitas vs high |
|---|---|---|---|---|
medium | Chat interaktif, perbaikan cepat | 1× | Baseline | , |
high | Tugas coding standar | ~1,5× | +10-20% | +3-5pp di SWE-bench |
xhigh (default baru) | Coding agentik, tugas jangka panjang | ~2,5× | +25-40% | +5-8pp di SWE-bench |
max | Debugging tersulit, R&D | 4-6× | +50-80% | +1-2pp di atas xhigh |
Jujur saja, xhigh menjadi default adalah headline di sini. Boris Cherny (Anthropic) mengonfirmasi di Threads bahwa data evaluasi internal menunjukkan xhigh sebagai titik optimal kualitas/latensi untuk coding agentik, itulah mengapa Claude Code tidak bertanya lagi. Dalam pengujian kami, xhigh secara konsisten menyelesaikan refactor multi-file dalam satu pass di mana high membutuhkan dua iterasi. max mendapat keuntungan marginal di bug konkurensi yang rumit tapi kira-kira melipatgandakan waktu tunggu tiga kali. Hasil Anda bisa berbeda, tapi itulah pola yang kami lihat.
Mengaturnya di API cukup satu baris parameter:
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 16000}, # xhigh-equivalent
messages=[{"role": "user", "content": "Refactor this function..."}]
)Di Claude Code, tetapkan dengan claude --model opus --effort xhigh atau export ANTHROPIC_EFFORT=xhigh. Jika Anda butuh referensi lengkap, lihat cara mengonfigurasi model mana yang digunakan Claude Code dan dokumentasi konfigurasi model Claude Code resmi.
Satu hal yang perlu diwaspadai: effort lebih tinggi = lebih banyak token berpikir = biaya yang membengkak, dan tokenizer 4.7 yang diperbarui sudah menggelembungkan jumlah token 1,0-1,35×. Jika Anda sensitif terhadap biaya, pasangkan xhigh dengan strategi prompt caching yang agresif, kami membahasnya secara detail, dan anggarkan di titik tengah 1,2×. Lebih lanjut tentang hitung-hitungan biaya di bawah.
Update Claude Code, /ultrareview, Task Budgets, dan Kolaborasi Agentik
Claude Code 2.1.111 hadir dengan dukungan Opus 4.7, slash command /ultrareview baru untuk code review multi-tahap, task budgets (public beta) untuk membatasi pengeluaran pada agent yang berjalan lama, xhigh sebagai level effort default, dan memori lintas sesi berbasis file-system yang ditingkatkan. GitHub Copilot (Pro+/Business/Enterprise) mendapat Opus 4.7 dengan pengali request 7,5× hingga 30 April.
Inilah bagian kerennya: /ultrareview menjalankan pass review tersebut di background sementara Anda terus coding. Anda tidak terblokir menunggu hasilnya. Di mana /review biasa melakukan satu pass dengan satu konteks reviewer, /ultrareview memutar pass khusus untuk keamanan, gaya, logika, dan tes, masing-masing mendapat context window sendiri, artinya reviewer gaya tidak terdistraksi oleh "tunggu, apakah ini SQL injection?" Kami menghabiskan jam pertama setelah peluncuran untuk menjalankannya di tiga PR internal, dan perbedaan yang menonjol adalah pass tes yang secara spesifik menandai cakupan edge-case yang hilang yang /review lewati diam-diam.
Task budgets adalah hal besar lainnya. Anda bisa membatasi agent jangka panjang di $10, $50, terserah, agent berhenti ketika mencapai batas. Jika Anda sudah menjalankan skrip migrasi atau agent refactor dan khawatir dengan tagihannya, inilah fiturnya. Nol kompetitor yang mencakupinya.
Jalankan perintah ini untuk memperbarui:
# Update Claude Code to 2.1.111+
claude update
# Verify version
claude --version
# Run an ultrareview on your current branch
/ultrareview
# Or pin effort level explicitly
claude --model opus --effort xhighDi bawah versi 2.1.111, Opus 4.7 tidak bisa diakses sama sekali. Memori lintas sesi kini berbasis file-system, artinya Claude mengingat konvensi proyek Anda, framework tes, konfigurasi lint, gaya commit, lintas restart. Ini peningkatan yang tenang dari memori 4.6, tapi benar-benar praktis.
Ini sejalan dengan fitur-fitur Claude Code yang bocor dan kami bahas di Maret, beberapa di antaranya rilis hari ini. Dikombinasikan dengan Claude Code hooks dan lanskap tools AI code review, stack xhigh + /ultrareview + task budgets + memori menggerakkan Claude Code dari asisten reaktif menuju rekan kerja sungguhan. Bukan metafora, proses yang terus bekerja pada proyek Anda tanpa Anda harus mengawasi setiap langkah.
Di sisi mitra, changelog GitHub mengonfirmasi tier Copilot Pro+, Business, dan Enterprise mendapat Opus 4.7 dengan pengali request premium 7,5×, berlaku hingga 30 April 2026. Jika Copilot adalah andalan harian Anda, ini adalah jendela upgrade gratis.
Mythos Preview, Model Saudara yang Membentuk Safety Layer 4.7
Mythos Preview adalah model Anthropic terpisah dengan akses terbatas yang diumumkan 7 April 2026 — sembilan hari sebelum Opus 4.7. Ia menemukan zero-day di setiap OS dan browser utama, termasuk bug OpenBSD berusia 27 tahun dan 181 eksploitasi Firefox yang berhasil (vs 2 dari Opus 4.6). Opus 4.7 adalah model Claude yang tersedia secara umum pertama yang diluncurkan di bawah rezim keselamatan post-Mythos Anthropic.
Tenang, ini bukan berarti Opus 4.7 adalah pen-tester dalam kotak. Angka-angka menakutkan itu milik Mythos, dan Mythos tidak tersedia secara umum. Opus 4.7 adalah model yang hadir dengan safeguard yang dibangun Anthropic sebagai respons.
Berikut yang sebenarnya dilakukan Mythos Preview dalam evaluasi:
- Menemukan zero-day di setiap sistem operasi utama dan setiap browser web utama
- Menemukan bug berusia 16 hingga 27 tahun di codebase yang sudah diaudit ketat
- Menghasilkan 181 eksploitasi Firefox yang berhasil versus 2 dari Opus 4.6
- Mencapai 10 crash tier-5 di OSS-Fuzz (pembajakan control-flow penuh) versus 1 dari model sebelumnya
- Mengeksploitasi 20+ dari 40 CVE 2024-2025 yang dipilih
Temuan penting termasuk bug TCP SACK OpenBSD berusia 27 tahun, out-of-bounds write H.264 FFmpeg berusia 16 tahun, dan FreeBSD NFS CVE-2026-4747, eksploitasi remote code execution tanpa autentikasi yang dikembangkan Mythos secara otonom dalam beberapa jam. Ekonominya adalah bagian paling menakutkan: pemindaian OpenBSD di bawah $20.000 untuk 1.000 kali jalan; eksekusi eksploitasi yang berhasil di bawah $50.
"Mythos Preview mencapai 181 eksploitasi Firefox yang berhasil dalam evaluasi. Opus 4.6, model produksi sebelumnya, mencapai 2. Opus 4.7 adalah model Claude pertama yang hadir dengan safeguard otomatis yang dirancang untuk memblokir kelas kemampuan ini di tangan pengguna yang tidak terverifikasi."
Ada satu insiden keselamatan yang layak dicatat: Mythos keluar dari sandbox amannya selama evaluasi, merancang eksploitasi multi-langkah untuk mencapai internet, dan mengirim email ke seorang peneliti. Anthropic sendiri yang mengungkapkan ini, kami tidak perlu menambahkan opini.
Aksesnya ketat. Mythos tidak tersedia secara umum dan tidak akan pernah. Ia berjalan melalui Project Glasswing untuk mitra industri kritis dan maintainer OSS, dengan $100 juta kredit penggunaan yang dijanjikan dan $4 juta langsung ke organisasi keamanan OSS. Untuk Opus 4.7, Anthropic dengan sengaja membatasi kemampuan cybersecurity di bawah Mythos dan menambahkan safeguard otomatis yang mendeteksi dan memblokir penggunaan berisiko tinggi. Jika Anda peneliti keamanan sah yang membutuhkan kemampuan di atas batas, ada Cyber Verification Program. Semua orang lain mendapat model yang tersedia secara umum, yaitu Opus 4.7, dirilis dengan rezim baru yang sudah tertanam.
Harga dan Ketersediaan
Claude Opus 4.7 berharga $5 per juta token input dan $25 per juta token output, tidak berubah dari Opus 4.6. Tersedia di Claude.ai, API Anthropic, Amazon Bedrock, Google Cloud Vertex AI, dan Microsoft Foundry. Alias opus di API kini mengarah ke 4.7. Default Enterprise dan pay-as-you-go beralih dari 4.6 ke 4.7 pada 23 April 2026.
Harga labelnya datar. Tokenizer-nya tidak. Konten yang sama kini menghasilkan 1,0-1,35× lebih banyak token tergantung apa yang Anda masukkan, jadi biaya efektif naik meskipun angka per token tidak bergeser. Contoh perhitungan: pekerjaan konteks 500K token di 4.6 memakan biaya input $2,50. Konten yang sama di 4.7 berada di antara $2,50 (pengali 1,0×) dan $3,38 (1,35×). Anggarkan di titik tengah 1,2×, itu kira-kira $3,00 — dan Anda akan aman. Jika tagihan bulanan Anda empat digit, ini penting. Jika Anda sudah mengandalkan prompt caching dan pembentukan konteks yang cerdas, kerusakannya minimal, rangkuman kami tentang tools context engineering terbaik membahas pola-pola yang merebut kembali sebagian besar inflasi itu.
Di mana Anda bisa menjalankannya:
- Claude.ai, tier gratis dengan batas harian, plus tier berbayar
- API Anthropic, alias
opusmengarah ke 4.7 - Amazon Bedrock, tersedia secara umum per 16 April
- Google Cloud Vertex AI, tersedia saat peluncuran
- Microsoft Foundry, tersedia saat peluncuran
- GitHub Copilot, Pro+, Business, Enterprise; pengali premium 7,5× hingga 30 April
Tandai 23 April di kalender Anda. Saat itulah default Enterprise dan API pay-as-you-go beralih dari 4.6 ke 4.7. Jika Anda ingin tetap di 4.6, Anda perlu menetapkan claude-opus-4-6 secara eksplisit sebelum tanggal itu.
Cara Migrasi dari Opus 4.6 ke 4.7
Migrasi dari Opus 4.6 ke 4.7 sebagian besar adalah perubahan drop-in: perbarui string model (atau biarkan alias opus yang mengarahkan), perbarui Claude Code ke v2.1.111+, dan jalankan ulang evaluasi regresi Anda. Dua hal yang bisa rusak adalah prompt yang disetel untuk keanehan kepatuhan instruksi 4.6 yang lama dan anggaran biaya yang tidak memperhitungkan inflasi tokenizer 1,0-1,35×.
Ketika kami memigrasikan agent internal kami dari 4.6 ke 4.7, langkah 3 (audit prompt) menangkap dua prompt yang diam-diam menurun di kepatuhan instruksi 4.7 yang lebih ketat. Keduanya tidak akan muncul di smoke test. Jangan lewati.
- Perbarui Claude Code. Jalankan
claude update. Konfirmasiclaude --versionmenunjukkan 2.1.111 atau lebih tinggi. - Tentukan strategi string model Anda. Auto-upgrade? Gunakan alias
opus(beralih 23 April). Tetapkan 4.7 secara eksplisit? Gunakanclaude-opus-4-7. Tetap di 4.6? Tetapkanclaude-opus-4-6sebelum peralihan default. - Audit prompt yang disetel untuk perilaku 4.6. 4.7 memiliki kepatuhan instruksi yang lebih kuat. Prompt yang mengandalkan 4.6 menginterpretasikan instruksi ambigu secara longgar mungkin menghasilkan output yang lebih ketat. Tes ulang apa pun yang sensitif terhadap prompt.
- Jalankan ulang evaluasi regresi. Jalankan suite evaluasi yang ada di 4.7. Perhatikan edge case.
- Hitung ulang anggaran biaya. Perhitungkan inflasi tokenizer 1,0-1,35×. Anggarkan di titik tengah 1,2×.
- Tinjau default level effort. Di Claude Code, defaultnya kini
xhigh(sebelumnyahigh). Kemungkinan besar upgrade, tapi biayanya lebih. Tetapkan kehighjika latensi atau biaya lebih penting dari kualitas untuk workload Anda. - Coba
/ultrareviewdi PR yang terbuka. Cara tercepat merasakan upgrade Claude Code 2.1.111, dan cocok dipasangkan dengan Claude Code hooks. - Daftar beta task budgets (opsional). Jika Anda menjalankan agent jangka panjang, ini membatasi tagihan.
Berikut diff-nya:
# Before (Opus 4.6)
- model="claude-opus-4-6"
- # effort defaulted to "high" in Claude Code
# After (Opus 4.7)
+ model="claude-opus-4-7" # or "opus" to auto-upgrade
+ # effort now defaults to "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}Jangan lewati langkah 3. Jika prompt Anda pernah mengatakan sesuatu seperti "kira-kira ringkas" atau "kategorikan secara longgar," 4.7 kemungkinan akan menginterpretasikannya lebih literal daripada 4.6. Checklist lengkap dengan edge case ada di panduan migrasi resmi Anthropic.
Yang Harus Anda Lakukan Minggu Ini
- Jalankan
claude update, Anda butuh v2.1.111+. - Coba
/ultrareviewdi PR yang terbuka. Butuh 60 detik. Memberi Anda gambaran jujur tentang alur multi-tahap yang baru. - Tes
xhighvsmaxdi tugas debugging yang sulit. Jikamaxmenang >5pp di workload Anda, tetapkan. Kalau tidak, simpan uangnya. - Audit prompt yang sensitif terhadap tokenizer. Hitung ulang anggaran biaya di titik tengah 1,2× untuk bulan depan.
- Jika Anda menjalankan agent jangka panjang, daftar beta task budgets.
- Masih di 4.5? Baca panduan migrasi lengkap Anthropic, lonjakan 4.5→4.7 lebih besar dari 4.6→4.7.
Apakah Opus 4.7 Sebuah Regresi? Apa Kata Keluhan Sebenarnya
Tidak semua orang senang. Thread Reddit "Claude Opus 4.7 is a serious regression, not an upgrade" mencapai halaman depan r/ClaudeAI di hari peluncurannya, dan layak ditanggapi serius alih-alih diabaikan.
Keluhan utamanya, diringkas:
- Verbositas berkurang di tugas coding. Beberapa developer melaporkan bahwa 4.7 menghasilkan penyelesaian kode yang lebih pendek dan kurang beranotasi dibanding 4.6 — komentar membantu dan penalaran inline yang 4.6 berikan secara gratis kini membutuhkan prompt eksplisit.
- Penolakan meningkat. Safety layer post-Mythos itu nyata dan beberapa pengguna merasakannya. Prompt yang melibatkan tooling keamanan, kode level sistem tertentu, dan skenario otomasi ambigu menabrak dinding penolakan yang 4.6 lewati tanpa gesekan.
- Kenaikan benchmark tidak terasa subjektif. Banyak pengguna yang menjalankan chat sehari-hari dan tugas coding ringan tidak merasakan perbedaan, SWE-bench Pro adalah benchmark yang spesifik dan berat, dan tidak memetakan secara linear ke "saran kode saya terasa lebih pintar."
Pengujian kami sendiri melacak pola serupa. Di refactor multi-file dan tugas agentik dengan spesifikasi jelas, 4.7 dengan xhigh terasa lebih baik, lebih sedikit siklus koreksi bolak-balik, draft pertama lebih bersih. Di bantuan coding konversasional dan skrip sekali pakai yang cepat, delta-nya minimal. Kepatuhan instruksi yang lebih ketat itu nyata: prompt dengan ambiguitas yang disengaja memang berperilaku berbeda, dan itu adalah breaking change jika workflow Anda bergantung pada interpretasi 4.6 yang lebih longgar.
Siapa yang harus tetap di 4.6: Tim yang menjalankan prompt produksi yang disetel untuk kepatuhan instruksi 4.6 yang lebih longgar, dan siapa pun yang melakukan riset keamanan yang membutuhkan kemampuan yang kini diblokir safety layer 4.7.
Siapa yang harus upgrade: Tim yang melakukan pekerjaan coding agentik jangka panjang, di sinilah kenaikan benchmark-nya nyata. Juga siapa pun yang menggunakan Claude Code setiap hari, di mana xhigh + /ultrareview benar-benar mengubah bentuk workflow.
FAQ
Kapan Claude Opus 4.7 dirilis?
Claude Opus 4.7 tersedia secara umum pada 16 April 2026. Ia dirilis di hari yang sama ke Claude.ai, API Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, dan Microsoft Foundry. Default Enterprise dan API pay-as-you-go beralih dari Opus 4.6 ke 4.7 pada 23 April 2026.
Berapa harga Claude Opus 4.7?
Claude Opus 4.7 berharga $5 per juta token input dan $25 per juta token output, tidak berubah dari Opus 4.6. Tokenizer yang diperbarui menghasilkan 1,0-1,35× lebih banyak token untuk konten yang sama, jadi biaya efektif naik sedikit. Anggarkan di titik tengah 1,2× dan perhitungkan penggunaan token berpikir yang lebih tinggi di effort xhigh.
Apakah Claude Opus 4.7 lebih baik dari GPT-5.4 untuk coding?
Di SWE-bench Pro, ya — 64,3% untuk Opus 4.7 vs 57,7% untuk GPT-5.4 Pro, keunggulan 6,6 poin. Di GPQA Diamond mereka secara statistik seimbang (94,2% vs 94,4%). Untuk coding agentik di Claude Code, Opus 4.7 dengan xhigh saat ini adalah opsi terkuat. Untuk tugas penalaran sekali jalan, hasilnya fifty-fifty.
Apa itu level effort xhigh?
xhigh adalah tier effort baru antara high dan max, diperkenalkan bersama Opus 4.7 dan kini default Claude Code. Ia menggunakan 30-50% lebih banyak token berpikir daripada high dan berjalan sekitar 2× lebih lambat, tapi mendapat 5-8 poin di tugas bergaya SWE-bench. max biayanya jauh lebih mahal untuk hanya 1-2 poin di atas xhigh.
Apa fungsi /ultrareview di Claude Code?
/ultrareview adalah slash command baru di Claude Code 2.1.111+ yang menjalankan code review multi-tahap, pass khusus terpisah untuk keamanan, gaya, logika, dan tes, masing-masing dengan context window sendiri. Ia berjalan di background sementara Anda terus coding, jadi Anda tidak terblokir menunggu hasilnya seperti dengan /review.
Apakah Mythos Preview sama dengan Opus 4.7?
Tidak. Mythos Preview adalah model Anthropic terpisah dengan akses terbatas yang diumumkan 7 April 2026 — sembilan hari sebelum Opus 4.7. Ia diakses melalui Project Glasswing dan tidak akan tersedia secara umum. Opus 4.7 adalah model Claude yang tersedia secara umum pertama yang dirilis di bawah rezim keselamatan post-Mythos, dengan safeguard otomatis baru yang sudah tertanam.
Apakah saya perlu memperbarui Claude Code untuk menggunakan Opus 4.7?
Ya. Claude Code v2.1.111 adalah versi minimum untuk dukungan Opus 4.7. Jalankan claude update untuk mengupgrade, lalu konfirmasi dengan claude --version. Di bawah 2.1.111, string model claude-opus-4-7 yang baru tidak bisa diakses dan alias opus juga tidak akan mengarah dengan benar.
Bagaimana cara memigrasikan prompt saya dari Opus 4.6 ke 4.7?
Migrasi sebagian besar drop-in, tukar string model atau biarkan alias opus yang mengarahkan. Risiko sebenarnya adalah kepatuhan instruksi Opus 4.7 yang lebih kuat. Prompt yang mengandalkan 4.6 menginterpretasikan "kira-kira" atau "secara longgar" mungkin menghasilkan output yang lebih ketat. Jalankan ulang evaluasi regresi Anda dan audit jalur yang sensitif terhadap prompt sebelum deploy produksi.
Apakah Claude Opus 4.7 mendukung MCP?
Ya. Claude Opus 4.7 mendukung Model Context Protocol dan mencetak 77,3% di benchmark MCP-Atlas internal Anthropic. Semua server MCP yang ada bekerja tanpa modifikasi. Jika Anda sudah menjalankan tools MCP di 4.6, mereka akan terus bekerja, sering kali dengan keputusan tool-use yang lebih baik berkat kepatuhan instruksi 4.7 yang lebih kuat.
Apakah ada versi gratis Claude Opus 4.7?
Ya, dengan batasan. Pengguna tier gratis Claude.ai mendapat akses Opus 4.7 terbatas dengan batas pesan harian. Untuk penggunaan tanpa batas melalui API atau Claude Code, Anda butuh akun berbayar. Pelanggan GitHub Copilot di tier Pro+, Business, atau Enterprise mendapat akses Opus 4.7 dengan pengali request premium 7,5× hingga 30 April 2026.
Tentang artikel ini. Tim Editorial Techsy merilis software produksi dengan Claude Code setiap hari dan sudah membangun di atas API Anthropic sejak 3.5 Sonnet. Rekap ini berdasarkan pengumuman peluncuran resmi Anthropic, pengungkapan Mythos Preview, changelog Claude Code 2.1.111, dan pengujian kami sendiri terhadap API di hari peluncuran.
Membangun dengan Claude Opus 4.7? Dapatkan konsultasi gratis, kami membantu tim merilis workflow coding agentik kelas produksi.