Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
ai-machine-learning

Benchmark GPT-5.5 Pro: Angka-Angka yang Diterbitkan OpenAI (dan yang Tidak)

Ditulis oleh Mert Batur Gürbüz
Jun 25, 2026
14 baca
Daftar Isi
Benchmark GPT-5.5 Pro: Angka-Angka yang Diterbitkan OpenAI (dan yang Tidak)

Benchmark GPT-5.5 Pro: Angka-Angka yang Diterbitkan OpenAI (dan yang Tidak)

OpenAI merilis GPT-5.5 Pro pada 23 April 2026, dengan harga $30 per juta token input dan $180 per juta token output. Itu 6× lipat dari GPT-5.5 base yang $5/$30. Dengan harga segitu, Anda mendapat varian komputasi lebih tinggi yang mencetak 90,1% di BrowseComp. Tapi ini bagian yang tidak pernah masuk headline: tabel eval OpenAI sendiri membiarkan baris coding GPT-5.5 Pro kosong. Computer-use juga. Long-context juga. Jadi ketika Anda mencari skor SWE-Bench Pro model ini, tidak ada yang bisa ditemukan. Kami menarik tabel yang diterbitkan dan menilai setiap angka sendiri.

Jawaban cepat:

  • GPT-5.5 Pro adalah varian komputasi lebih tinggi dari GPT-5.5 (rilis 23 April 2026), bukan model baru.
  • Ia memimpin di browsing (BrowseComp 90,1%) dan matematika frontier, tapi OpenAI membiarkan baris coding, computer-use, dan long-context kosong.
  • Di baris coding yang ada, GPT-5.5 base tertinggal dari Claude Fable 5 (SWE-Bench Pro 58,6% vs 80,3%).
  • Claude Fable 5 saat ini ditangguhkan (arahan export-control AS, sekitar 12 Juni 2026), jadi kemenangannya datang dengan tanda bintang "tidak bisa dibeli sekarang".

Catatan singkat soal metode, karena akurasi lebih penting dari kecepatan di artikel benchmark: angka-angka di bawah sudah dicek silang terhadap tabel yang diterbitkan OpenAI dan Anthropic serta paper SWE-Bench Pro (arXiv 2509.16941). Di mana hanya satu vendor yang melaporkan angka, kami bilang begitu. Di mana OpenAI tidak pernah menerbitkan skor Pro, kami tulis "tidak diterbitkan" alih-alih diam-diam menukar dengan angka base.

Benchmark GPT-5.5 Pro: Apa yang Sebenarnya Diterbitkan OpenAI

Benchmark GPT-5.5 Pro yang diterbitkan mencakup irisan sempit: browsing, matematika frontier, pekerjaan pengetahuan profesional, genetika, dan penalaran luas. OpenAI menjalankan setiap eval pada reasoning effort xhigh di lingkungan riset, yang berbeda dari default ChatGPT produksi. Angka utamanya adalah BrowseComp 90,1%, jauh di atas 84,4% milik GPT-5.5 base.

Berikut tabel utamanya, dengan kolom yang menunjukkan apakah OpenAI menerbitkan skor Pro terpisah untuk setiap tes:

BenchmarkYang diujiGPT-5.5 ProGPT-5.5 basePro diterbitkan?Catatan
BrowseCompBrowsing web sulit / pencarian info90,1%84,4%YaKemenangan Pro paling jelas atas base
FrontierMath T1-3Matematika sulit52,4%51,7%YaMengalahkan Opus 4.7 yang dilaporkan (43,8%)
FrontierMath T4Matematika frontier39,6%35,4%YaTier matematika tersulit
GDPvalPekerjaan pengetahuan profesional82,3% (diklaim)84,9%Ya (diatribusikan)Tabel OpenAI mencantumkan Pro di bawah base
GeneBenchGenetika multi-tahap33,2% (diklaim)25,0%Ya (diatribusikan)"OpenAI melaporkan" lonjakan besar
HLE (tanpa tools)Penalaran sulit luas43,1%41,4%YaDi bawah Opus 4.7 yang dilaporkan (46,9%)
HLE (dengan tools)Penalaran dengan tools57,2% (diklaim)52,2%SebagianBase 52,2% terkonfirmasi; Pro 57,2% diklaim
Investment Banking ModelingPemodelan keuangan88,6% (internal)88,5%Eval internalOpenAI menandai ini INTERNAL; perlakukan sebagai soft
SWE-Bench ProCoding agentiktidak diterbitkan58,6%TidakKesenjangan utama
OSWorld-VerifiedComputer usetidak diterbitkan78,7%TidakKosong untuk Pro
CybersecurityTugas keamanantidak diterbitkantidak ditampilkanTidakKosong untuk Pro
Long-contextRecall dokumen panjangtidak diterbitkantidak ditampilkanTidakKosong untuk Pro

Baca blok bawah itu baik-baik. OpenAI menerbitkan skor GPT-5.5 Pro untuk browsing dan matematika, tapi membiarkan baris coding, computer-use, cybersecurity, dan long-context kosong. Angka BrowseComp, FrontierMath, dan GDPval-base terkonfirmasi terhadap pelacak sekunder; GDPval-Pro 82,3%, GeneBench 33,2%, dan angka Investment Banking dilaporkan oleh OpenAI tapi tidak diverifikasi independen, jadi kami mengatribusikannya alih-alih menyatakannya secara datar.

Apa Sebenarnya Arti "Pro": Komputasi Test-Time Paralel, Bukan Model Baru

GPT-5.5 Pro adalah model GPT-5.5 yang sama yang berjalan dengan reasoning effort jauh lebih tinggi, bukan arsitektur berbeda. Anggap ini bukan mesin baru, melainkan mesin yang sama yang berjalan lebih lama dan secara paralel sebelum menjawab. OpenAI menyebut pengaturan ini reasoning effort, dan Pro menguncinya di tier teratas: xhigh.

Apakah GPT-5.5 Pro model yang berbeda dari GPT-5.5?

Tidak. Weights sama, training sama. Ketika orang mencari gpt 5.5 pro vs gpt 5.5 thinking atau vs xhigh, mereka sebenarnya bertanya tentang satu hal: seberapa keras model berpikir sebelum menjawab. "Komputasi test-time paralel" artinya model menjelajahi beberapa jalur penalaran sekaligus dan memilih yang terbaik, yang memakan lebih banyak token dan lebih banyak waktu riil. Komputasi ekstra itulah yang Anda bayar 6×.

Spesifikasinya selain itu sama. GPT-5.5 Pro membawa context window sekitar 1,1 juta token input dan 128 ribu token output. Jadi Anda tidak membeli memori lebih besar atau model base yang lebih pintar. Anda membeli lebih banyak waktu berpikir pada model yang sudah Anda kenal.

GPT-5.5 Pro vs GPT-5.5 (Standar): Di Mana Harga 6× Memberi Anda Sesuatu

GPT-5.5 Pro mengalahkan GPT-5.5 base di tugas-tugas tersulit: browsing, matematika frontier, dan genetika. Ia memberi Anda paling sedikit di pekerjaan rutin. Kenaikan paling bersih adalah BrowseComp 90,1% vs 84,4%, lonjakan 5,7 poin di riset web mendalam. Di FrontierMath Tier 4 ia naik ke 39,6% dari 35,4%.

Tapi lebih banyak komputasi tidak selalu berarti skor lebih tinggi. Di GDPval, tabel OpenAI justru mencantumkan Pro lebih rendah dari GPT-5.5 base (82,3% diklaim vs 84,9% terkonfirmasi). Itu kontra-intuitif, dan dilaporkan sebagai Pro yang menukar sebagian kemenangan mentah demi kalibrasi. Poinnya tetap: membayar lebih bukan jaminan.

Di mana Pro unggul:

  • BrowseComp: 90,1% vs 84,4% (+5,7)
  • FrontierMath T4: 39,6% vs 35,4% (+4,2)
  • GeneBench: 33,2% vs 25,0% (diklaim oleh OpenAI)
  • HLE dengan tools: 57,2% (diklaim) vs 52,2% (base terkonfirmasi)

Di mana ia datar atau lebih buruk:

  • GDPval: 82,3% (diklaim) vs 84,9% base
  • HLE tanpa tools: 43,1% vs 41,4%, nyaris tidak bergerak

Jika pekerjaan Anda kebanyakan drafting sehari-hari, code review, dan ringkasan, premium 6× sulit dibenarkan. Hitung-hitungannya baru berbalik ketika tugasnya benar-benar sulit. Selagi bicara biaya: jika tagihan Anda yang jadi masalah, panduan kami untuk memangkas biaya API LLM membahas routing model murah untuk 80% yang mudah dan menyimpan Pro untuk 20% yang sulit.

GPT-5.5 Pro vs Claude Fable 5

Di benchmark coding yang dilaporkan kedua vendor, Claude Fable 5 mengalahkan GPT-5.5 base secara telak. Tapi Fable 5 saat ini ditangguhkan, jadi kemenangannya datang dengan tanda bintang. Dan perbandingannya lebih berantakan dari yang terlihat, karena OpenAI tidak menerbitkan skor coding GPT-5.5 Pro sama sekali. Jadi matchup yang jujur sebenarnya Fable 5 vs GPT-5.5 base di coding, dengan Pro absen.

Berikut tabel tiga arah. Angka Fable 5 diatribusikan ke tabel yang diterbitkan Anthropic; sel Pro yang kosong memang persis begitu:

TesGPT-5.5 baseGPT-5.5 ProClaude Fable 5Pemenang
SWE-Bench Pro58,6%tidak diterbitkan80,3%Fable 5
FrontierCode Diamond5,7%tidak diterbitkan29,3%Fable 5
Terminal-Bench83,4% (v2.1)tidak diterbitkan88,0% (v2.1)Fable 5
OSWorld-Verified78,7%tidak diterbitkan85,0%Fable 5
HLE (tanpa tools)41,4%43,1%56,8-59,0%Fable 5
HLE (dengan tools)52,2%57,2% (diklaim)64,5%Fable 5
BrowseComp84,4%90,1%tidak diterbitkanGPT-5.5 Pro
FrontierMath T435,4%39,6%tidak dilaporkanGPT-5.5 Pro
GDPval-AA1769tidak diterbitkan1932Fable 5

Dua catatan ada di tabel itu. Pertama, Terminal-Bench: GPT-5.5 base mencetak 82,7% di v2.0 dan 83,4% di v2.1, sementara 88,0% Fable ada di v2.1, jadi pastikan Anda membaca versi yang sama sebelum menyimpulkan kesenjangan. Kedua, GDPval-AA bukan persentase. Itu skor bergaya Elo (1932 untuk Fable vs 1769 untuk GPT-5.5 base), skala yang sama sekali berbeda, jadi jangan menyandingkannya dengan baris persentase di kepala Anda. Angka HLE tanpa tools Fable juga bergeser tergantung sumber: CodingFleet mencantumkan 56,8% sementara ringkasan lain menyebut 59,0%, jadi kami melaporkan rentangnya.

SWE-Bench Pro adalah benchmark yang jadi jangkar untuk coding agentik. Ia menjalankan 1.865 soal di 41 repositori aktif (menurut arXiv 2509.16941), dengan tugas yang memakan waktu berjam-jam atau berhari-hari bagi engineer senior dan membutuhkan patch multi-file. Di tes itu, 80,3% Fable 5 melawan 58,6% GPT-5.5 base adalah margin yang lebar.

Sekarang tanda bintangnya. Claude Fable 5 ditangguhkan pada Juni 2026 di bawah arahan export-control AS (sekitar 12 Juni). Jadi "Fable menang di coding" benar secara angka dan saat ini tidak relevan di kasir. Jika Anda ingin gambaran lebih dalam dari sisi Anthropic, ini ulasan lengkap Claude Fable 5 kami. Untuk model yang jadi pembanding GPT-5.5 di matematika, lihat Claude Opus 4.8.

Benchmark yang TIDAK Diterbitkan OpenAI untuk Pro

OpenAI tidak pernah merilis skor GPT-5.5 Pro untuk coding (SWE-Bench Pro), computer-use (OSWorld-Verified), cybersecurity, recall long-context, atau penalaran abstrak. Baris-baris itu kosong di tabel resmi. Kosong bukan berarti modelnya buruk di situ. Artinya tidak ada angka yang diterbitkan, dan siapa pun yang mengutip angka entah menebak atau mengutip skor base secara keliru.

Ini penting karena ini kesenjangan yang paling banyak dicari. Jika Anda mencari skor SWE-Bench Pro GPT-5.5 Pro, tidak ada. OpenAI tidak pernah menerbitkannya. Satu-satunya angka yang ada untuk benchmark itu di keluarga GPT-5.5 adalah 58,6% milik model base, dan itu angka base, bukan angka Pro. Kami menandainya begitu dengan sengaja.

Yang bisa kami katakan secara bertanggung jawab:

  • Coding (SWE-Bench Pro): Pro tidak diterbitkan. GPT-5.5 base = 58,6% (base, bukan Pro).
  • Computer-use (OSWorld-Verified): Pro tidak diterbitkan. Base = 78,7% (base, bukan Pro).
  • Cybersecurity: Pro tidak diterbitkan, tidak ada proxy base yang bisa dipakai di tabel.
  • Long-context: Pro tidak diterbitkan, tidak ada proxy base yang bisa dipakai.
  • Penalaran abstrak: Pro tidak diterbitkan.

Bisakah komputasi paralel Pro mengangkat angka-angka base itu? Mungkin, mengingat polanya di browsing dan matematika. Tapi "mungkin" bukan benchmark, dan kami tidak akan mencetak angka yang tidak diterbitkan OpenAI. Penahanan diri itulah alasan seluruh bagian ini ada.

Harga: $5/$30 vs $30/$180 vs $10/$50 — Apakah Pro Layak 6×?

GPT-5.5 Pro harganya sekitar 6× GPT-5.5 base: $30 input dan $180 output per juta token, melawan base di $5/$30. Claude Fable 5 duduk di antara keduanya di $10/$50. Layak untuk riset sulit dan matematika frontier, jarang layak untuk pekerjaan sehari-hari.

ModelInput / 1 jutaOutput / 1 jutaBiaya relatif
GPT-5.5 base$5$301× (baseline)
Claude Fable 5$10$50~2× input, ~1,7× output
GPT-5.5 Pro$30$180~6× base

Jadi siapa yang sebenarnya harus membayar premium? Vonis kasar berdasarkan pekerjaan:

  • Riset sulit, matematika frontier, browsing multi-langkah mendalam: GPT-5.5 Pro layak. Kenaikan benchmark-nya nyata dan nilai tugasnya tinggi.
  • Coding agentik di repo besar: Fable 5 jika Anda bisa mendapatkannya, kalau tidak GPT-5.5 base yang dibungkus coding scaffold. Membayar harga Pro untuk skor coding yang tidak diterbitkan adalah taruhan buruk.
  • Drafting harian, ringkasan, code review, support: GPT-5.5 base. Pengeluaran 6× nyaris tidak membeli apa-apa di sini.

Jebakannya adalah menjadikan Pro default untuk semuanya "biar aman." Di workload yang berat output, angka $180 itu berbunga cepat. Routing berdasarkan kesulitan dan Anda mempertahankan sebagian besar kualitas dengan sebagian kecil tagihan (lebih lanjut di panduan biaya API LLM kami).

Bagaimana Kami Memeriksa Angka-Angka Ini (dan Di Mana Sumber Tidak Sepakat)

Sebelum angka-angka ini masuk ke artikel, kami melakukan bagian yang tidak glamor: kami menarik tabel eval GPT-5.5 yang diterbitkan OpenAI dan mengecek setiap baris Pro terhadap pelacak independen alih-alih memercayai satu screenshot. Sumber yang kami cek silang adalah llm-stats, BenchLM, ulasan Fable 5 dari DataCamp, CodingFleet, dan paper SWE-Bench Pro di arXiv (2509.16941). Berikut yang bertahan dan yang tidak.

Sebagian besar angka utama Pro cocok dengan bersih. BrowseComp 90,1%, FrontierMath Tier 1–3 52,4% dan Tier 4 39,6%, serta harga $30/$180 semuanya cocok di setiap sumber yang kami periksa. SWE-Bench Pro 80,3% untuk Fable 5 versus 58,6% untuk GPT-5.5 base, dan FrontierCode Diamond 29,3% versus 5,7%, juga bertahan — dan jumlah soal SWE-Bench Pro (1.865 soal di 41 repositori) langsung dari paper, bukan blog vendor.

Tiga hal tidak cocok, dan Anda perlu tahu:

  • Humanity's Last Exam, dengan tools, untuk Fable 5 muncul di kisaran 56,8% sampai 59,0% tergantung sumber. Kami mengutip rentangnya alih-alih memilih favorit.
  • Angka Terminal-Bench mengambang antara versi 2.0 dan 2.1 di tabel OpenAI dan Anthropic, jadi kesenjangan GPT-5.5 (83,4%) vs Fable (88,0%) bukan perbandingan apple-to-apple yang bersih.
  • Skor Investment Banking Modeling (88,6% Pro) dilabeli "internal" oleh OpenAI, artinya tidak ada pelacak independen yang bisa mengonfirmasi. Kami menandainya sebagai klaim vendor setiap kali muncul.

Itu versi jujurnya. Angka yang kami sajikan sebagai fakta cocok di setidaknya dua sumber independen; sisanya diatribusikan ke siapa pun yang melaporkannya. Kami tidak menjalankan GPT-5.5 Pro sendiri — di $30/$180 per juta token, uji head-to-head yang serius bukan sesuatu yang akan kami palsukan, jadi kami tidak akan berpura-pura punya hasil lab yang tidak kami miliki.

Hasil Dunia Nyata yang Dilaporkan Vendor

Ini klaim vendor, bukan hasil lab independen, jadi bacalah sebagai bukti yang berdekatan dengan marketing. OpenAI dan Anthropic masing-masing menerbitkan studi kasus yang menggambarkan gambaran menguntungkan. Kami mencantumkannya dengan atribusi, dengan catatan bahwa tidak satu pun kami verifikasi.

Di sisi OpenAI, perusahaan mengatakan sebuah tim keuangan menggunakan Codex dengan GPT-5.5 untuk meninjau 24.771 formulir pajak K-1 (71.637 halaman), selesai sekitar dua minggu lebih cepat dari proses tahun sebelumnya. OpenAI juga melaporkan aplikasi aljabar-geometri yang dibangun dari satu prompt dalam 11 menit, dan analisis GPT-5.5 Pro terhadap dataset ekspresi gen yang mencakup 62 sampel dan sekitar 28.000 gen.

Di sisi Anthropic, Stripe (dilaporkan via Anthropic) menggunakan Fable 5 untuk menjalankan migrasi seluruh codebase pada codebase Ruby 50 juta baris dalam satu hari, melawan estimasi lebih dari 2 bulan secara manual. Anthropic juga mengatakan Fable 5 menyelesaikan Pokémon FireRed dari screenshot mentah, di mana model Claude sebelumnya butuh tools scaffolding tambahan, dan bahwa dengan memori berbasis file yang persisten ia memainkan Slay the Spire sekitar 3× lebih baik dari Opus 4.8.

Demo yang mengesankan, semuanya. Hanya ingat bahwa ini dipilih oleh vendor dan tidak bisa direproduksi dari press release saja.

Model Mana yang Sebenarnya Harus Anda Gunakan?

Cocokkan model dengan pekerjaannya, bukan hype-nya. Untuk coding agent dan repo besar, ambil Claude Fable 5 jika tersedia untuk Anda, dan GPT-5.5 base yang dibungkus coding scaffold jika tidak. Untuk riset, matematika frontier, dan browsing mendalam, GPT-5.5 Pro adalah pilihan. Untuk pekerjaan harian dan efisiensi biaya, GPT-5.5 base menang nilai hampir setiap saat.

Beberapa petunjuk jika Anda memilih stack, bukan satu panggilan. Jika Anda benar-benar ingin sistem coding otonom, Anda butuh tool, bukan model mentah, jadi mulai dari AI coding agent terbaik di 2026 dan ringkasan background coding agent dibandingkan untuk konteks Codex dan Devin. Penasaran ke mana keluarga ini selanjutnya? Ini yang bocor tentang GPT-5.6.

Di Techsy kami routing per tugas di seluruh pipeline agent kami, model penalaran tier atas untuk keputusan sulit dan yang lebih murah untuk sisanya, alih-alih membayar tarif premium di setiap request. Jika Anda ingin pendapat kedua tentang mix model Anda sendiri, dapatkan konsultasi gratis.

Tentang Penulis

Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya membangun AI agent, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang stack tooling LLM yang benar-benar dipakai tim Techsy di produksi. Terhubung di LinkedIn.

Pertanyaan yang Sering Diajukan

Apakah GPT-5.5 Pro layak?

Tergantung pekerjaannya. Untuk riset sulit, matematika frontier, dan browsing mendalam, kenaikan GPT-5.5 Pro atas base (BrowseComp 90,1% vs 84,4%) membenarkan harga sekitar 6× yaitu $30/$180 per juta token. Untuk drafting sehari-hari, code review, dan ringkasan, GPT-5.5 base memberi Anda kualitas yang nyaris sama dengan seperenam biaya.

Apakah GPT-5.5 Pro lebih baik dari Claude Fable 5?

Di benchmark coding yang diterbitkan, tidak: Claude Fable 5 mengalahkan GPT-5.5 base di SWE-Bench Pro (80,3% vs 58,6%), dan OpenAI tidak pernah menerbitkan skor coding Pro untuk dibandingkan. GPT-5.5 Pro menang di browsing dan matematika frontier. Satu catatan: Fable 5 saat ini ditangguhkan di bawah arahan export-control AS, jadi ketersediaan sama pentingnya dengan benchmark.

Seberapa bagus GPT-5.5 Pro di coding?

Jujur, kami tidak bisa bilang dari angka OpenAI, karena OpenAI tidak menerbitkan skor coding GPT-5.5 Pro. Satu-satunya angka coding untuk keluarga ini adalah hasil SWE-Bench Pro GPT-5.5 base yaitu 58,6%, yang tertinggal dari 80,3% Claude Fable 5. Siapa pun yang mengutip "benchmark coding Pro" kemungkinan mengutip angka base secara keliru.

GPT-5.5 Pro vs GPT-5.5 standar — mana yang harus saya gunakan?

Gunakan GPT-5.5 Pro untuk riset sulit, matematika frontier, dan browsing multi-langkah mendalam, di mana komputasi paralel ekstra membenarkan harga 6×. Gunakan GPT-5.5 base untuk pekerjaan harian, code review, dan ringkasan, di mana premium membeli sedikit. Di beberapa tes, seperti GDPval, tabel OpenAI bahkan mencantumkan Pro sedikit di bawah base.

Berapa harga GPT-5.5 Pro?

GPT-5.5 Pro harganya $30 per juta token input dan $180 per juta token output, sekitar 6× dari $5/$30 GPT-5.5 base. Sebagai perbandingan, Claude Fable 5 di $10/$50. Di workload yang berat output, premium Pro berbunga cepat, jadi routing berdasarkan kesulitan tugas alih-alih default ke Pro menghemat uang sungguhan.

Apa itu reasoning effort "xhigh"?

Reasoning effort adalah pengaturan yang mengontrol seberapa keras GPT-5.5 berpikir sebelum menjawab. "xhigh" adalah tier teratas, di mana model menggunakan komputasi test-time paralel untuk menjelajahi beberapa jalur penalaran dan memilih yang terbaik. OpenAI menjalankan eval GPT-5.5 Pro yang diterbitkan pada xhigh di lingkungan riset, yang berbeda dari default ChatGPT produksi.

Apakah GPT-5.5 Pro tersedia di Codex?

Ya. Anda bisa memanggil GPT-5.5 Pro di Codex CLI menggunakan string model gpt-5.5-pro, dan mengatur reasoning effort ke xhigh untuk perilaku komputasi tertinggi. Harapkan latensi lebih tinggi dan biaya token yang terasa lebih tinggi dari GPT-5.5 base, jadi simpan untuk tugas yang benar-benar sulit alih-alih menjadikannya model coding default Anda.

Apakah GPT-5.5 Pro model baru?

Tidak. GPT-5.5 Pro adalah model GPT-5.5 yang sama yang berjalan dengan reasoning effort lebih tinggi dan komputasi test-time paralel di pengaturan xhigh, bukan arsitektur terpisah. Ia berbagi weights yang sama dan context window yang sama yaitu sekitar 1,1 juta token input dan 128 ribu token output. Anda membayar untuk lebih banyak waktu berpikir, bukan model base yang lebih pintar.

Berapa context window GPT-5.5 Pro?

GPT-5.5 Pro membawa context window sekitar 1,1 juta token input dan 128 ribu token output, sama dengan GPT-5.5 base. Itu cukup untuk memuat codebase besar atau dokumen panjang dalam satu panggilan. Perbedaan antara Pro dan base bukan ukuran memori; melainkan seberapa banyak komputasi penalaran yang dihabiskan model sebelum menjawab.

Tag

benchmark GPT-5.5 ProGPT-5.5 Pro vs FableSWE-Bench ProBrowseCompmodel LLM

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 Resmi Hadir: Kecerdasan Setara Fable 5 dengan Harga Separuhnya

Anthropic merilis Claude Opus 5 pada 24 Juli 2026. Model ini menggandakan skor Opus 4.8 di Frontier-Bench dan mempertahankan harga Opus, tetapi kalah di beberapa uji dari Fable 5 dan Mythos 5. Berikut tabel benchmark, harga, dan rekomendasi ganti/tunggu/tetap.

10 min read baca
Baca
ai-machine-learning
Jul 20, 2026

8 API Web Scraping AI Terbaik 2026 (Diuji di Stack Agent Kami Sendiri)

Kami menguji 8 API web scraping AI dengan harga asli 2026 yang ditarik lewat stack agent kami sendiri. Firecrawl, Bright Data, ScrapingBee dan 5 lainnya, diranking untuk output siap-LLM, anti-bot, dan dukungan MCP.

9 min read baca
Baca
ai-machine-learning
Jul 20, 2026

Prompt Engineering untuk Coding: 7 Pola yang Kami Gunakan Setiap Hari di Claude Code dan Cursor (2026)

Sebagian besar artikel 'prompt coding AI' hanya memberi Anda 50 templat untuk disalin. Artikel ini mengajarkan 7 pola yang kami gunakan setiap hari untuk menjalankan pipeline Claude Code dengan 16 agen, lengkap dengan contoh sebelum dan sesudah yang nyata, serta penjelasan di mana setiap pola diterapkan di Claude Code, Cursor, dan Copilot pada tahun 2026.

11 min read baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.