Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
guides

Perbandingan Harga API LLM 2026: Setiap Model Utama, Dihitung

Ditulis oleh Mert Batur Gürbüz
Diperbarui Jul 18, 2026
10 baca
Daftar Isi
Perbandingan Harga API LLM 2026: Setiap Model Utama, Dihitung

Perbandingan Harga API LLM 2026: Setiap Model Utama, Dihitung

Perbandingan harga API LLM terdengar sederhana sampai Anda mencoba membuatnya: harga berubah dua kali dalam paruh pertama tahun 2026, setiap penyedia menetapkan harga input dan output secara berbeda, dan angka "utama" jarang sekali sesuai dengan tagihan aktual Anda. Jadi, kami mengambil setiap angka di bawah ini langsung dari halaman harga resmi pada 14 Juli 2026, dan melakukan perhitungan untuk beban kerja nyata di bagian akhir.

Tabel Lengkap Harga API LLM (2026)

Berikut adalah seluruh lapangan dalam satu layar, dengan harga per 1 juta token dalam USD. Ini adalah tabel yang sering di-screenshot orang, jadi kami menampilkannya pertama.

ModelInputOutputCached InputKonteks
Claude Opus 4.8$5.00$25.00$0.501Jt
Claude Sonnet 5$3.00$15.00$0.301Jt
Claude Haiku 4.5$1.00$5.00$0.10200Rb
Claude Fable 5$10.00$50.00$1.001Jt
GPT-5.6 Sol$5.00$30.00$0.501.05Jt
GPT-5.6 Terra$2.50$15.00$0.251.05Jt
GPT-5.6 Luna$1.00$6.00$0.101.05Jt
GPT-5.4 nano$0.20$1.25$0.021.1Jt
Gemini 2.5 Pro$1.25$10.00$0.311Jt
Gemini 2.5 Flash$0.30$2.50$0.031Jt
Gemini 2.5 Flash-Lite$0.10$0.40$0.011Jt
DeepSeek-V4$0.14$0.28$0.0031Jt
Zhipu GLM-4.6$0.43$1.74n/a205Rb
Alibaba Qwen3-Max$1.20$6.00n/a262Rb
Mistral Medium 3.5$1.50$7.50n/a128Rb
Mistral Large 3$0.50$1.50n/a128Rb
Mistral Small 4$0.15$0.60n/a32Rb

Dua catatan kaki yang penting. Claude Sonnet 5 berada pada harga perkenalan sebesar $2.00 input / $10.00 output per juta hingga 31 Agustus 2026, setelah itu kembali ke harga $3.00 / $15.00 seperti yang ditunjukkan di atas. Dan Gemini 2.5 Pro melonjak menjadi $2.50 input / $15.00 output begitu satu prompt tunggal melampaui 200K token, sehingga harga "daftar"-nya sebenarnya adalah batas bawah.

Setiap model di sini juga menawarkan Batch API dengan diskon flat 50% baik untuk input maupun output (Anthropic, OpenAI, Google, dan Alibaba), yang akan kami masukkan ke dalam contoh perhitungan di bawah ini.

Apa yang Sebenarnya Anda Bayarkan

Tiga angka mendorong tagihan Anda, dan sebagian besar halaman harga mengubur dua di antaranya.

  • Token input adalah segala sesuatu yang Anda kirim: prompt sistem, riwayat percakapan, konteks yang diambil, pertanyaan pengguna. Pada aplikasi chat dan RAG, ini biasanya merupakan bagian yang lebih besar.
  • Token output adalah apa yang dihasilkan model, dan harganya 3-6x lebih mahal daripada input di hampir setiap penyedia. GPT-5.6 Terra membebankan $2.50 untuk input dan $15.00 untuk output, pengali 6x. Respons yang bertele-tele merugikan.
  • Cached input adalah faktor tersembunyi. Jika Anda mengirim prompt sistem yang sama pada setiap permintaan, caching prompt menagih token berulang tersebut dengan tarif sekitar 10% dari tarif normal. Lihat kolom "Cached Input" di atas: Claude Opus 4.8 turun dari $5.00 menjadi $0.50. Pada aplikasi dengan lalu lintas tinggi, satu kolom itu menentukan apakah tagihan Anda $10K atau $3K. Panduan caching prompt kami mencakup pengaturan untuk setiap penyedia.

Intinya: perbandingan "harga input" mentah menyesatkan. Model dengan harga termurah bisa kalah oleh model yang sedikit lebih mahal namun memiliki caching yang lebih baik, dan model dengan harga output yang paling menakutkan bisa menjadi yang termurah jika tugas Anda hanya mengembalikan jawaban dua kata.

Model Termurah untuk Pekerjaan Volume Tinggi

Jika Anda memproses jutaan token untuk tugas-tugas seperti klasifikasi, ekstraksi, ringkasan, atau moderasi, bagian bawah tabel adalah tempat uang itu berada.

  • DeepSeek-V4 adalah batas harga terendah di $0.14 input / $0.28 output. Tarif input cache-hit-nya sekitar $0.003 per juta hampir gratis. Pada konteks 1Jt token dengan output maksimal 384K, ia menangani sebagian besar pekerjaan non-frontier dengan nyaman.
  • Gemini 2.5 Flash-Lite di $0.10 / $0.40 adalah jawaban Google, dengan konteks 1Jt yang sama dan ekosistem yang matang.
  • Zhipu GLM-4.6 di $0.43 / $1.74 berada di tengah dan merupakan model coding yang kuat. Jika Anda menggunakannya secara intensif untuk pengembangan, langganan coding-plan GLM dapat mengalahkan harga per-token secara langsung.
  • Mistral Small 4 di $0.15 / $0.60 adalah opsi termurah dengan residensi data UE, yang penting untuk beban kerja yang diatur.

Kesenjangan antara tingkat ini dan model unggulan tidak halus. Harga output DeepSeek-V4 lebih dari 50x lebih murah daripada GPT-5.6 Sol. Untuk tugas apa pun di mana model open-weights tingkat menengah memenuhi standar kualitas Anda, selisih tersebut adalah tuas terbesar pada tagihan Anda.

Tingkat Unggulan, Dibandingkan

Ketika tugas benar-benar membutuhkan penalaran frontier (agen kompleks, kode sulit, analisis mendalam), Anda memilih antara empat model. Berikut cara mereka berbaris berdasarkan harga untuk kelas kecerdasan yang sama:

UnggulanInputOutputKonteksCatatan
GPT-5.6 Sol$5.00$30.001.05JtHarga output tertinggi dari keempatnya
Claude Opus 4.8$5.00$25.001JtSama dengan Sol pada input, output lebih murah
Claude Fable 5$10.00$50.001JtPaling mampu dari Anthropic, harga di atas Opus
Gemini 2.5 Pro$1.25$10.001JtUnggulan termurah, tetapi naik tingkat di atas 200K

Di atas kertas, Gemini 2.5 Pro adalah tawaran terbaik di grup, sekitar seperempat dari harga output Sol. Masalahnya adalah penalti konteks panjangnya: melewati 200K token dalam satu prompt dan seluruh permintaan dihargai ulang menjadi $2.50 / $15.00. Untuk agen yang memasukkan konteks besar, itu menghapus sebagian besar keunggulan, jadi hitung ukuran prompt aktual Anda sebelum memutuskan.

Claude Fable 5 adalah pengecualian dalam hal biaya. Ia diposisikan di atas tingkat Opus untuk penalaran jangka panjang yang paling menuntut, jadi ini adalah model "gunakan ketika kebenaran lebih penting daripada biaya" yang disengaja, bukan default.

Biaya Tersembunyi yang Tidak Dimasukkan Siapa Pun ke Dalam Tabel

Perbandingan per-token melewatkan empat hal yang menggerakkan tagihan nyata:

  1. Tingkat konteks panjang. Gemini 2.5 Pro (di atas 200K) dan GPT-5.6 (di atas sekitar 272K) membebankan 1.5-2x begitu prompt menjadi besar. Jika Anda mengerjakan dokumen panjang, tarif efektif Anda adalah yang bertingkat.
  2. Premium penulisan cache. Anthropic membebankan 1.25x untuk menulis cache (2x untuk TTL 1 jam) sebelum Anda mendapatkan tarif baca 0.1x. Ini menguntungkan setelah dua permintaan, tetapi beban kerja dengan repetisi rendah dapat membayar premium penulisan dan tidak pernah mendapat manfaatnya.
  3. Batch vs real-time. Diskon batch 50% adalah uang gratis jika beban kerja Anda dapat menunggu 24 jam. Sebagian besar tim memiliki lalu lintas yang memenuhi syarat untuk batch lebih banyak daripada yang mereka kira (pekerjaan malam, pengisian ulang, moderasi).
  4. Penyedia yang tidak ada dalam daftar. Untuk volume yang sangat tinggi, hosting mandiri model open-source pada GPU sewaan dapat undercut setiap tarif API di sini. Panduan menjalankan LLM secara lokal kami membahas kapan matematika itu berubah.

Harga Per Tugas, Bukan Per Token: Pekerjaan Nyata

Harga per-token bersifat abstrak. Jadi kami menjalankan satu yang nyata. Pada Juni 2026, kami mendorong batch ringkasan 50 dokumen (sekitar 1.2Jt token input dan 120Rb token output) melalui lima model dan mencatat tagihan aktualnya:

ModelBiaya Real-timeDengan Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (intro)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n/a
DeepSeek-V4$0.20n/a

50 dokumen yang sama, prompt yang sama. Tagihan berkisar dari $4.80 hingga $0.20, selisih 24x pada pekerjaan yang identik, sebelum batching. Setelah kami memindahkan penyedia yang memenuhi syarat batch ke antrean malam hari mereka, Gemini 2.5 Flash mendarat di 33 sen. Untuk ringkasan, di mana perbedaan kualitas antara model-model ini berada dalam margin kesalahan kami, keputusan itu bernilai ribuan dolar sebulan dalam skala besar.

Pelajarannya: perbandingan yang tepat selalu biaya per tugas, dihitung berdasarkan rasio input/output nyata Anda, bukan harga stiker dari satu token. Model dengan output mahal murah untuk ekstraksi; model dengan input murah mahal untuk generasi panjang.

Model Mana yang Termurah untuk Kasus Penggunaan Anda?

Versi singkat, dihitung dari tabel di atas:

  • Chatbot dan RAG (input panjang, output pendek): harga input dan caching mendominasi. Gemini 2.5 Flash dan DeepSeek-V4 menang; tambahkan caching prompt pada whichever yang Anda pilih.
  • Generasi bentuk panjang (input pendek, output panjang): harga output mendominasi. Gemini 2.5 Flash-Lite dan DeepSeek-V4 adalah yang termurah; hindari GPT-5.6 Sol kecuali Anda membutuhkan penalarannya.
  • Agen dan penggunaan alat (konteks besar, banyak giliran): perhatikan tingkat konteks panjang. Claude Opus 4.8 dan GPT-5.6 Terra dapat diprediksi; Gemini 2.5 Pro termurah hanya jika Anda tetap di bawah 200K.
  • Coding: GLM-4.6 dan langganan coding-plan-nya, atau Claude Opus 4.8 untuk masalah tersulit.
  • Penalaran frontier di mana kebenaran mengalahkan biaya: Claude Opus 4.8 atau Claude Fable 5.

Apa pun pilihan Anda, arahkan melalui gateway sehingga mengganti penyedia adalah perubahan konfigurasi, bukan penulisan ulang. Perbandingan alat gateway LLM terbaik kami mencakup opsi-opsinya, dan jika Anda ingin panduan lengkap untuk menurunkan tagihan, lihat panduan kami tentang mengurangi biaya API LLM. Untuk pendalaman khusus Gemini dengan tarif multimodal dan audio yang tidak dicakup tabel ini, lihat rincian harga API Gemini kami.

Bagaimana Techsy Memilih Model untuk Klien

Kami membangun sistem AI produksi untuk klien B2B, dan pemilihan model adalah salah satu keputusan pertama yang kami buat, biasanya sebelum satu baris kode ditulis. Pendekatan kami membosankan dengan sengaja: kami memprofilkan rasio input/output nyata dari beban kerja, menghitung harga tiga kandidat teratas berdasarkan rasio itu (bukan harga stiker), menjalankannya terhadap set evaluasi untuk memastikan kesetaraan kualitas, kemudian menghubungkan model termurah yang lolos di belakang gateway sehingga kami dapat menilai ulang harganya setiap kuartal saat model baru diluncurkan. Langkah terakhir itu lebih penting daripada memilih model "terbaik" hari ini, karena harga yang Anda lihat di atas akan salah dalam tiga bulan.

Jika Anda memilih model atau menatap tagihan yang terus meningkat, itulah jenis keputusan yang kami bantu. Jelajahi layanan integrasi AI kami atau pesan tinjauan arsitektur gratis.

Pertanyaan yang Sering Diajukan

Apa API LLM termurah di 2026?

DeepSeek-V4 adalah model capable termurah di $0.14 input / $0.28 output per juta token pada Juli 2026, dengan input cache-hit mendekati $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) dan Mistral Small 4 ($0.15 / $0.60) berada di dekatnya. Untuk pekerjaan kualitas frontier, Gemini 2.5 Pro adalah unggulan termurah.

Apakah GPT-5.6 atau Claude Opus 4.8 lebih mahal?

Mereka sama pada input ($5.00/Jt) tetapi Claude Opus 4.8 lebih murah pada output ($25.00/Jt vs $30.00/Jt GPT-5.6 Sol). Untuk beban kerja yang berat output, Opus 4.8 menang dalam harga; untuk yang berat input, mereka secara efektif seri sebelum caching.

Mengapa output lebih mahal daripada input?

Menghasilkan token lebih intensif komputasi daripada membacanya, sehingga hampir setiap penyedia membebankan 3-6x lebih mahal untuk output. Inilah mengapa memotong panjang respons (dan menggunakan output terstruktur) menghemat lebih banyak per token daripada memotong prompt Anda.

Berapa banyak penghematan sebenarnya dari caching prompt?

Token input cached ditagih sekitar 10% dari tarif standar di Anthropic, OpenAI, dan Google, diskon 90% pada bagian prompt yang berulang. Untuk aplikasi yang mengirim prompt sistem yang sama pada setiap permintaan, caching sering memotong total tagihan 30-50%.

Apakah harga ini termasuk diskon Batch API?

Tidak. Tabel utama menunjukkan harga real-time standar. Anthropic, OpenAI, Google, dan Alibaba semuanya menawarkan Batch API dengan diskon flat 50% pada input dan output untuk beban kerja non-mendesak yang dapat mentolerir latensi hingga 24 jam.

Apakah DeepSeek benar-benar jauh lebih murah daripada model AS?

Ya, di atas kertas. Harga output DeepSeek-V4 ($0.28/Jt) lebih dari 50x lebih murah daripada GPT-5.6 Sol ($30/Jt). Trade-off-nya adalah bahwa model frontier AS masih memimpin dalam tugas penalaran tersulit, sehingga sebagian besar tim melakukan arbitrase pada tugas-tugas di mana kesetaraan kualitas berlaku dan menyimpan unggulan untuk sisanya.

Apa jebakan dengan harga rendah Gemini 2.5 Pro?

Tingkat konteks panjangnya. Gemini 2.5 Pro terdaftar di $1.25 / $10.00, tetapi setiap prompt tunggal di atas 200K token menghargai ulang seluruh permintaan menjadi $2.50 / $15.00. Jika prompt Anda besar, angarkan tarif bertingkat, bukan headline.

Seberapa sering harga API LLM berubah?

Sering. Harga bergeser dua kali dalam paruh pertama 2026, dan keluarga model baru (seperti tingkat GPT-5.6 yang diluncurkan 9 Juli 2026) mengatur ulang lapangan setiap kali. Selalu konfirmasi terhadap halaman harga resmi penyedia sebelum berkomitmen pada beban kerja, dan nilai ulang setiap kuartal.

Model mana yang memiliki jendela konteks terbesar untuk harganya?

DeepSeek-V4 dan keluarga Gemini 2.5 menawarkan konteks 1Jt token di ujung bawah kisaran harga. Model GPT-5.6 sedikit lebih tinggi di 1.05Jt, dan GPT-5.4 nano mencapai 1.1Jt hanya dengan $0.20 input, menjadikannya opsi konteks besar termurah untuk tugas sederhana.

Tentang Penulis

Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomatisasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang tumpukan alat LLM yang benar-benar digunakan tim Techsy dalam produksi. Terhubung di LinkedIn.

Sumber

  • Harga API Anthropic Claude (diakses 2026-07-14)
  • Harga API OpenAI (diakses 2026-07-14)
  • Harga API Google Gemini (diakses 2026-07-14)
  • Harga API DeepSeek (diakses 2026-07-14)
  • Harga Alibaba Cloud Model Studio (diakses 2026-07-14)
  • Harga API Mistral (diakses 2026-07-14)
  • Harga Z.AI (Zhipu GLM) (diakses 2026-07-14)

Tag

perbandingan harga api llmharga llmharga gpt-5.6harga claudeharga geminiharga deepseekbiaya per token

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di guides

guides
Apr 12, 2026

Panduan Surfer SEO 2026: Editor Konten, Skor NLP, dan Pencarian AI

Panduan praktis Surfer SEO yang mencakup alur kerja Content Editor, sistem penilaian NLP, AI Tracker untuk optimasi GEO, dan otomatisasi API. Berdasarkan pengujian pada lebih dari 50 artikel.

14 min read baca
Baca
guides
Apr 12, 2026

Panduan Semrush 2026: Setiap Alat Dijelaskan (Dengan Contoh)

Panduan praktis Semrush yang mencakup riset kata kunci, audit situs, analisis kompetitif, pelacakan Visibilitas AI, dan pengaturan server MCP. Termasuk contoh kode dan alur kerja dari pipa SEO nyata.

14 min read baca
Baca
guides
Apr 12, 2026

Panduan Screaming Frog 2026: Audit SEO Teknis dengan Integrasi AI

Panduan praktis untuk Screaming Frog SEO Spider yang mencakup pengaturan, audit teknis, ekstraksi XPath kustom, pola regex, dan fitur integrasi AI yang tidak dibahas panduan lain. Termasuk pembaruan v23 dan 15+ cuplikan kode siap pakai.

14 min read baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.