
Perbandingan Harga API LLM 2026: Setiap Model Utama, Dihitung
Perbandingan harga API LLM terdengar sederhana sampai Anda mencoba membuatnya: harga berubah dua kali dalam paruh pertama tahun 2026, setiap penyedia menetapkan harga input dan output secara berbeda, dan angka "utama" jarang sekali sesuai dengan tagihan aktual Anda. Jadi, kami mengambil setiap angka di bawah ini langsung dari halaman harga resmi pada 14 Juli 2026, dan melakukan perhitungan untuk beban kerja nyata di bagian akhir.
Tabel Lengkap Harga API LLM (2026)
Berikut adalah seluruh lapangan dalam satu layar, dengan harga per 1 juta token dalam USD. Ini adalah tabel yang sering di-screenshot orang, jadi kami menampilkannya pertama.
| Model | Input | Output | Cached Input | Konteks |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1Jt |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1Jt |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200Rb |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1Jt |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05Jt |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05Jt |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05Jt |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1Jt |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1Jt |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1Jt |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1Jt |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1Jt |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205Rb |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262Rb |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128Rb |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128Rb |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32Rb |
Dua catatan kaki yang penting. Claude Sonnet 5 berada pada harga perkenalan sebesar $2.00 input / $10.00 output per juta hingga 31 Agustus 2026, setelah itu kembali ke harga $3.00 / $15.00 seperti yang ditunjukkan di atas. Dan Gemini 2.5 Pro melonjak menjadi $2.50 input / $15.00 output begitu satu prompt tunggal melampaui 200K token, sehingga harga "daftar"-nya sebenarnya adalah batas bawah.
Setiap model di sini juga menawarkan Batch API dengan diskon flat 50% baik untuk input maupun output (Anthropic, OpenAI, Google, dan Alibaba), yang akan kami masukkan ke dalam contoh perhitungan di bawah ini.
Apa yang Sebenarnya Anda Bayarkan
Tiga angka mendorong tagihan Anda, dan sebagian besar halaman harga mengubur dua di antaranya.
- Token input adalah segala sesuatu yang Anda kirim: prompt sistem, riwayat percakapan, konteks yang diambil, pertanyaan pengguna. Pada aplikasi chat dan RAG, ini biasanya merupakan bagian yang lebih besar.
- Token output adalah apa yang dihasilkan model, dan harganya 3-6x lebih mahal daripada input di hampir setiap penyedia. GPT-5.6 Terra membebankan $2.50 untuk input dan $15.00 untuk output, pengali 6x. Respons yang bertele-tele merugikan.
- Cached input adalah faktor tersembunyi. Jika Anda mengirim prompt sistem yang sama pada setiap permintaan, caching prompt menagih token berulang tersebut dengan tarif sekitar 10% dari tarif normal. Lihat kolom "Cached Input" di atas: Claude Opus 4.8 turun dari $5.00 menjadi $0.50. Pada aplikasi dengan lalu lintas tinggi, satu kolom itu menentukan apakah tagihan Anda $10K atau $3K. Panduan caching prompt kami mencakup pengaturan untuk setiap penyedia.
Intinya: perbandingan "harga input" mentah menyesatkan. Model dengan harga termurah bisa kalah oleh model yang sedikit lebih mahal namun memiliki caching yang lebih baik, dan model dengan harga output yang paling menakutkan bisa menjadi yang termurah jika tugas Anda hanya mengembalikan jawaban dua kata.
Model Termurah untuk Pekerjaan Volume Tinggi
Jika Anda memproses jutaan token untuk tugas-tugas seperti klasifikasi, ekstraksi, ringkasan, atau moderasi, bagian bawah tabel adalah tempat uang itu berada.
- DeepSeek-V4 adalah batas harga terendah di $0.14 input / $0.28 output. Tarif input cache-hit-nya sekitar $0.003 per juta hampir gratis. Pada konteks 1Jt token dengan output maksimal 384K, ia menangani sebagian besar pekerjaan non-frontier dengan nyaman.
- Gemini 2.5 Flash-Lite di $0.10 / $0.40 adalah jawaban Google, dengan konteks 1Jt yang sama dan ekosistem yang matang.
- Zhipu GLM-4.6 di $0.43 / $1.74 berada di tengah dan merupakan model coding yang kuat. Jika Anda menggunakannya secara intensif untuk pengembangan, langganan coding-plan GLM dapat mengalahkan harga per-token secara langsung.
- Mistral Small 4 di $0.15 / $0.60 adalah opsi termurah dengan residensi data UE, yang penting untuk beban kerja yang diatur.
Kesenjangan antara tingkat ini dan model unggulan tidak halus. Harga output DeepSeek-V4 lebih dari 50x lebih murah daripada GPT-5.6 Sol. Untuk tugas apa pun di mana model open-weights tingkat menengah memenuhi standar kualitas Anda, selisih tersebut adalah tuas terbesar pada tagihan Anda.
Tingkat Unggulan, Dibandingkan
Ketika tugas benar-benar membutuhkan penalaran frontier (agen kompleks, kode sulit, analisis mendalam), Anda memilih antara empat model. Berikut cara mereka berbaris berdasarkan harga untuk kelas kecerdasan yang sama:
| Unggulan | Input | Output | Konteks | Catatan |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05Jt | Harga output tertinggi dari keempatnya |
| Claude Opus 4.8 | $5.00 | $25.00 | 1Jt | Sama dengan Sol pada input, output lebih murah |
| Claude Fable 5 | $10.00 | $50.00 | 1Jt | Paling mampu dari Anthropic, harga di atas Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1Jt | Unggulan termurah, tetapi naik tingkat di atas 200K |
Di atas kertas, Gemini 2.5 Pro adalah tawaran terbaik di grup, sekitar seperempat dari harga output Sol. Masalahnya adalah penalti konteks panjangnya: melewati 200K token dalam satu prompt dan seluruh permintaan dihargai ulang menjadi $2.50 / $15.00. Untuk agen yang memasukkan konteks besar, itu menghapus sebagian besar keunggulan, jadi hitung ukuran prompt aktual Anda sebelum memutuskan.
Claude Fable 5 adalah pengecualian dalam hal biaya. Ia diposisikan di atas tingkat Opus untuk penalaran jangka panjang yang paling menuntut, jadi ini adalah model "gunakan ketika kebenaran lebih penting daripada biaya" yang disengaja, bukan default.
Biaya Tersembunyi yang Tidak Dimasukkan Siapa Pun ke Dalam Tabel
Perbandingan per-token melewatkan empat hal yang menggerakkan tagihan nyata:
- Tingkat konteks panjang. Gemini 2.5 Pro (di atas 200K) dan GPT-5.6 (di atas sekitar 272K) membebankan 1.5-2x begitu prompt menjadi besar. Jika Anda mengerjakan dokumen panjang, tarif efektif Anda adalah yang bertingkat.
- Premium penulisan cache. Anthropic membebankan 1.25x untuk menulis cache (2x untuk TTL 1 jam) sebelum Anda mendapatkan tarif baca 0.1x. Ini menguntungkan setelah dua permintaan, tetapi beban kerja dengan repetisi rendah dapat membayar premium penulisan dan tidak pernah mendapat manfaatnya.
- Batch vs real-time. Diskon batch 50% adalah uang gratis jika beban kerja Anda dapat menunggu 24 jam. Sebagian besar tim memiliki lalu lintas yang memenuhi syarat untuk batch lebih banyak daripada yang mereka kira (pekerjaan malam, pengisian ulang, moderasi).
- Penyedia yang tidak ada dalam daftar. Untuk volume yang sangat tinggi, hosting mandiri model open-source pada GPU sewaan dapat undercut setiap tarif API di sini. Panduan menjalankan LLM secara lokal kami membahas kapan matematika itu berubah.
Harga Per Tugas, Bukan Per Token: Pekerjaan Nyata
Harga per-token bersifat abstrak. Jadi kami menjalankan satu yang nyata. Pada Juni 2026, kami mendorong batch ringkasan 50 dokumen (sekitar 1.2Jt token input dan 120Rb token output) melalui lima model dan mencatat tagihan aktualnya:
| Model | Biaya Real-time | Dengan Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (intro) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
50 dokumen yang sama, prompt yang sama. Tagihan berkisar dari $4.80 hingga $0.20, selisih 24x pada pekerjaan yang identik, sebelum batching. Setelah kami memindahkan penyedia yang memenuhi syarat batch ke antrean malam hari mereka, Gemini 2.5 Flash mendarat di 33 sen. Untuk ringkasan, di mana perbedaan kualitas antara model-model ini berada dalam margin kesalahan kami, keputusan itu bernilai ribuan dolar sebulan dalam skala besar.
Pelajarannya: perbandingan yang tepat selalu biaya per tugas, dihitung berdasarkan rasio input/output nyata Anda, bukan harga stiker dari satu token. Model dengan output mahal murah untuk ekstraksi; model dengan input murah mahal untuk generasi panjang.
Model Mana yang Termurah untuk Kasus Penggunaan Anda?
Versi singkat, dihitung dari tabel di atas:
- Chatbot dan RAG (input panjang, output pendek): harga input dan caching mendominasi. Gemini 2.5 Flash dan DeepSeek-V4 menang; tambahkan caching prompt pada whichever yang Anda pilih.
- Generasi bentuk panjang (input pendek, output panjang): harga output mendominasi. Gemini 2.5 Flash-Lite dan DeepSeek-V4 adalah yang termurah; hindari GPT-5.6 Sol kecuali Anda membutuhkan penalarannya.
- Agen dan penggunaan alat (konteks besar, banyak giliran): perhatikan tingkat konteks panjang. Claude Opus 4.8 dan GPT-5.6 Terra dapat diprediksi; Gemini 2.5 Pro termurah hanya jika Anda tetap di bawah 200K.
- Coding: GLM-4.6 dan langganan coding-plan-nya, atau Claude Opus 4.8 untuk masalah tersulit.
- Penalaran frontier di mana kebenaran mengalahkan biaya: Claude Opus 4.8 atau Claude Fable 5.
Apa pun pilihan Anda, arahkan melalui gateway sehingga mengganti penyedia adalah perubahan konfigurasi, bukan penulisan ulang. Perbandingan alat gateway LLM terbaik kami mencakup opsi-opsinya, dan jika Anda ingin panduan lengkap untuk menurunkan tagihan, lihat panduan kami tentang mengurangi biaya API LLM. Untuk pendalaman khusus Gemini dengan tarif multimodal dan audio yang tidak dicakup tabel ini, lihat rincian harga API Gemini kami.
Bagaimana Techsy Memilih Model untuk Klien
Kami membangun sistem AI produksi untuk klien B2B, dan pemilihan model adalah salah satu keputusan pertama yang kami buat, biasanya sebelum satu baris kode ditulis. Pendekatan kami membosankan dengan sengaja: kami memprofilkan rasio input/output nyata dari beban kerja, menghitung harga tiga kandidat teratas berdasarkan rasio itu (bukan harga stiker), menjalankannya terhadap set evaluasi untuk memastikan kesetaraan kualitas, kemudian menghubungkan model termurah yang lolos di belakang gateway sehingga kami dapat menilai ulang harganya setiap kuartal saat model baru diluncurkan. Langkah terakhir itu lebih penting daripada memilih model "terbaik" hari ini, karena harga yang Anda lihat di atas akan salah dalam tiga bulan.
Jika Anda memilih model atau menatap tagihan yang terus meningkat, itulah jenis keputusan yang kami bantu. Jelajahi layanan integrasi AI kami atau pesan tinjauan arsitektur gratis.
Pertanyaan yang Sering Diajukan
Apa API LLM termurah di 2026?
DeepSeek-V4 adalah model capable termurah di $0.14 input / $0.28 output per juta token pada Juli 2026, dengan input cache-hit mendekati $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) dan Mistral Small 4 ($0.15 / $0.60) berada di dekatnya. Untuk pekerjaan kualitas frontier, Gemini 2.5 Pro adalah unggulan termurah.
Apakah GPT-5.6 atau Claude Opus 4.8 lebih mahal?
Mereka sama pada input ($5.00/Jt) tetapi Claude Opus 4.8 lebih murah pada output ($25.00/Jt vs $30.00/Jt GPT-5.6 Sol). Untuk beban kerja yang berat output, Opus 4.8 menang dalam harga; untuk yang berat input, mereka secara efektif seri sebelum caching.
Mengapa output lebih mahal daripada input?
Menghasilkan token lebih intensif komputasi daripada membacanya, sehingga hampir setiap penyedia membebankan 3-6x lebih mahal untuk output. Inilah mengapa memotong panjang respons (dan menggunakan output terstruktur) menghemat lebih banyak per token daripada memotong prompt Anda.
Berapa banyak penghematan sebenarnya dari caching prompt?
Token input cached ditagih sekitar 10% dari tarif standar di Anthropic, OpenAI, dan Google, diskon 90% pada bagian prompt yang berulang. Untuk aplikasi yang mengirim prompt sistem yang sama pada setiap permintaan, caching sering memotong total tagihan 30-50%.
Apakah harga ini termasuk diskon Batch API?
Tidak. Tabel utama menunjukkan harga real-time standar. Anthropic, OpenAI, Google, dan Alibaba semuanya menawarkan Batch API dengan diskon flat 50% pada input dan output untuk beban kerja non-mendesak yang dapat mentolerir latensi hingga 24 jam.
Apakah DeepSeek benar-benar jauh lebih murah daripada model AS?
Ya, di atas kertas. Harga output DeepSeek-V4 ($0.28/Jt) lebih dari 50x lebih murah daripada GPT-5.6 Sol ($30/Jt). Trade-off-nya adalah bahwa model frontier AS masih memimpin dalam tugas penalaran tersulit, sehingga sebagian besar tim melakukan arbitrase pada tugas-tugas di mana kesetaraan kualitas berlaku dan menyimpan unggulan untuk sisanya.
Apa jebakan dengan harga rendah Gemini 2.5 Pro?
Tingkat konteks panjangnya. Gemini 2.5 Pro terdaftar di $1.25 / $10.00, tetapi setiap prompt tunggal di atas 200K token menghargai ulang seluruh permintaan menjadi $2.50 / $15.00. Jika prompt Anda besar, angarkan tarif bertingkat, bukan headline.
Seberapa sering harga API LLM berubah?
Sering. Harga bergeser dua kali dalam paruh pertama 2026, dan keluarga model baru (seperti tingkat GPT-5.6 yang diluncurkan 9 Juli 2026) mengatur ulang lapangan setiap kali. Selalu konfirmasi terhadap halaman harga resmi penyedia sebelum berkomitmen pada beban kerja, dan nilai ulang setiap kuartal.
Model mana yang memiliki jendela konteks terbesar untuk harganya?
DeepSeek-V4 dan keluarga Gemini 2.5 menawarkan konteks 1Jt token di ujung bawah kisaran harga. Model GPT-5.6 sedikit lebih tinggi di 1.05Jt, dan GPT-5.4 nano mencapai 1.1Jt hanya dengan $0.20 input, menjadikannya opsi konteks besar termurah untuk tugas sederhana.
Tentang Penulis
Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomatisasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang tumpukan alat LLM yang benar-benar digunakan tim Techsy dalam produksi. Terhubung di LinkedIn.
Sumber
- Harga API Anthropic Claude (diakses 2026-07-14)
- Harga API OpenAI (diakses 2026-07-14)
- Harga API Google Gemini (diakses 2026-07-14)
- Harga API DeepSeek (diakses 2026-07-14)
- Harga Alibaba Cloud Model Studio (diakses 2026-07-14)
- Harga API Mistral (diakses 2026-07-14)
- Harga Z.AI (Zhipu GLM) (diakses 2026-07-14)