Techsy
Kontak
Mulai Sekarang

Kalkulator biaya API OpenAI, Claude & Gemini

Bandingkan biaya bulanan antar penyedia dengan fitur caching dan batch savings.

Biaya API untuk GPT, Claude, dan Gemini berkisar antara $0,15 hingga $75 per juta token input, dengan token output biasanya 3–5× lebih mahal. Untuk 10 juta token/bulan, GPT-4o memakan biaya sekitar $775, Claude Sonnet 4 sekitar $1.140, dan Gemini 2.5 Pro sekitar $825. Prompt caching memangkas biaya 10× pada token yang di-cache; Batch API memangkas biaya 50% untuk pekerjaan non-realtime. Kalkulator ini membantu Anda memodelkan penggunaan secara presisi di ketiga penyedia.

Beranda/Sumber Daya/Alat/Kalkulator biaya API OpenAI, Claude & Gemini
↓ Buka kalkulator

Masukan Anda

05 fields

Estimasi biaya bulanan

● Keyakinan tinggi

SGD 63 – SGD 97

Estimasi median: SGD 74

Rincian biaya

Token input (10M × $2.50/M)SGD 34
Token output (3M × $10.00/M)SGD 41

Wajib email + nomor telepon. Panggilan review 30 menit bersama tim kami.

Lihat bagaimana tim di Singapore menaksir cakupan proyek Anda →

Untuk siapa alat ini dirancang

Pendiri yang sedang merencanakan proyek openai api sebelum berdiskusi dengan vendor. CTO dan pemimpin engineering yang menyusun anggaran tahunan untuk pengembangan produk baru. Manajer produk yang menerjemahkan ide singkat menjadi kisaran biaya yang bisa dipertanggungjawabkan kepada tim keuangan. Tim pengadaan yang memverifikasi kelayakan penawaran harga dari agensi dan kontraktor.

Bagaimana kami menghitungnya

Harga berdasarkan tarif yang dipublikasikan secara terbuka oleh OpenAI, Anthropic, dan Google per tahun 2026. Prompt caching hanya berlaku untuk token input yang di-cache (biasanya system prompt + konteks yang stabil). Batch API berlaku untuk token input maupun output pada pekerjaan non-realtime dengan SLA 24 jam.

Sumber data

  • Harga publik API OpenAI
  • Dokumentasi Batch API OpenAI
  • Harga publik API Anthropic
  • Dokumentasi prompt caching Anthropic
  • Anthropic Message Batches API
  • Harga API Google AI / Gemini
  • Dokumentasi prompt caching OpenAI

Faktor yang mempengaruhi angka

Pemilihan tier model

Model frontier seperti GPT-4.5, Claude Opus 4, dan Gemini 2.5 Pro harganya 5 hingga 10 kali lebih mahal per token dibanding model kelas menengahnya. Gunakan frontier hanya untuk tugas penalaran berat yang benar-benar gagal ditangani model kelas menengah: logika multi-langkah yang kompleks, matematika, pembuatan kode yang ambigu, atau tugas yang membutuhkan pengetahuan dunia yang mendalam. Arahkan sisanya ke Claude Sonnet 4, GPT-4o, atau Gemini Flash. Selisih biayanya cukup besar sehingga routing yang cerdas biasanya memangkas pengeluaran sebesar 60 hingga 80% pada workload campuran.

Caching prompt

Anthropic meng-cache token input selama 5 menit secara gratis atau 1 jam dengan biaya tambahan 25%, memangkas biaya token yang di-cache hingga sekitar 90%. OpenAI meng-cache secara otomatis selama 5 hingga 10 menit di endpoint tertentu tanpa perlu konfigurasi. Caching bekerja paling baik saat system prompt Anda lebih dari 2K token dan stabil di seluruh request, yang menggambarkan sebagian besar chatbot produksi dan sistem RAG. Penghematan terbesar ada pada workload dengan konteks stabil yang panjang dan banyak request per menit.

Batch API

OpenAI maupun Anthropic menawarkan endpoint batch dengan diskon tepat 50% dari harga standar sebagai ganti SLA 24 jam. Batch ideal untuk klasifikasi, pembuatan embedding, peringkasan, menjalankan evaluasi, dan pemrosesan latar belakang apa pun. Integrasinya sangat mudah: model sama, prompt sama, endpoint berbeda, ditambah antrean untuk menunggu hasil. Kebanyakan tim mengabaikan batch dan membayar harga penuh untuk workload yang tidak punya kebutuhan real-time, yang merupakan salah satu biaya AI yang paling mudah dihindari.

Token output

Token output harganya 3 hingga 5 kali lebih mahal daripada token input di semua penyedia, dan sebagian besar respons tidak butuh buffer output 4K token yang diizinkan API secara default. Jika Anda mengekstrak jawaban ya-atau-tidak, batasi output di 10 token. Jika Anda membuat ringkasan singkat, batasi di 200. Model sering kali ingin menjelaskan penalarannya bahkan saat Anda tidak memintanya, dan Anda membayar untuk penjelasan itu. Memperketat max_tokens sering memangkas biaya output 30 hingga 50% tanpa dampak pada kualitas.

Jendela konteks tidak sama dengan harga

Semua penyedia besar menghitung biaya per token yang terpakai, bukan per ukuran context window. Memakai context window 200K untuk prompt 5K token biayanya persis sama dengan memakai context window 5K untuk prompt 5K token. Artinya, model long-context tidak otomatis "lebih mahal dipakai" kecuali Anda memang memenuhi context-nya. Pilih model berdasarkan kapabilitas dan harga per token, bukan berdasarkan context window mana yang paling besar.

Cara mengurangi biaya

Aktifkan prompt caching sebagai optimasi pertama, sebelum yang lain. Untuk Anthropic, tandai system prompt yang stabil dengan header cache_control dan token yang di-cache turun ke sekitar 10% dari harga input standar. Untuk OpenAI, caching berjalan otomatis di endpoint tertentu saat prefix prompt Anda identik antar-request. Keuntungan terbesar ada di workload dengan context panjang yang stabil dan banyak request: chatbot dengan persona detail, sistem RAG dengan context retrieval yang berulang, dan loop agent apa pun yang mengirim ulang instruction set panjang. Kebanyakan tim lupa mengaktifkan caching dan akhirnya bayar 5 sampai 10 kali lebih mahal.

Pindahkan semua workload yang tidak real-time ke Batch API. Anthropic maupun OpenAI menawarkan endpoint batch di tepat 50% dari harga standar dengan SLA respons 24 jam. Pekerjaan klasifikasi, moderasi konten, pembuatan embedding, pipeline summarization, dan evaluation run semuanya cocok. Integrasinya mudah karena prompt dan model tidak berubah. Banyak tim rutin menjalankan seluruh pipeline content tagging di harga standar, padahal batch bisa memangkas tagihan setengahnya tanpa perbedaan kualitas sama sekali.

Arahkan request berdasarkan tingkat kesulitan. Query sederhana (sapaan, formatting, pencarian dasar) cocok di GPT-4o mini, Claude Haiku, atau Gemini Flash dengan harga $0,15 sampai $0,80 per juta token input. Penalaran berat cocok di Claude Opus, GPT-4.5, atau Gemini Pro dengan harga $1,25 sampai $75 per juta. Classifier kecil di depan model router biasanya memangkas biaya 60 sampai 80% di workload campuran. Mengirim semua ke model frontier adalah kesalahan biaya AI paling umum yang kami temui di produksi.

Batasi max_tokens secara agresif. Token output biayanya 3 sampai 5 kali lebih mahal dari token input, dan buffer output default 4K jauh lebih besar dari yang dibutuhkan kebanyakan respons. Batasi jawaban ya-atau-tidak di 10 token, ringkasan pendek di 200, JSON terstruktur sesuai kebutuhan schema Anda ditambah buffer kecil. Model kadang ingin menjelaskan lebih panjang meski Anda tidak memintanya, dan Anda yang bayar untuk itu. Memperketat max_tokens memangkas biaya output 30 sampai 50% di kebanyakan kasus.

Pangkas context yang di-retrieve hanya ke yang dibutuhkan per query. Sistem RAG sering mengambil 10 sampai 20 chunk dan memasukkan semuanya ke prompt untuk jaga-jaga. Hasilnya, Anda membayar ribuan token yang tidak relevan per request. Menambahkan reranker yang menyaring ke 3 sampai 5 chunk paling relevan biasanya memangkas penggunaan token input 50 sampai 70% tanpa penurunan kualitas, bahkan sering justru meningkatkan kualitas karena model tidak terganggu oleh context yang tidak relevan.

Catat setiap request beserta jumlah token, model, dan status cached versus uncached. Anda tidak bisa mengoptimalkan yang tidak bisa Anda lihat, dan biaya AI bisa berubah drastis dalam semalam saat fitur baru dirilis atau prompt diutak-atik. Pasang alert pengeluaran harian. Buat dashboard yang memecah pengeluaran per fitur, model, dan endpoint. Kebanyakan pembengkakan biaya produksi yang kami temui terjadi karena pola penggunaan berubah dua minggu sebelum ada yang melihat tagihan.

Biaya per juta token (harga 2026)

ModelInputOutputInput ter-cache
GPT-4.5$75,00$150,00$37,50
GPT-4o$2,50$10,00$1,25
GPT-4o mini$0,15$0,60$0,075
Claude Opus 4$15,00$75,00$1,50
Claude Sonnet 4$3,00$15,00$0,30
Claude Haiku 4$0,80$4,00$0,08
Gemini 2.5 Pro$1,25$10,00N/A
Gemini 2.5 Flash$0,075$0,30N/A

FAQ

Pertanyaan yang sering kami terima setiap minggu

Jawaban singkat dengan bahasa yang mudah dipahami. Jika pertanyaan Anda tidak ada di sini,

GPT-4o: $2,50 per juta token input, $10 output. GPT-4o mini: $0,15/juta input, $0,60 output. GPT-4.5: $75/juta input, $150 output. Pada 10 juta token per bulan dengan rasio input/output 30/70, perkirakan $25–$13 ribu tergantung model.

Untuk sebagian besar beban kerja: GPT-4o mini, Gemini 2.5 Flash, atau Claude Haiku 4; semuanya di bawah $1 per juta token input. Untuk keseimbangan kualitas dan harga: Claude Sonnet 4 atau Gemini 2.5 Pro.

Anthropic dan OpenAI menyimpan cache prompt input besar antar permintaan. Token yang di-cache biayanya sekitar 90% lebih murah dibanding yang tidak. Paling cocok untuk chatbot dengan system prompt stabil atau RAG dengan konteks yang stabil.

Tepat 50% untuk token input maupun output. Syaratnya, Anda harus menerima SLA 24 jam. Cocok untuk klasifikasi, peringkasan, embedding, dan evaluasi. Tidak cocok untuk chat real-time atau UX interaktif.

Pada tier kualitas yang sebanding, biayanya mirip. Claude Sonnet 4 versus GPT-4o kurang lebih setara. Claude Opus 4 dengan prompt caching sekitar 30% lebih murah dari GPT-4o untuk beban kerja dengan prompt stabil.

(1) Aktifkan prompt caching. (2) Gunakan Batch API jika memungkinkan. (3) Arahkan kueri sederhana ke model mini. (4) Batasi max_tokens secara agresif. (5) Pangkas konteks retrieval ke hal-hal esensial.

Titik impas ada di sekitar $5 ribu per bulan untuk pengeluaran API. Di bawah itu: tetap gunakan API. Di atasnya: self-hosting Llama 3.1 atau Mistral memangkas biaya 50–70% jika Anda memiliki keahlian infrastruktur.

Ambil sampel 100 request yang representatif. Ukur rata-rata token input dan output. Kalikan dengan volume request bulanan. Kalikan dengan biaya per juta token. Tambahkan margin aman 30%.

Hanya untuk penalaran berat yang gagal ditangani model kelas menengah. Untuk 80% workload produksi, Sonnet 4, GPT-4o, atau Gemini 2.5 Pro sudah memadai dengan biaya 10× lebih murah.

Dalam kisaran ±15% untuk workload tipikal. Variasi di dunia nyata berasal dari perbedaan panjang prompt, perbedaan panjang output, loop error dan retry, serta logika routing. Gunakan kalkulator ini sebagai alat perencanaan, bukan tagihan final.

Alat serupa

Kalkulator lain yang biasanya dibuka setelah ini; pilih yang paling sesuai dengan keputusan Anda selanjutnya.

Kalkulator biaya integrasi AI
Kalkulator biaya integrasi AI

Biaya pengembangan ditambah biaya operasional bulanan; gambaran lengkapnya.

Buka kalkulator

Dapatkan estimasi presisi dari tim kami

Kalkulator memberikan kisaran biaya. Panggilan 30 menit memberikan cakupan, jadwal, dan anggaran yang tetap. Konsultasi gratis tanpa kewajiban.

Mulai percakapan

Terbaru dari library

Sumber daya

Lihat semua
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Sumber daya

Lihat semua
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Sumber Daya
  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Sumber Daya
  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.