
Berapa Biaya Inferensi LLM? Rincian 4 Skenario dengan Hitungan Riil
GPT-4 dibanderol $30 per juta token input pada Maret 2023. Tiga tahun kemudian, GPT-5.6 memproses juta token yang sama seharga $10. Claude Opus 4.5 di angka $15. Harga termurah? Dua sen. Artinya ada rentang 1.500x antara opsi termurah dan termahal untuk unit kerja yang persis sama. Biaya inferensi LLM adalah tagihan berulang yang kamu bayar setiap kali model terlatih membaca input-mu dan menghasilkan output, dan semua provider besar mematoknya per juta token. Model kelas budget berjalan di $0,02-$0,30 per juta token input. Model frontier menarik $15-$75 untuk volume yang sama. Jarak ini penting, karena workload-mu, bukan ambisimu, yang menentukan kelas mana yang benar-benar kamu butuhkan.
Poin Penting:
- Model kelas budget berharga $0,02-$0,30 per juta token input; model frontier $15-$75 (Juli 2026).
- Token output 3-5x lebih mahal daripada token input karena generasi berjalan berurutan, bukan paralel.
- Chatbot support dengan 50 ribu percakapan menghabiskan sekitar $9-$420/bulan tergantung kelas model.
- Harga inferensi turun sekitar 10x per tahun; Gartner memproyeksikan 90% lebih murah pada 2030.
Berapa Biaya Inferensi LLM Per Juta Token?
Harga inferensi LLM mengikuti struktur tiga kelas per Juli 2026. Model budget dari provider seperti Google (Gemini 2.5 Flash) dan opsi open-source (Llama 4, Qwen 3) mematok $0,02-$0,30 per juta token input. Model kelas menengah (GPT-4.1, Claude Sonnet 4) mendarat di antara $0,55 dan $15. Model reasoning frontier (o3, Claude Opus 4.5) meminta $15-$75. Semua provider mempublikasikan tarif ini di halaman harga resmi mereka (OpenAI, Anthropic), dan PricePerToken.com melacak 300+ model dalam grid live.
Per Juli 2026, kamu bisa memproses sejuta token input hanya dengan dua sen, atau membayar tujuh puluh lima dolar untuk sejuta token yang sama di model frontier.
| Kelas | Contoh Model | Input $/Jt Token | Output $/Jt Token | Input Cache $/Jt | Paling Cocok Untuk |
|---|---|---|---|---|---|
| Budget | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0,02-$0,30 | $0,06-$1,20 | $0,01-$0,15 | Klasifikasi volume tinggi, routing |
| Menengah | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0,55-$15 | $2,20-$60 | $0,28-$7,50 | RAG, generasi kode, analisis |
| Frontier | o3, Claude Opus 4.5 | $15-$75 | $60-$300 | $7,50-$37,50 | Reasoning kompleks, riset |
Diskon input-cache memangkas tagihanmu 50-90% pada prompt berulang (prompt caching memangkas biaya input menjelaskan mekanismenya). Untuk grid live 300 model dengan tarif terkini semua provider, lihat tabel harga per-token lengkap kami.
Apa yang Menentukan Biaya Inferensi LLM? 4 Komponennya
Tagihan inferensimu terbagi menjadi empat pendorong biaya: waktu komputasi GPU per token, memori untuk bobot model dan KV cache, asimetri input/output yang membuat generasi lebih mahal daripada membaca, dan overhead infrastruktur (listrik, pendinginan, jaringan). Memahami komponen mana yang mendominasi workload-mu menunjukkan di mana optimasi sepadan.
| Komponen | Apa Itu | Porsi Tagihanmu | Yang Memengaruhinya |
|---|---|---|---|
| Komputasi (waktu GPU) | FLOP untuk memproses tiap token melewati lapisan model | 40-60% | Ukuran model, ukuran batch, tingkat kuantisasi |
| Memori (bobot + KV cache) | VRAM yang menampung parameter model dan state atensi | 20-35% | Panjang konteks, request bersamaan |
| Asimetri input/output | Fase decode berjalan berurutan, satu token per langkah | Sudah masuk harga output | Panjang output, strategi sampling |
| Overhead infrastruktur | Listrik, pendinginan, jaringan, waktu GPU menganggur | 10-20% | Lokasi data center, tingkat utilisasi |
Komputasi: Waktu GPU Per Token
Setiap token melewati setiap lapisan model. Model 70B parameter di FP16 butuh sekitar 140 GFLOP per token. Kuantisasi ke INT4 memangkasnya menjadi ~35 GFLOP. Panduan benchmark inferensi NVIDIA mengurai rumus TCO lengkapnya: amortisasi hardware plus listrik plus overhead operasional, dibagi token yang disajikan.
Memori: Bobot Model + KV Cache
Model 70B di FP16 memakan ~140 GB VRAM hanya untuk bobot. KV cache tumbuh seiring panjang konteks dan ukuran batch bersamaan. Pada konteks 128K dengan 32 request bersamaan, kamu bisa membakar 80 GB tambahan. Inilah mengapa kebutuhan VRAM per model sangat penting untuk keputusan self-hosting.
Asimetri Input vs Output
Token output 3-5x lebih mahal daripada token input karena model menghasilkannya satu per satu, secara berurutan. Ia tidak bisa memparalelkan seperti saat membaca prompt-mu.
Versi sederhananya: membaca prompt 2.000 token-mu (fase "prefill") memproses semua token secara bersamaan di seluruh core GPU. Menghasilkan 500 token output (fase "decode") berjalan satu token per langkah, masing-masing bergantung pada sebelumnya. GPU sebagian besar menganggur menunggu bandwidth memori antar langkah. Waktu menganggur itulah yang kamu bayar dengan tarif 3-5x lipat dari tarif input.
Overhead Infrastruktur
Listrik, pendinginan, jaringan, dan GPU yang menganggur di antara request. Dokumentasi optimasi Hugging Face membahas bagaimana continuous batching dan speculative decoding memeras lebih banyak token per jam-GPU dari hardware yang sama, yang langsung memangkas porsi overhead ini.
Berapa Biaya Inferensi LLM untuk 4 Workload Riil?
Chatbot support tipikal menghabiskan $9-$420/bulan, pipeline RAG berjalan $168-$3.360/bulan, asisten kode untuk 200 developer menagih $123-$2.078/bulan, dan pemrosesan dokumen batch mendarat di antara $240 dan $6.400/bulan. Rentangnya hampir sepenuhnya bergantung pada pilihan kelas model. Kami menyusun empat skenario ini dari volume token deployment klien kami, dihargai terhadap halaman resmi Juli 2026. Setiap angka dolar di bawah ini bisa direproduksi: asumsi token yang dinyatakan dikalikan tarif yang dipublikasikan. Analisis kami, bukan klaim vendor.
Chatbot Customer Support: 50 Ribu Percakapan/Bulan
Percakapan rata-rata: 800 token input (system prompt + pesan user + konteks yang diambil), 400 token output. Volume bulanan: 50.000 percakapan = 40 juta token input, 20 juta token output.
- Pilihan budget (Gemini 2.5 Flash): 40 juta × $0,075/juta + 20 juta × $0,30/juta = $9/bulan. Murah sampai hampir mencurigakan.
- Pilihan menengah (Claude Sonnet 4): 40 juta × $3/juta + 20 juta × $15/juta = $420/bulan.
Untuk bot support yang menangani tiket tier-1, model budget menangani 90% query dengan baik. Arahkan 10% yang sulit ke kelas menengah dengan classifier.
Pipeline RAG: 10 Ribu Query/Hari
Query rata-rata: 3.200 token input (chunk yang diambil + system prompt + pertanyaan user), 600 token output. Bulanan: 300 ribu query = 960 juta token input, 180 juta token output.
- Pilihan budget (Llama 4 Scout via API): 960 juta × $0,10/juta + 180 juta × $0,40/juta = $168/bulan.
- Pilihan menengah (GPT-4.1): 960 juta × $2/juta + 180 juta × $8/juta = $3.360/bulan.
Workload RAG berat di input, jadi diskon input-cache sangat terasa di sini. Dengan prompt caching 70%, kelas menengah turun ke ~$2.100/bulan.
Asisten Kode: 200 Developer
Sesi rata-rata: 4.500 token input (konteks file + percakapan), 1.200 token output. Asumsikan 15 request/developer/hari, 22 hari kerja = 66.000 request/bulan = 297 juta input, 79 juta output.
- Pilihan budget (Qwen 3 32B): 297 juta × $0,20/juta + 79 juta × $0,80/juta = $123/bulan.
- Pilihan menengah (Claude Sonnet 4): 297 juta × $3/juta + 79 juta × $15/juta = $2.078/bulan.
Developer cepat menyadari perbedaan kualitas. Untuk kode, kelas menengah biasanya jadi lantai minimum. Model budget cocok untuk saran gaya autocomplete, tapi kewalahan dengan refactor multi-file.
Pemrosesan Dokumen Batch: 1 Juta Dokumen/Bulan
Dokumen rata-rata: 2.000 token input, 300 token output (ekstraksi, klasifikasi, ringkasan). Bulanan: 2 miliar input, 300 juta output.
- Pilihan budget (Gemini 2.5 Flash): 2 miliar × $0,075/juta + 300 juta × $0,30/juta = $240/bulan.
- Pilihan menengah (GPT-4.1): 2 miliar × $2/juta + 300 juta × $8/juta = $6.400/bulan.
Pada volume ini, jarak harga 27x antar kelas adalah pos biaya $6.160/bulan. Model budget menangani ekstraksi terstruktur dengan baik. Untuk ukuran hardware jika kamu mempertimbangkan self-hosting volume ini, cek kebutuhan VRAM per model.
| Workload | Model | Token/Request (In/Out) | Request/Bulan | $/Bulan |
|---|---|---|---|---|
| Chatbot support | Gemini 2.5 Flash | 800 / 400 | 50 ribu | $9 |
| Chatbot support | Claude Sonnet 4 | 800 / 400 | 50 ribu | $420 |
| Pipeline RAG | Llama 4 Scout | 3.200 / 600 | 300 ribu | $168 |
| Pipeline RAG | GPT-4.1 | 3.200 / 600 | 300 ribu | $3.360 |
| Asisten kode | Qwen 3 32B | 4.500 / 1.200 | 66 ribu | $123 |
| Asisten kode | Claude Sonnet 4 | 4.500 / 1.200 | 66 ribu | $2.078 |
| Dokumen batch | Gemini 2.5 Flash | 2.000 / 300 | 1 juta | $240 |
| Dokumen batch | GPT-4.1 | 2.000 / 300 | 1 juta | $6.400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI atau Self-Hosted: Kapan Masing-Masing Menang?
API menang di bawah ~20 ribu request/hari atau ketika timmu tidak punya pengalaman infrastruktur ML. Self-hosted menang di atas 200 ribu request/hari dengan utilisasi GPU berkelanjutan di atas 50%. Titik impasnya, menurut analisis Introl, mendarat di sekitar 50-80 ribu request/hari untuk model kelas 70B di satu node H100. Di bawah ambang itu, efisiensi multi-tenant provider API mengalahkan hitungan hardware single-tenant-mu.
| Level Volume | API $/Bulan | Self-Hosted $/Bulan (GPU + Ops) | Pemenang | Kenapa |
|---|---|---|---|---|
| Rendah: 2 ribu req/hari | $150-$400 | $2.800-$4.500 | API | GPU menganggur 85% waktu |
| Sedang: 20 ribu req/hari | $1.500-$4.000 | $3.200-$5.000 | API (tipis) | Utilisasi ~40%, masih di bawah impas |
| Tinggi: 200 ribu req/hari | $15.000-$40.000 | $5.500-$8.000 | Self-hosted | Utilisasi 70%+ mengamortisasi hardware dengan cepat |
Kapan API Menang
Kamu rilis dalam hitungan hari, bukan minggu. Tanpa gaji ML engineer ($180 ribu-$250 ribu/tahun), tanpa giliran on-call untuk kegagalan GPU, tanpa perencanaan kapasitas. Untuk kebanyakan tim di bawah 50 engineer, API adalah default yang tepat. Titik.
Kapan Self-Hosted Menang
Kamu sudah lewat 200 ribu request/hari, workload-mu bisa diprediksi, dan kamu sudah mempekerjakan orang infrastruktur ML. Model open-source (Llama 4, Qwen 3, Mistral) berjalan di hardware-mu dengan biaya listrik plus amortisasi. Benchmark vLLM vs SGLang menunjukkan perbedaan throughput 15-30% tergantung bentuk workload, yang berarti banyak pada skala ini.
Angka Titik Impas
Self-hosted hanya menang di atas utilisasi GPU berkelanjutan ~50%. Di bawah itu, kamu membayar silikon yang menganggur. Biaya orang-orang yang tersembunyi (waktu ML engineer, on-call, pembaruan model, patch keamanan) adalah alasan sebenarnya kebanyakan tim tetap di API bahkan ketika hitungan GPU mentah terlihat menguntungkan. Jika kamu tetap self-host, deploy model di Modal menghilangkan lapisan manajemen infrastruktur sambil menjaga biaya per-token di bawah tarif API.
Biaya Tersembunyi yang Tidak Dianggarkan Siapa Pun
Pengeluaran token mentah adalah 60-80% dari tagihan riilmu. Sisanya bersembunyi di enam pos yang tidak pernah muncul di kalkulator harga. Anggarkan tambahan 20-40% di atas estimasi token-mu untuk menutupinya.
- Tool monitoring dan observabilitas: $200-$1.500/bulan. Dashboard penggunaan token, pelacakan latensi, atribusi biaya per fitur. Stack observabilitas LLM balik modal begitu kamu menangkap regresi prompt sebelum membakar anggaranmu.
- Retry dan pengulangan gagal: 3-8% request gagal atau perlu diulang (timeout, rate limit, output cacat). Itu 3-8% dari tagihan token-mu, habis tanpa menghasilkan apa-apa.
- Jam iterasi prompt engineering: 20-60 jam per kuartal dengan biaya engineering terbebani $100-$200/jam. Setiap tweak prompt menjalankan ulang batch uji.
- Eval dan uji regresi: $100-$800/bulan dalam pengeluaran token untuk suite eval otomatis. Kamu membayar model untuk menilai dirinya sendiri.
- Redundansi multi-region: biaya infrastruktur 1,5-2x jika kamu butuh failover antar region untuk latensi atau kepatuhan.
- Penalti latensi cold-start: Deployment GPU serverless (Modal, AWS Lambda) menagih waktu menganggur. Cold start menambah 2-8 detik dan menagihmu untuk pemanasan.
Aturan praktisnya: kalikan estimasi token mentahmu dengan 1,3 untuk anggaran yang realistis. Kalikan dengan 1,4 jika kamu di industri teregulasi dengan overhead kepatuhan.
Kenapa Inferensi LLM Terus Menjadi Lebih Murah?
Harga inferensi LLM sudah turun sekitar 10x per tahun sejak 2023. Workload yang menghabiskan $1.000/bulan pada 2024 kini mendekati $100. Tiga kekuatan mendorong ini: perbaikan hardware (NVIDIA Blackwell FP4, Google TPU v6), tekanan kompetisi (DeepSeek, model open-source yang memaksa perang harga), dan optimasi software (speculative decoding, continuous batching, kuantisasi). Gartner memproyeksikan biaya inferensi turun 90% lagi pada 2030, meski itu proyeksi, bukan jaminan.
Pelacakan harga Epoch AI mendokumentasikan penurunan ini dengan titik data keras. Analisis "LLMflation" a16z menciptakan istilah ini dan membingkai implikasi ekonominya: inferensi mengalami deflasi lebih cepat daripada kategori komputasi mana pun sebelumnya.
Biaya Training vs Inferensi
Training model frontier menghabiskan $50 juta-$200 juta (sekali saja). Inferensi untuk model yang sama, di semua user, berjalan $5 juta-$50 juta per tahun tergantung skala. Untuk kebanyakan tim, rasionya 10-100x: training memakan biaya 10-100 kali lipat dari inferensi setahun. Tapi training adalah pengeluaran modal sekali waktu. Inferensi adalah tagihan operasional berulang yang membengkak seiring pertumbuhan user. Kamu tidak membayar training kecuali kamu membangun foundation model. Kamu membayar inferensi setiap hari.
Pos Biaya Energi
NVIDIA H100 menarik ~700W di bawah beban. Pada $0,10/kWh (rata-rata AS), itu $0,07 per jam-GPU. Model 70B di satu H100 menghasilkan sekitar 2.000 token output/detik saat batch. Selama satu jam: 7,2 juta token. Biaya listrik per juta token output: ~$0,01. Perhitungan kami, diberi label demikian. Energi adalah 1-3% dari tagihan API-mu tapi 8-15% dari TCO self-hosted. Ini lebih berarti jika kamu menjalankan GPU sendiri di region berlistrik mahal (Jerman di $0,30/kWh melipatgandakan angka ini tiga kali).
Pelajaran praktisnya: harga turun cukup cepat sehingga komitmen 12 bulan ke kelas model tertentu itu berisiko. Evaluasi ulang tiap kuartal. 12 cara memangkas tagihan LLM membahas langkah taktis yang bisa kamu ambil sekarang, sementara tren makro melakukan pekerjaan beratnya.
Bagaimana Kamu Memperkirakan Biaya Inferensimu SENDIRI?
Perkirakan biaya inferensi LLM bulananmu dalam empat langkah: hitung token per request, kalikan dengan volume bulanan, terapkan harga kelas, lalu tambah overhead 20-40%. Dari pengalaman kami menyusun anggaran inferensi untuk klien, kebanyakan tim melewatkan langkah keempat dan bertanya-tanya kenapa tagihan aktual mereka melebihi estimasi sepertiganya. Beginilah proses yang kami pakai.
- Hitung token per request. Log rata-rata token input (system prompt + konteks + pesan user) dan token output (respons model) dari 100+ request riil. Jangan menebak. Ukur.
- Kalikan dengan volume bulanan. Request/hari × 30 = request bulanan. Kalikan dengan jumlah token per request-mu.
- Terapkan harga kelas. Kalikan total token input dengan tarif $/juta input model. Begitu juga output. Jumlahkan.
- Tambah overhead 20-40%. Retry, eval, iterasi prompt, monitoring. Inilah angka yang masuk anggaranmu, bukan langkah 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthBegitu kamu tahu angkamu, tool gateway LLM merutekan trafik ke model termurah yang lolos standar kualitasmu. Gateway dengan pemilihan model per-request bisa memangkas biaya campuranmu 30-50% tanpa menyentuh prompt-mu.
Tentang Penulis
Mert Batur adalah Co-Founder Techsy.io, tempat timnya merilis AI agent, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia menulis tentang stack tooling LLM yang benar-benar dipakai tim Techsy di produksi. Terhubung di LinkedIn.
Pertanyaan yang Sering Diajukan
Apakah inferensi LLM mahal?
Tergantung skala dan pilihan model. Sejuta token input berharga $0,02 di Gemini 2.5 Flash atau $75 di model reasoning frontier. Untuk aplikasi kecil yang memproses 10 ribu request/hari, perkirakan $50-$400/bulan. Untuk workload enterprise di 1 juta+ request/hari, anggaran berjalan $5.000-$40.000/bulan. Biaya per unitnya rendah; volumenya yang membuatnya menumpuk.
Berapa banyak 1 juta token dalam LLM?
Satu juta token setara sekitar 750.000 kata, atau sekitar 10 novel penuh. Pada Juli 2026, memproses 1 juta token input berharga $0,02 (kelas budget) hingga $75 (kelas frontier). Token output untuk volume yang sama berjalan $0,06 hingga $300. Kebanyakan workload produksi mendarat di kelas menengah: $2-$15 per juta token input.
Kenapa inferensi AI begitu mahal?
Inferensi mengharuskan setiap token melewati miliaran parameter model di GPU yang masing-masing berharga $25.000-$40.000. Fase decode menghasilkan token secara berurutan, membuat core GPU menganggur di antara langkah. Kamu membayar hardware khusus, listrik, pendinginan, dan tim engineering provider yang menjaga stack serving berjalan 24/7.
Apakah biaya inferensi AI turun?
Ya, sekitar 10x per tahun sejak 2023. GPT-4 meluncur di $30/$60 per juta token (input/output). Kemampuan setara kini berharga $2-$10. Data Epoch AI mengonfirmasi lintasan ini di semua provider. Gartner memproyeksikan penurunan 90% lagi pada 2030, didorong perbaikan hardware dan tekanan kompetisi dari model open-source.
Berapa biaya inferensi LLM pada 2026?
Model budget: $0,02-$0,30 per juta token input. Kelas menengah: $0,55-$15. Frontier: $15-$75. Workload produksi tipikal (chatbot support, pipeline RAG, atau asisten kode) menghabiskan $150-$4.000/bulan di model kelas menengah. Model budget menangani tugas volume tinggi, kompleksitas rendah dengan 10-30x lebih murah.
Apa perbedaan biaya training dan biaya inferensi?
Training adalah pengeluaran sekali waktu untuk mengajarkan model dari nol: $50 juta-$200 juta untuk model frontier, membutuhkan ribuan GPU selama berbulan-bulan. Inferensi adalah biaya berulang menggunakan model terlatih itu: menjalankan input melaluinya untuk mendapat output, ditagih per token. Untuk kebanyakan tim, inferensi adalah satu-satunya tagihan yang mereka bayar. Training untuk perusahaan yang membangun foundation model.
Bagaimana cara menghitung biaya inferensi LLM untuk aplikasiku?
Kalikan rata-rata token input per request dengan volume request bulananmu, lalu dengan tarif $/juta input model. Ulangi untuk token output. Jumlahkan keduanya. Tambah 30% untuk overhead retry, eval, dan monitoring. Snippet Python di artikel ini mengotomatiskan hitungannya. Ukur jumlah token riil alih-alih menebak; log dari 100+ request memberi rata-rata yang andal.
Apakah token output lebih mahal daripada token input?
Ya, biasanya 3-5x lebih mahal. Pemrosesan input (prefill) memparalelkan semua token secara bersamaan, memakai core GPU sepenuhnya. Generasi output (decode) menghasilkan satu token per langkah, masing-masing bergantung pada sebelumnya. GPU menunggu bandwidth memori di antara langkah. Provider mematok output lebih tinggi untuk mencerminkan efisiensi hardware yang lebih rendah ini.
Apakah inferensi self-hosted lebih murah daripada memakai API?
Hanya di atas ~200 ribu request/hari dengan utilisasi GPU berkelanjutan di atas 50%. Di bawah itu, efisiensi multi-tenant provider API mengalahkan hardware single-tenant-mu. Self-hosting juga menambah biaya tersembunyi: gaji ML engineer ($180 ribu-$250 ribu/tahun), giliran on-call, pembaruan model, dan patch keamanan. Kebanyakan tim di bawah 50 engineer sebaiknya tetap di API.
Apakah inferensi LLM memakai banyak energi?
GPU H100 menarik ~700W di bawah beban. Pada $0,10/kWh, itu $0,07/jam-GPU, yang berarti sekitar $0,01 per juta token output untuk model 70B. Energi adalah 1-3% dari tagihan API tapi 8-15% dari TCO self-hosted. Di region berlistrik mahal (Jerman, $0,30/kWh), porsi energi naik tiga kali lipat dan memengaruhi ekonomi self-hosting secara material.
Intinya
Empat angka untuk diingat: $0,02 (lantai budget per juta token input), 3-5x (premium output atas input), 20-40% (overhead untuk ditambah di atas hitungan token mentah), dan 10x (penurunan harga tahunan sejak 2023). Tagihan aktualmu tergantung pada volume, kelas model, dan seberapa agresif kamu melakukan cache, batch, dan merutekan trafik.
Di Techsy, tim kami menyusun anggaran inferensi dan memilih kelas model untuk klien B2B yang menjalankan workload LLM produksi. Jika kamu ingin pendapat kedua tentang model biayamu, dapatkan konsultasi gratis.