ai-machine-learning

Monitoring Biaya LLM: Lacak Pengeluaran Sebelum Melonjak (2026)

Ditulis oleh Mert Batur
Diperbarui Jul 31, 2026
12 baca
Monitoring Biaya LLM: Lacak Pengeluaran Sebelum Melonjak (2026)

Monitoring Biaya LLM: Lacak Pengeluaran Sebelum Melonjak (2026)

Monitoring biaya LLM adalah pembeda antara tagihan kejutan $412 dan notifikasi Slack di 80% anggaran. Claude Sonnet 5 bulan ini mematok tarif $3,00 per juta token input, dan satu loop agen yang lepas kendali bisa menghabisinya dalam satu sore. Kebanyakan tim memasang pelacakan dalam sehari; alert justru bagian yang mereka lewati.

Poin-Poin Utama:

  • Monitoring biaya LLM menempelkan jumlah token dan estimasi dolar ke setiap request, lalu mengagregasinya per model dan tim.
  • Lacak lima metrik: token per request, biaya per fitur/tim/model, rasio cache hit, biaya per percakapan, dan tingkat lonjakan.
  • Anggaran LiteLLM, trace Langfuse, atau Datadog LLM Observability masing-masing memberi visibilitas pengeluaran dalam waktu kurang dari sehari.
  • Dashboard menampilkan estimasi; harga input ter-cache dan diskon batch membuat tagihan biasanya mendarat di bawahnya.

Apa Sebenarnya yang Dilacak Monitoring Biaya LLM?

Monitoring biaya LLM adalah praktik menempelkan jumlah token dan estimasi dolar ke setiap request LLM, lalu mengagregasi estimasi itu per model, fitur, dan tim agar pengeluaran bisa diberi alert sebelum tagihan tiba. Estimasi dihitung per request dari harga token yang dipublikasikan, digulung berdasarkan tag apa pun yang kamu tempelkan ke panggilan itu, dan dibandingkan dengan anggaran yang ditetapkan di awal.

Matematika di baliknya netral vendor. Respons penggunaan dari setiap provider memecah token menjadi beberapa field, dan dokumentasi biaya Datadog mendokumentasikan hubungan itu secara eksplisit. Konvensi semantik OpenTelemetry GenAI menstandarkan field-field yang sama lintas vendor, jadi dashboard yang dibangun di atasnya tidak terkunci ke satu provider.

FieldYang dihitungTarif tagihan
input_tokensSemua yang kamu kirim: system prompt, riwayat, konteks yang diambil, pertanyaannyaTarif input dasar
output_tokensSemua yang dihasilkan modelTarif output dasar (3-6x input)
cache_read_tokensInput yang dipakai ulang dari cache sebelumnya0,1x-0,25x dari input dasar
cache_write_tokensInput yang pertama kali ditulis ke cache~1,25x input dasar (TTL 5 menit Anthropic)
reasoning_tokensChain-of-thought internal, bagian dari outputTarif output

Tiga hubungan mengerjakan sebagian besar pekerjaan: total token = input + output; input = non-cache + cache_read + cache_write; dan token reasoning duduk di dalam output, pada tarif output. Benarkan itu dan estimasi per request tetap dekat; abaikan dan dashboard akan menyimpang dari tagihan setiap bulan. Monitoring biaya adalah satu pilar dari observabilitas AI; tracing dan eval adalah dua pilar lainnya, dan ketiganya berbagi kosakata field yang sama.

Dashboard-mu menampilkan estimasi; tagihan adalah satu-satunya metrik biaya yang tidak pernah ter-cache.

Berapa harga 1 juta token di LLM?

Tergantung model dan arahnya: 1 juta token berharga $0,14 sebagai input DeepSeek-V4 dan $15,00 sebagai output GPT-5.6 Terra, rentang 100x untuk satuan yang sama. Berikut empat model dari riset harga kami pada 14 Juli 2026, diverifikasi terhadap halaman resmi:

ModelInput / 1 juta tokenOutput / 1 juta tokenInput ter-cache / 1 juta token
Claude Sonnet 5$3,00$15,00$0,30
GPT-5.6 Terra$2,50$15,00$0,25
Gemini 2.5 Pro$1,25$10,00$0,31
DeepSeek-V4$0,14$0,28$0,003

Sumber: harga OpenAI dan harga Anthropic. Satu catatan kaki: Claude Sonnet 5 menjalankan harga perkenalan $2,00 input / $10,00 output hingga 31 Agustus 2026, lalu kembali ke angka di atas.

5 Metrik yang Benar-Benar Penting

Lima metrik mencakup pelacakan biaya LLM, dan kebanyakan tim hanya pernah memberi alert pada dua di antaranya. Mulailah dari dua baris pertama: token per request menangkap prompt bloat di hari kemunculannya, dan biaya per tim adalah angka yang pada akhirnya diminta finance. Tiga lainnya memperjelas gambaran setelah keduanya terpasang.

MetrikCara menghitungnyaKenapa pentingAmbang alert
Token per requestJumlahkan input + output per panggilan, kelompokkan per fiturPrompt bloat dan context stuffing muncul di sini lebih dulu+30% di atas median 7 hari
Biaya per fitur / tim / modelJumlahkan estimasi biaya, kelompokkan per tag atau virtual keyDasar chargeback unit dan anggaran yang benar-benar berjalan80% anggaran bulanan
Rasio cache hitcache_read / total token inputRasio rendah berarti kamu bayar harga penuh untuk prompt yang diulangDi bawah 50% pada trafik stabil
Biaya per percakapan / sesiJumlahkan biaya di seluruh turn dalam satu sesiMenyingkap agen multi-turn yang lepas kendali, yang luput dari tampilan per request2x sesi persentil ke-90
Tingkat lonjakan / anomaliPerubahan pengeluaran total hari-ke-hariSatu-satunya metrik yang menangkap loop rusak sebelum tagihan+50% hari ke hari

Satu catatan granularitas: Datadog menyimpan biaya level request dalam nanodolar (miliaran dolar) menurut dokumentasi biaya-nya. Pada $0,14 per juta token, satu request DeepSeek-V4 bisa berharga kurang dari seperseribu sen, jadi agregasi dulu sebelum membulatkan, atau trafik model kecil menghilang dari laporan.

Jika kamu tidak melacak hal lain, lacak baris satu dan dua. Token per request adalah peringatan paling awal yang kamu dapat; biaya per tim adalah yang bertahan saat berhadapan dengan departemen akuntansi.

Tiga Cara Memasang Monitoring Biaya LLM

Tidak satu pun dari halaman peringkat teratas untuk kueri ini mengirimkan satu baris kode yang bisa dijalankan, jadi berikut tiga setup yang berfungsi. Masing-masing live dalam waktu kurang dari sehari, dan bisa digabung: kami menjalankan dua yang pertama bersamaan.

Yang benar-benar kami jalankan di produksi: dalam setup kami, setiap agen klien berbicara ke proxy LiteLLM melalui virtual key-nya sendiri, dengan anggaran bulanan di setiap key dan Langfuse men-trace setiap request di belakang proxy. Saat kami men-deploy keduanya bersamaan, pembagian kerja adalah intinya: proxy menegakkan batas, dan trace menjelaskan apa yang menghabiskannya. Setiap key klien kami juga membawa tpm_limit 100.000 token per menit sebagai sekering kedua; berdasarkan dokumentasi LiteLLM, proxy menolak request setelah limit tercapai, dan perilaku terdokumentasi itulah yang kami andalkan, bukan benchmark yang kami ukur sendiri. Konfigurasi kami melewati LiteLLM 1.82.7 dan 1.82.8 sepenuhnya, dua versi yang tersangkut insiden rantai pasokan Maret 2026, dan mem-pin tag image alih-alih mengambang di latest.

Proxy LiteLLM: virtual key + anggaran

Techsy menjalankan setup proxy LiteLLM di produksi dengan satu virtual key per klien dan anggaran bulanan di setiap key. Request di bawah adalah bentuk terdokumentasi dari dokumentasi virtual_keys LiteLLM: berdasarkan dokumentasi itu, begitu pengeluaran kumulatif pada key ini melewati $50 dalam sebulan, proxy menolak request selanjutnya dengan error budget-exceeded alih-alih mencatat peringatan setelah kejadian.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Lakukan aritmetika terhadap harga yang dipublikasikan: pada $3,00 / $15,00 per juta token milik Claude Sonnet 5, $50 membeli sekitar 16,7 juta token input atau 3,3 juta token output, kira-kira seminggu trafik untuk salah satu agen klien kami yang lebih ringan. Itulah radius ledak yang kami inginkan. tpm_limit adalah sekering kedua: loop yang lepas kendali memicu 100 ribu token per menit jauh sebelum memicu anggaran bulanan. Atribusi per pengguna bekerja dengan cara yang sama melalui endpoint users, dan panduan kami tentang alat gateway LLM terbaik membahas kapan proxy layak mendapat tempat versus kapan ia hanya hop tambahan.

Langfuse: tracing biaya @observe

Autocomplete Google memasangkan "langfuse monitoring" dengan kueri ini, dan ada alasannya: Langfuse adalah default tracing open source. SDK Python-nya membungkus klien provider-mu sehingga setiap panggilan menjadi trace yang membawa jumlah token dan biaya terhitung, menurut dokumentasi tracing Langfuse:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Biaya mendarat di trace tanpa hitungan token di sisimu; kelompokkan trace per session atau user id untuk gulungan per fitur, dan self-host jika data tidak boleh keluar dari jaringanmu.

Datadog LLM Observability: jika kamu sudah memakainya

Jika timmu sudah mengirimkan agen Datadog, dokumentasi biaya LLM-nya adalah referensi tunggal terdalam di halaman ini: biaya level request dalam nanodolar, cost_tags kustom untuk rincian tim dan fitur, dan bagian pemecahan masalah sungguhan untuk celah biaya parsial. Batas jujurnya: hanya Datadog. Metriknya tidak keluar dari platform, dan tidak ada cadangan open source jika harganya berhenti cocok. Pilih untuk konsolidasi, bukan untuk fleksibilitas.

Bagaimana Memasang Anggaran, Alert, dan Chargeback?

Kamu memasangnya dalam tiga lapisan: batas anggaran yang menolak request pada limit, alert webhook yang menyala pada ambang persentase sebelum batas, dan virtual key per tim yang mengubah showback dan chargeback menjadi kueri alih-alih perdebatan. LiteLLM mengirimkan ketiganya secara native; polanya bisa dipindahkan ke gateway mana pun dengan anggaran level key.

Anggaran yang hanya menghitung adalah laporan; anggaran yang menolak request pada batas adalah kontrol.

Alert yang menyala sebelum lonjakan

Atur alert di 80% batas, bukan di 100%. LiteLLM mengirimkan alerting Slack bawaan: atur alerting: ["slack"] dan alerting_threshold: 80 di general_settings, arahkan environment variable SLACK_WEBHOOK_URL ke sebuah channel, dan pesan seperti ini mendarat saat sebuah key melewati ambang:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

Di 80%, manusia masih punya beberapa hari untuk bertindak: turunkan model, perketat prompt, atau naikkan batas dengan nama pada persetujuannya. Alert di 100% adalah otopsi.

Dari showback ke chargeback

Showback berarti setiap tim melihat pengeluarannya sendiri; chargeback berarti itu keluar dari anggaran mereka. Keduanya berjalan dengan satu bahan: virtual key per tim, diberi tag saat pembuatan. Laporan bulanan kemudian menjadi group-by di atas tabel pengeluaran:

TimAnggaran bulananPengeluaran sejauh iniStatus
search$50$40,18alert menyala di 80%
support-chat$200$112,40sesuai jalur
evals-batch$30$29,97batas tercapai, menolak
sandbox$10$1,06sesuai jalur

Format contoh, bukan data klien. Baris evals-batch adalah pola yang bekerja sebagaimana mestinya: pekerjaan batch berjalan sampai batasnya dan berhenti, alih-alih diam-diam berdarah ke tagihan. Perilaku penegakan didokumentasikan di dokumentasi virtual_keys LiteLLM, termasuk bagaimana durasi anggaran direset.

Kenapa Dashboard-mu Tidak Cocok dengan Tagihan?

Karena dashboard menagih pada harga list sementara tagihan menerapkan diskon yang tidak pernah dilihat monitoring-mu. Input ter-cache mendarat di 0,1x sampai 0,25x harga dasar, batch berjalan di separuhnya, dan token reasoning ditagih pada tarif output dari dalam jumlah output. Ketika dua angka menyimpang, tagihan biasanya yang lebih rendah, dan celahnya hampir selalu salah satu dari empat pengubah.

Pengubah hargaPengali tipikalEfek pada estimasimu
Input ter-cache (cache read)0,1x-0,25x dari input dasarDashboard berjalan tinggi jika menagih cache hit pada harga penuh
Batch API0,5x pada input dan outputPekerjaan async berharga separuh angka yang terlacak
Token reasoning1x tarif output, dihitung di dalam outputChain of thought panjang membakar anggaran output secara diam-diam
Cache write~1,25x input dasarRequest pertama dalam jendela cache berharga sedikit lebih mahal

Katalog pydantic/genai-prices yang terbuka menunjukkan kenapa pengali ini berbeda per model: setiap provider menetapkan faktor cache dan batch-nya sendiri, jadi satu tabel harga hardcode tunggal menyimpang di hari seorang provider merevisi kartunya. Dokumentasi biaya Datadog mendokumentasikan separuh masalah lainnya, celah biaya parsial di mana field token yang hilang mengembalikan COST UNAVAILABLE untuk sebuah request. Periksa ke sana saat dashboard membaca lebih rendah dari tagihan; periksa tabel diskon saat ia membaca lebih tinggi. Mekanisme di balik pengali terbesar adalah prompt caching LLM, dan rasio cache hit yang tinggi adalah alasan paling umum estimasi yang terlacak melampaui tagihan asli.

Estimasi biaya tanpa diskon cache-hit dan batch adalah plafon, bukan prakiraan.

Alat Mana yang Benar-Benar Melakukan Pelacakan Biaya LLM?

Enam alat mencakup kebanyakan setup produksi: Langfuse, LiteLLM, Helicone, dan Portkey di sisi open source dan gateway, Datadog dan Braintrust di sisi komersial. Pembelahan jujurnya adalah penegakan versus observabilitas: proxy bisa menolak request pada anggaran, sementara alat tracing mengukur pengeluaran setelah kejadian. Kebanyakan stack yang matang berakhir dengan satu dari masing-masing.

AlatJenisPendekatan pelacakan biayaTier gratisPilih ini jika...
LangfuseOpen sourceBiaya per trace dari kartu harga model, bisa self-hostSelf-hosted gratis; tier hobi gratis di cloudKamu ingin open source dan memiliki data
LiteLLMProxy open sourceAnggaran key dan tim ditegakkan di gatewayGratis (OSS); enterprise berbayarKamu butuh anggaran yang menolak request, bukan hanya menghitung
HeliconeGateway open sourceLog biaya level proxy per key dan modelTier gratis dengan rate limitKamu ingin pertukaran proxy satu baris tanpa perubahan SDK
PortkeyGateway komersialAnggaran virtual key plus analitik biayaTier developer gratisKamu ingin gateway, prompt, dan eval dalam satu panel
Datadog LLM ObservabilityKomersialMetrik request nanodolar plus cost_tagsUji coba 14 hariKamu sudah menjalankan Datadog untuk semua hal lain
BraintrustKomersialPengeluaran terkait eval per proyekTier gratisPekerjaan biayamu dimulai dari eval, bukan tagihan

Satu peringatan tentang konten vendor di ruang ini: perbandingan alat pelacakan biaya versi Braintrust sendiri tahun 2026 meranking dirinya sendiri pertama dan menghilangkan setiap opsi open source di tabel di atas. Baca listicle vendor untuk datanya, bukan rankingnya.

Untuk tim yang mulai dari nol, kami akan menjalankan LiteLLM di depan dan Langfuse di belakangnya: proxy menegakkan anggaran, trace menjelaskannya, dan pasangan ini tidak memakan biaya apa pun sampai kamu menyeberang ke paket hosted. Jika kamu menimbang dua default tracing, rincian Langfuse vs Langsmith kami membahas dalam pilihan itu, dan rangkuman platform observabilitas AI terbaik mencakup seluruh bidang.

Dari Monitoring ke Memotong Biaya

Monitoring menunjukkan ke mana uang pergi; langkah berikutnya adalah memutuskan berapa banyak yang pergi ke sana. Tiga tuas, berurutan menurut hasilnya: cache input yang diulang, arahkan request mudah ke model lebih murah, dan turunkan ukuran model di mana kualitas masih bertahan. Panduan pangkas biaya API LLM kami membahas setiap tuas, dan perbandingan harga API LLM adalah input untuk semua hitungan di atas.

Perspektif kami: ketika pengeluaran LLM klien mengejutkan mereka, kami memonitor dulu dan memotong kemudian, tidak pernah sebaliknya. Tim yang men-cache sebelum mengukur biasanya berakhir men-cache prompt yang salah. Monitoring memberitahumu ke mana uang pergi; caching dan routing memutuskan berapa banyak yang pergi ke sana. Jika tagihanmu sudah menyengat, ambil konsultasi gratis dan kami akan melihat angkanya bersamamu.

Tentang Penulis

Mert Batur adalah Co-Founder Techsy.io, tempat timnya mengirimkan agen AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia menulis tentang stack tooling LLM yang benar-benar dipakai tim Techsy di produksi. Terhubung di LinkedIn.

Pertanyaan yang Sering Diajukan

Berapa harga 1 juta token di LLM?

Pada harga list, di mana saja dari $0,14 sampai $15 per juta tergantung model dan arahnya: input DeepSeek-V4 berharga $0,14 per juta, sementara output GPT-5.6 Terra berharga $15. Token output berjalan 3 sampai 6 kali tarif input di setiap provider besar. Tabel di bagian pertama punya empat model, dan perbandingan harga API LLM kami memberi harga ketujuh belasnya, diverifikasi terhadap halaman OpenAI dan Anthropic pada Juli 2026.

Apa itu optimasi biaya LLM?

Praktik menurunkan biaya per request tanpa menurunkan kualitas: prompt caching untuk input yang diulang, routing tugas mudah ke model lebih murah, batch API untuk pekerjaan async, dan right-sizing model per fitur. Monitoring biaya LLM adalah prasyaratnya, karena kamu tidak bisa mengoptimasi apa yang belum kamu atribusikan. Rasio cache hit dan biaya per fitur adalah dua metrik yang menunjuk ke tuas terbesar lebih dulu.

Kenapa LLM sangat mahal?

Inference terikat komputasi: setiap token yang dihasilkan menjalankan satu forward pass penuh model di GPU, dan model reasoning menghabiskan token ekstra untuk berpikir sebelum menjawab, ditagih pada tarif output. System prompt panjang mengalikan biaya itu di setiap request. Tagihan tumbuh dengan verbositas di kedua sisi panggilan, itulah kenapa token per request adalah metrik pertama yang layak dipantau.

Berapa biaya LLM di AS?

Harga API didenominasi USD dan global: OpenAI, Anthropic, dan Google membebankan harga list yang sama per juta token apakah request berasal dari Ohio atau Osaka. Perbedaan regional muncul di self-hosting, di mana jam GPU bervariasi per wilayah cloud, dan di platform hosted yang menambah markup. Untuk pekerjaan API, lokasi mengubah latensi, bukan harga.

Bagaimana melacak biaya LLM per tim?

Keluarkan satu virtual key per tim melalui proxy seperti LiteLLM, tag setiap key dengan nama tim saat pembuatan, dan agregasi pengeluaran per tag itu. Setiap request kemudian membawa atribusi sejak saat dibuat, tanpa parsing log. Tabel showback di bagian anggaran di atas adalah produk akhirnya: tim, anggaran bulanan, pengeluaran sejauh ini, status.

Langfuse vs Datadog untuk pelacakan biaya LLM: pilih yang mana?

Pilih Langfuse jika kamu ingin open source, self-hosting, dan data yang kamu kendalikan; menjalankannya gratis dan men-trace biaya per request langsung dari kotaknya. Pilih Datadog hanya jika timmu sudah menjalankannya untuk infrastruktur, karena fitur biaya LLM-nya tidak keluar dari platform. Untuk kebanyakan tim yang mulai baru, Langfuse plus proxy LiteLLM mengalahkan salah satu opsi saja.

Apakah estimasi biaya LLM cocok dengan tagihan asli?

Tidak, dan biasanya tagihan lebih rendah. Dashboard menagih pada harga list sementara input ter-cache mendarat di 0,1x sampai 0,25x dan pekerjaan batch di 0,5x, jadi beban kerja ber-cache tinggi melihat tagihan asli datang jauh di bawah estimasi yang terlacak. Field token yang hilang mendorong error ke arah sebaliknya. Tabel penyimpangan di atas mencantumkan setiap pengali dan ke mana harus melihat.

Bagaimana memberi alert pada lonjakan pengeluaran LLM?

Atur alert ambang di 80% anggaran bulanan setiap tim, dikirimkan ke Slack melalui webhook, plus alert anomali hari-ke-hari di +50% untuk loop yang membakar cepat. LiteLLM mengirimkan pola ambang secara native melalui pengaturan alerting_threshold-nya. Alert di 80% menyisakan beberapa hari untuk bereaksi; alert di 100% hanya mengonfirmasi batas melakukan pekerjaannya.

Adakah pelacak biaya LLM gratis?

Ya, tiga yang kredibel. Langfuse self-hosted gratis dan open source, dengan tier hobi gratis di cloud menurut halaman harga Langfuse. Anggaran key bawaan LiteLLM tidak memakan biaya apa pun di proxy open source. Tier gratis Helicone mencakup log biaya level proxy dengan rate limit. Tier gratis mencakup monitoring; penegakan dan alerting dalam skala adalah tempat paket berbayar dimulai.

Kesimpulan

Pilih jalur setup hari ini, karena alert yang akan kamu inginkan dalam enam minggu memakan waktu satu sore untuk dipasang sekarang. Versi singkatnya:

  • Lacak token per request dan biaya per tim lebih dulu; tambahkan tiga metrik lainnya setelah keduanya berjalan.
  • Anggaran yang menolak request adalah kontrol; yang hanya menghitung adalah laporan.
  • Atur alert di 80%, di Slack, sebelum tagihan bisa mengejutkan siapa pun.
  • Dashboard-mu adalah estimasi; harga input ter-cache dan batch berarti tagihan biasanya mendarat di bawahnya.

Jika kamu lebih suka seseorang melihat angkanya bersamamu, ambil konsultasi gratis.

Tag

monitoring biaya llmpelacakan biaya llmpelacakan penggunaan tokenobservabilitas llm

Bagikan artikel ini

Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.