ai-machine-learning

LLM Maliyet İzleme: Harcama Patlamadan Takibe Alın (2026)

Yazan Mert Batur
Güncellendi Jul 31, 2026
12 okuma
LLM Maliyet İzleme: Harcama Patlamadan Takibe Alın (2026)

LLM Maliyet İzleme: Harcama Patlamadan Takibe Alın (2026)

LLM maliyet izleme, 412 dolarlık sürpriz bir fatura ile bütçenin %80'inde gelen bir Slack bildirimi arasındaki farktır. Claude Sonnet 5 bu ay milyon girdi tokenı başına 3,00 dolardan faturalanıyor ve kontrolden çıkan tek bir ajan döngüsü bu tutarı bir öğleden sonra yakabilir. Çoğu ekip takibi bir günde kurar; asıl atlanan kısım uyarıdır.

Öne Çıkanlar:

  • LLM maliyet izleme, her isteğe bir token sayısı ve dolar tahmini ekler, ardından modele ve ekibe göre toplar.
  • Beş metriği takip edin: istek başına token, özellik/ekip/model başına maliyet, önbellek isabet oranı, konuşma başına maliyet, ani artış oranı.
  • LiteLLM bütçeleri, Langfuse izleri veya Datadog LLM Observability; her biri harcama görünürlüğünü bir günden kısa sürede bağlar.
  • Panolar tahmin gösterir; önbelleğe alınmış girdi fiyatları ve toplu işlem indirimleri sayesinde fatura genelde bu tahminlerin altında gelir.

LLM Maliyet İzleme Gerçekte Neyi Takip Eder?

LLM maliyet izleme, her LLM isteğine bir token sayısı ve bir dolar tahmini ekleme, ardından bu tahminleri modele, özelliğe ve ekibe göre toplayarak fatura gelmeden önce harcama üzerinde uyarı verebilme pratiğidir. Tahmin, yayınlanmış token fiyatlarından istek başına hesaplanır, çağrıya eklediğiniz etiketler bazında toplanır ve önceden belirlenmiş bir bütçeyle karşılaştırılır.

Altındaki matematik sağlayıcıdan bağımsızdır. Her sağlayıcının kullanım yanıtı tokenları alanlara böler ve Datadog'un maliyet dokümanları bu ilişkileri açıkça belgeler. OpenTelemetry GenAI semantik sözleşmeleri aynı alanları sağlayıcılar arasında standartlaştırır; bu yüzden bunların üzerine kurulan bir pano tek bir sağlayıcıya kilitlenmez.

AlanNeyi sayarFaturalama
input_tokensGönderdiğiniz her şey: sistem promptu, geçmiş, getirilen bağlam, soruTaban girdi oranı
output_tokensModelin ürettiği her şeyTaban çıktı oranı (girdinin 3-6 katı)
cache_read_tokensÖnceki bir önbellekten yeniden kullanılan girdiTaban girdinin 0,1x-0,25x'i
cache_write_tokensÖnbelleğe ilk kez yazılan girdi~1,25x taban girdi (Anthropic 5 dk TTL)
reasoning_tokensDahili düşünce zinciri, çıktının bir alt kümesiÇıktı oranı

Üç ilişki işin çoğunu halleder: toplam token = girdi + çıktı; girdi = önbelleklenmemiş + cache_read + cache_write; reasoning tokenları ise çıktının içinde, çıktı oranından oturur. Bunları doğru kurarsanız istek başına tahmin gerçeğe yakın kalır; görmezden gelirseniz pano her ay faturadan biraz daha uzaklaşır. Maliyet izleme, yapay zeka gözlemlenebilirliğinin üç ayağından biridir; izleme (tracing) ve değerlendirmeler (evals) diğer ikisidir ve hepsi bu aynı alan sözlüğünü paylaşır.

Panonuz bir tahmin gösterir; fatura, asla önbelleklenmeyen tek maliyet metriğidir.

LLM'de 1 milyon token ne kadar?

Modele ve yöne göre değişir: 1 milyon token, DeepSeek-V4 girdisi olarak 0,14 dolar, GPT-5.6 Terra çıktısı olarak 15,00 dolar tutar; aynı birim üzerinde 100 katlık bir makas. İşte 14 Temmuz 2026 tarihli fiyat araştırmamızdan, resmi sayfalarla doğrulanmış dört model:

ModelGirdi / 1M tokenÇıktı / 1M tokenÖnbellekli girdi / 1M token
Claude Sonnet 5$3.00$15.00$0.30
GPT-5.6 Terra$2.50$15.00$0.25
Gemini 2.5 Pro$1.25$10.00$0.31
DeepSeek-V4$0.14$0.28$0.003

Kaynaklar: OpenAI fiyatlandırma ve Anthropic fiyatlandırma. Bir not: Claude Sonnet 5, 31 Ağustos 2026'ya kadar 2,00 dolar girdi / 10,00 dolar çıktı tanıtım fiyatıyla çalışır, sonra yukarıdaki rakamlara döner.

Gerçekten Önem Taşıyan 5 Metrik

Beş metrik LLM maliyet takibini kapsar ve çoğu ekip bunların yalnızca ikisi için uyarı kurar. İlk iki satırla başlayın: istek başına token, prompt şişmesini ortaya çıktığı gün yakalar; ekip başına maliyet ise finansın eninde sonunda isteyeceği rakamdır. Diğer üçü, bunlar bağlandıktan sonra resmi netleştirir.

MetrikNasıl hesaplanırNeden önemliUyarı eşiği
İstek başına tokenHer çağrıda girdi + çıktıyı topla, özelliğe göre gruplaPrompt şişmesi ve bağlam doldurma önce burada görünür7 günlük medyanın %30 üzerinde
Özellik / ekip / model başına maliyetTahmini maliyeti topla, etikete veya sanal anahtara göre gruplaBirim yansıtma ve bütçelerin gerçekte üzerinde döndüğü rakamAylık bütçenin %80'i
Önbellek isabet oranıcache_read / toplam girdi tokenıDüşük oranlar, tekrar eden promptlar için tam fiyat ödediğiniz anlamına gelirSabit trafikte %50'nin altı
Konuşma / oturum başına maliyetBir oturumun her turundaki maliyeti toplaİstek bazlı görünümün kaçırdığı, kontrolden çıkan çok turlu ajanları ortaya çıkarır90. persentil oturumun 2 katı
Ani artış / anomali oranıToplam harcamada günden güne değişimKırık bir döngüyü faturadan önce yakalayan tek metrikGünden güne +%50

Bir ayrıntı notu: Datadog, maliyet dokümanlarına göre istek düzeyindeki maliyeti nanodolar (doların milyarda biri) cinsinden saklar. Milyon token başına 0,14 dolarda tek bir DeepSeek-V4 isteği bir sentin binde birinden ucuza mal olabilir; bu yüzden yuvarlamadan önce toplayın, yoksa küçük model trafiği rapordan silinir.

Başka hiçbir şeyi takip etmeyecekseniz, birinci ve ikinci satırı takip edin. İstek başına token alacağınız en erken uyarıdır; ekip başına maliyet ise muhasebe departmanıyla temastan sağ çıkan tek metriktir.

LLM Maliyet İzlemeyi Bağlamanın Üç Yolu

Bu sorgu için üst sıralardaki sayfaların hiçbiri tek bir çalıştırılabilir kod satırı yayınlamıyor, o yüzden işte üç çalışan kurulum. Her biri bir günden kısa sürede canlıya alınır ve birbirleriyle uyumludurlar: biz ilk ikisini birlikte çalıştırıyoruz.

Production'da gerçekte ne çalıştırıyoruz: bizim kurulumda her istemci ajanı, kendi sanal anahtarıyla LiteLLM proxy'sine konuşur; her anahtarda aylık bir bütçe vardır ve proxy'nin arkasında Langfuse her isteği izler. İkisini birlikte devreye aldığımızda iş bölümü asıl noktaydı: proxy limitleri uygular, izler (trace'ler) ise bu limiti neyin tükettiğini açıklar. İstemci anahtarlarımızın her biri ayrıca ikinci bir sigorta olarak dakika başına 100.000 token'lık bir tpm_limit taşır; LiteLLM dokümanlarına göre proxy, bir limite ulaşıldığında istekleri reddeder ve bizim güvendiğimiz şey kendi ölçtüğümüz bir benchmark değil, bu belgelenmiş davranıştır. Konfigürasyonumuz, Mart 2026 tedarik zinciri olayına yakalanan iki sürüm olan LiteLLM 1.82.7 ve 1.82.8'i tamamen atlar ve imaj etiketini latest üzerinde yüzer bırakmak yerine sabitler.

LiteLLM proxy: sanal anahtarlar + bütçeler

Techsy, production'da her istemci için bir sanal anahtar ve her anahtarda aylık bir bütçe ile bir LiteLLM proxy kurulumu çalıştırıyor. Aşağıdaki istek, LiteLLM'in virtual_keys dokümanlarındaki belgelenmiş biçimdir: o dokümanlara göre bu anahtardaki kümülatif harcama bir ay içinde 50 doları aştığında proxy, iş işten geçtikten sonra bir uyarı loglamak yerine sonraki istekleri bütçe-aşıldı hatasıyla reddeder.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Hesabı yayınlanmış fiyatlar üzerinden yapın: Claude Sonnet 5'in milyon token başına 3,00 / 15,00 doları ile 50 dolar kabaca 16,7 milyon girdi tokenı veya 3,3 milyon çıktı tokenı satın alır; bu, daha hafif istemci ajanlarımızdan biri için yaklaşık bir haftalık trafiktir. İstediğimiz etki yarıçapı tam olarak bu. tpm_limit ikinci sigortadır: kontrolden çıkan bir döngü, aylık bütçeyi tetiklemesinden çok önce dakika başına 100 bin token sınırını tetikler. Kullanıcı başına ilişkilendirme de users endpoint'i üzerinden aynı şekilde çalışır ve en iyi LLM gateway araçları rehberimiz, bir proxy'nin ne zaman yerini hak ettiğini, ne zaman yalnızca fazladan bir atlama noktası olduğunu ele alır.

Langfuse: @observe maliyet izleme

Google otomatik tamamlama "langfuse monitoring" ifadesini bu sorguyla eşleştiriyor ve bunun iyi bir nedeni var: Langfuse, açık kaynaklı izlemenin varsayılanıdır. Python SDK'sı sağlayıcı istemcinizi sarar; böylece her çağrı, Langfuse izleme dokümanlarına göre token sayıları ve hesaplanmış bir maliyet taşıyan bir iz (trace) haline gelir:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Maliyet, sizin tarafınızda hiçbir token hesabı yapmadan ize düşer; özellik bazında toplamlar için izleri oturuma veya kullanıcı kimliğine göre gruplayın ve veri ağınızdan çıkamıyorsa kendi sunucunuzda barındırın.

Datadog LLM Observability: zaten kullanıyorsanız

Ekibiniz zaten Datadog ajanları çalıştırıyorsa, onun LLM maliyet dokümanları bu sayfadaki en derin tek kaynaktır: nanodolar cinsinden istek düzeyinde maliyet, ekip ve özellik kırılımları için özel cost_tags ve kısmi maliyet boşlukları için gerçek bir sorun giderme bölümü. Dürüst sınır: yalnızca Datadog. Metrikler platformdan dışarı çıkmaz ve fiyatlandırma artık uymadığında açık kaynaklı bir yedek yoktur. Esneklik için değil, konsolidasyon için seçin.

Bütçeleri, Uyarıları ve Yansıtmayı Nasıl Bağlarsınız?

Üç katmanda bağlarsınız: limitte istekleri reddeden bir bütçe üst sınırı, üst sınırdan önce bir yüzde eşiğinde tetiklenen bir webhook uyarısı ve showback ile chargeback'i bir tartışma yerine bir sorguya dönüştüren, ekip başına sanal anahtarlar. LiteLLM üçünü de yerleşik olarak sunar; bu kalıplar, anahtar düzeyinde bütçesi olan herhangi bir gateway'e taşınır.

Yalnızca sayan bir bütçe bir rapordur; üst sınırda istekleri reddeden bir bütçe bir kontroldür.

Ani artıştan önce tetiklenen uyarılar

Uyarıyı %100'de değil, üst sınırın %80'inde kurun. LiteLLM, Slack uyarısını yerleşik olarak sunar: general_settings içinde alerting: ["slack"] ve alerting_threshold: 80 ayarlayın, SLACK_WEBHOOK_URL ortam değişkenini bir kanala yönlendirin; bir anahtar eşiği aştığında şöyle bir mesaj düşer:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

%80'te bir insanın harekete geçmek için hâlâ günleri vardır: modeli düşürmek, promptu sıkılaştırmak veya onayda bir isimle üst sınırı yükseltmek. %100'deki bir uyarı bir otopsidir.

Showback'ten chargeback'e

Showback, her ekibin kendi harcamasını görmesidir; chargeback, harcamanın onların bütçesinden düşmesidir. İkisi de tek bir malzemeyle çalışır: oluşturma anında etiketlenmiş, ekip başına bir sanal anahtar. Aylık rapor o zaman harcama tablosu üzerinde bir group-by'dır:

EkipAylık bütçeBugüne kadar harcamaDurum
search$50$40.18%80'de uyarı tetiklendi
support-chat$200$112.40yolunda
evals-batch$30$29.97üst sınıra ulaşıldı, reddediyor
sandbox$10$1.06yolunda

Örnek biçim, istemci verisi değil. evals-batch satırı, kalıbın tasarlandığı gibi çalışmasıdır: toplu iş üst sınırına kadar koştu ve durdu; faturaya sessizce sızmak yerine. Uygulama davranışı, bütçe süresinin nasıl sıfırlandığı da dahil, LiteLLM'in virtual_keys dokümanlarında belgelenmiştir.

Panonuz Faturayla Neden Uyuşmuyor?

Çünkü panolar liste fiyatı üzerinden faturalar, faturalar ise izlemenizin asla görmediği indirimleri uygular. Önbellekli girdi taban fiyatın 0,1x ile 0,25x'ine oturur, toplu işler yarı fiyata çalışır ve reasoning tokenları çıktı sayısının içinden çıktı oranıyla faturalanır. İki rakam birbirinden saptığında fatura genelde daha düşük olanıdır ve aradaki fark neredeyse her zaman dört düzenleyiciden biridir.

Fiyat düzenleyiciTipik çarpanTahmininize etkisi
Önbellekli girdi (cache read)Taban girdinin 0,1x-0,25x'iPano, önbellek isabetlerini tam fiyattan faturalıyorsa yüksek kalır
Batch APIGirdi ve çıktıda 0,5xAsenkron işler takip edilen rakamın yarısına mal olur
Reasoning tokenları1x çıktı oranı, çıktı içinde sayılırUzun düşünce zincirleri çıktı bütçesini sessizce yakar
Cache write~1,25x taban girdiBir önbellek penceresindeki ilk istek biraz daha pahalıya gelir

Açık pydantic/genai-prices kataloğu, bu çarpanların neden modelden modele farklılaştığını gösterir: her sağlayıcı kendi önbellek ve toplu işlem katsayılarını belirler; bu yüzden tek bir sabit kodlu fiyat tablosu, bir sağlayıcı kartlarını revize ettiği gün kayar. Datadog'un maliyet dokümanları sorunun diğer yarısını belgeler: eksik bir token alanının bir istek için COST UNAVAILABLE döndürdüğü kısmi maliyet boşlukları. Pano faturadan düşük okuduğunda oraya bakın; yüksek okuduğunda indirim tablosuna bakın. En büyük çarpanın arkasındaki mekanizma LLM prompt önbelleklemedir ve yüksek önbellek isabet oranı, takip edilen bir tahminin gerçek faturayı aşmasının en yaygın nedenidir.

Önbellek isabeti ve toplu işlem indirimlerini hesaba katmayan bir maliyet tahmini, bir öngörü değil, bir üst sınırdır.

LLM Maliyet Takibini Gerçekte Hangi Araçlar Yapar?

Altı araç, production kurulumların çoğunu kapsar: açık kaynak ve gateway tarafında Langfuse, LiteLLM, Helicone ve Portkey; ticari tarafta Datadog ve Braintrust. Dürüst ayrım uygulama (enforcement) ile gözlemlenebilirlik arasındadır: bir proxy istekleri bir bütçe sınırında reddedebilir, bir izleme aracı ise harcamayı iş işten geçtikten sonra ölçer. Olgun yığınların çoğu sonunda her birinden birer taneyle biter.

AraçTürMaliyet takibi yaklaşımıÜcretsiz katmanŞu durumda seçin...
LangfuseAçık kaynakModel fiyat kartlarından iz başına maliyet, kendi sunucuda barındırılabilirKendi sunucuda ücretsiz; bulutta ücretsiz hobi katmanıAçık kaynak istiyor ve verinin sahibi siz olmak istiyorsanız
LiteLLMAçık kaynak proxyGateway'de uygulanan anahtar ve ekip bütçeleriÜcretsiz (OSS); ücretli kurumsalYalnızca sayan değil, istekleri reddeden bütçeler gerekiyorsa
HeliconeAçık kaynak gatewayAnahtar ve model başına proxy düzeyinde maliyet loglarıHız limitli ücretsiz katmanSıfır SDK değişikliğiyle tek satırlık bir proxy değişimi istiyorsanız
PortkeyTicari gatewaySanal anahtar bütçeleri artı maliyet analitiğiÜcretsiz geliştirici katmanıGateway, prompt ve eval'leri tek panelde istiyorsanız
Datadog LLM ObservabilityTicariNanodolar cinsinden istek metrikleri artı cost_tags14 günlük denemeGeri kalan her şey için zaten Datadog çalıştırıyorsanız
BraintrustTicariProje başına eval bağlantılı harcamaÜcretsiz katmanMaliyet işiniz faturalardan değil, eval'lerden başlıyorsa

Bu alandaki sağlayıcı içeriklerine dair bir uyarı: Braintrust'ın maliyet takibi araçlarına dair kendi 2026 karşılaştırması, kendisini birinci sıraya koyar ve yukarıdaki tablodaki açık kaynak seçeneklerin tamamını dışarıda bırakır. Sağlayıcı listicle'larını sıralamaları için değil, verileri için okuyun.

Sıfırdan başlayan bir ekip için biz LiteLLM'i önde, Langfuse'u arkada çalıştırırdık: proxy bütçeleri uygular, izler onları açıklar ve bu ikili, barındırılan planlara geçene kadar hiçbir şeye mal olmaz. İki izleme varsayılanı arasında karar veriyorsanız, Langfuse vs Langsmith karşılaştırmamız bu seçimi tüm ayrıntılarıyla ele alır ve en iyi yapay zeka gözlemlenebilirlik platformları derlememiz sahanın tamamını kapsar.

İzlemeden Maliyet Kısma

İzleme, paranın nereye gittiğini gösterir; sonraki adım oraya ne kadar gideceğine karar vermektir. Üç hamle, getiri sırasıyla: tekrar eden girdiyi önbelleğe alın, kolay istekleri daha ucuz modellere yönlendirin ve kalitenin hâlâ tutunduğu yerde modeli küçültün. LLM API maliyetlerini düşürme rehberimiz her hamleyi ele alır ve LLM API fiyat karşılaştırması yukarıdaki tüm hesabın girdisidir.

Bizim bakış açımız: bir istemcinin LLM harcaması onu şaşırttığında, önce izler, sonra kısarız; asla tersini yapmayız. Ölçmeden önce önbellekleyen ekipler genelde yanlış promptları önbellekler. İzleme, paranın nereye gittiğini söyler; önbellekleme ve yönlendirme oraya ne kadar gideceğine karar verir. Faturanız zaten can yakıyorsa, ücretsiz danışmanlık alın ve rakamlara birlikte bakalım.

Yazar Hakkında

Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekip burada B2B istemciler için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştirir. Techsy ekibinin production'da gerçekte kullandığı LLM araç yığını hakkında yazar. LinkedIn üzerinden bağlanın.

Sıkça Sorulan Sorular

LLM'de 1 milyon token ne kadar?

Liste fiyatıyla, modele ve yöne bağlı olarak milyon başına 0,14 dolardan 15 dolara kadar: DeepSeek-V4 girdisi milyon başına 0,14 dolar, GPT-5.6 Terra çıktısı ise 15 dolardır. Çıktı tokenları, büyük sağlayıcıların hepsinde girdi oranının 3 ila 6 katıdır. İlk bölümdeki tabloda dört model var ve LLM API fiyat karşılaştırması on yedisinin tamamını fiyatlandırır; Temmuz 2026'da OpenAI ve Anthropic sayfalarıyla doğrulandı.

LLM maliyet optimizasyonu nedir?

Kaliteyi düşürmeden istek başına maliyeti indirme pratiği: tekrar eden girdi için prompt önbellekleme, kolay görevleri daha ucuz modellere yönlendirme, asenkron işler için toplu API'ler ve özellik bazında modeli doğru boyutlandırma. LLM maliyet izleme bunun ön koşuludur; çünkü ilişkilendirmediğiniz bir şeyi optimize edemezsiniz. Önbellek isabet oranı ve özellik başına maliyet, en büyük hamle noktalarını önce gösteren iki metriktir.

LLM'ler neden bu kadar pahalı?

Inference, hesaplama sınırlıdır: üretilen her token, GPU'larda modelin tam bir ileri geçişini çalıştırır ve reasoning modelleri yanıtlamadan önce düşünerek ekstra token harcar, çıktı oranından faturalanır. Uzun sistem promptları bu maliyeti her istekte katlar. Fatura, çağrının her iki tarafındaki gevezelikle büyür; bu yüzden istek başına token, izlemeye değer ilk metriktir.

ABD'de bir LLM ne kadara mal olur?

API fiyatlandırması dolar bazlıdır ve küreseldir: OpenAI, Anthropic ve Google, istek Ohio'dan da gelse Osaka'dan da gelse milyon token başına aynı liste fiyatını alır. Bölgesel farklar, GPU saatlerinin bulut bölgesine göre değiştiği kendi sunucuda barındırmada ve üzerine kâr payı ekleyen barındırılan platformlarda ortaya çıkar. API işi için konum, gecikmeyi değiştirir, fiyatı değil.

LLM maliyetlerini ekip başına nasıl takip ederim?

LiteLLM gibi bir proxy üzerinden ekip başına bir sanal anahtar verin, her anahtarı oluşturma anında ekip adıyla etiketleyin ve harcamayı o etikete göre toplayın. Böylece her istek, yapıldığı andan itibaren ilişkilendirme taşır; log ayrıştırması gerekmez. Yukarıdaki bütçeler bölümündeki showback tablosu nihai üründür: ekip, aylık bütçe, bugüne kadar harcama, durum.

LLM maliyet takibi için Langfuse mı Datadog mu: hangisini seçmeliyim?

Açık kaynak, kendi sunucuda barındırma ve kontrol ettiğiniz veri istiyorsanız Langfuse seçin; çalıştırması ücretsizdir ve kutudan çıktığı haliyle istek başına maliyeti izler. Datadog'u yalnızca ekibiniz altyapı için zaten kullanıyorsa seçin; çünkü LLM maliyet özellikleri platformdan dışarı çıkmaz. Sıfırdan başlayan çoğu ekip için Langfuse artı bir LiteLLM proxy'si, tek başına herhangi bir seçenekten daha iyidir.

Tahmini LLM maliyetleri gerçek faturayla eşleşir mi?

Hayır ve genelde fatura daha düşüktür. Panolar liste fiyatından faturalar; önbellekli girdi 0,1x-0,25x'e, toplu işler 0,5x'e oturur; bu yüzden yüksek önbellekli bir iş yükünde gerçek fatura, takip edilen tahminin oldukça altında gelir. Eksik token alanları hatayı diğer yöne iter. Yukarıdaki sapma tablosu her çarpanı ve nereye bakılacağını listeler.

LLM harcama ani artışları için nasıl uyarı kurarım?

Her ekibin aylık bütçesinin %80'inde, Slack'e webhook ile iletilen bir eşik uyarısı kurun; buna ek olarak hızlı yakan döngüler için günden güne +%50'lik bir anomali uyarısı ekleyin. LiteLLM, eşik kalıbını alerting_threshold ayarı üzerinden yerleşik olarak sunar. %80'teki bir uyarı tepki vermek için günler bırakır; %100'deki bir uyarı yalnızca üst sınırın işini yaptığını doğrular.

Ücretsiz bir LLM maliyet takipçisi var mı?

Evet, üç güvenilir tane var. Kendi sunucuda Langfuse ücretsiz ve açık kaynaktır; Langfuse fiyatlandırma sayfasına göre bulutta ücretsiz bir hobi katmanı vardır. LiteLLM'in yerleşik anahtar bütçeleri, açık kaynak proxy'de hiçbir şeye mal olmaz. Helicone'un ücretsiz katmanı, hız limitleriyle proxy düzeyinde maliyet loglarını kapsar. Ücretsiz katmanlar izlemeyi kapsar; ölçekte uygulama ve uyarı, ücretli planların başladığı yerdir.

Sonuç

Bugün bir kurulum yolu seçin; çünkü altı hafta sonra isteyeceğiniz uyarıyı şimdi bağlamak bir öğleden sonra sürer. Kısa versiyon:

  • Önce istek başına token ve ekip başına maliyeti takip edin; bunlar çalıştığında diğer üç metriği ekleyin.
  • İstekleri reddeden bir bütçe bir kontroldür; yalnızca sayan bir bütçe bir rapor.
  • Uyarıyı %80'te, Slack'te kurun; fatura kimseyi şaşırtamadan önce.
  • Panonuz bir tahmindir; önbellekli girdi ve toplu işlem fiyatlandırması, faturanın genelde onun altında gelmesi demektir.

Rakamlarınıza biriyle birlikte bakmayı tercih ederseniz, ücretsiz danışmanlık alın.

Etiketler

llm maliyet izlemellm maliyet takibitoken kullanım takibillm gözlemlenebilirlik

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.