ai-machine-learning

Yapay Zeka Gözlemlenebilirliği: Üretimde LLM İzleme için Eksiksiz Rehber [2026]

Yazan Mert Batur
Güncellendi Aug 4, 2026
17 okuma
Yapay Zeka Gözlemlenebilirliği: Üretimde LLM İzleme için Eksiksiz Rehber [2026]

YZ gözlemlenebilirliği, LLM uygulamanız ile sessiz başarısızlık arasındaki tek şeydir. 500 hatası fırlatan çöken bir sunucunun aksine, bir dil modeli size özgüvenle yanlış bir yanıt verir -- yığın izi yok, hata kodu yok, hiçbir şey yok. Bu yüzden geleneksel izleme araçları burada işe yaramaz.

YZ Gözlemlenebilirliği Bir Bakışta

Derinlere dalmadan önce, ekibinizle paylaşabileceğiniz özet:

KonuÖzet
YZ gözlemlenebilirliği nedir?İzler, ölçümler ve değerlendirmeler aracılığıyla LLM sisteminizin iç durumunu anlamak
İzlemeden farkı nedir?İzleme bilinen arızaları takip eder; gözlemlenebilirlik bilinmeyenleri araştırmanıza yardımcı olur
Temel sütunlarİzleme, ölçümler, değerlendirme, uyarılar
Takip edilecek temel ölçümlerGecikme (P50/P95), token maliyeti, kalite puanları, halüsinasyon oranı
En iyi kendi sunucunuzda barındırılabilir araçlarLangfuse (MIT), Arize Phoenix (Elastic License 2.0, kaynağı açık ancak OSI onaylı değil), Helicone (Apache-2.0)
En iyi ticari araçlarBraintrust, Datadog LLM Observability, LangSmith
Kimin ihtiyacı var?Üretimde LLM çalıştıran herkes -- tek bir uç nokta bile olsa
Ne zaman başlamalı?Üretim dağıtımının ilk gününde
En büyük hataLLM'leri geleneksel REST API'ları gibi ele almak
Maliyet aralığıÜcretsiz (kendi sunucunuzda açık kaynak) ile 500+ $/ay (kurumsal platformlar) arasında

Şimdi her parçayı inceleyelim; YZ gözlemlenebilirliğinin zaten bildiğiniz izlemeden temel olarak neden farklı olduğuyla başlayalım.

YZ Gözlemlenebilirliği Nedir (ve İzlemeden Neden Farklıdır)?

YZ gözlemlenebilirliği, LLM sisteminizin dahili olarak ne yaptığını anlama yeteneğidir -- yalnızca çalışıp çalışmadığını değil, neden belirli bir girdi için belirli bir çıktı ürettiğini. Dağıtık izlemeyi, gerçek zamanlı ölçümleri, otomatik kalite değerlendirmesini ve uyarıları tek bir geri bildirim döngüsünde birleştirir.

Bu, düz izlemeden nasıl farklı? Şöyle düşünün: izleme size yanıt gecikmesinin 8 saniyeye çıktığını söyler. Gözlemlenebilirlik size neden olduğunu anlatır -- geri alma adımınız 5 yerine 47 parça döndürdü çünkü biri bir gömme eşiğini değiştirdi; bu da bağlam penceresini taşırarak modeli daha uzun, daha yavaş bir yanıt üretmeye zorladı.

Datadog, New Relic ve Grafana gibi geleneksel APM araçları deterministik bir dünya etrafında inşa edilmiştir. HTTP durum kodları, CPU kullanımı, bellek sızıntıları -- bunlar bilinebilir, tekrarlanabilir durumlardır. LLM'ler bu varsayımı tamamen kırar. Aynı istemi iki kez gönderin ve iki farklı yanıt alırsınız. Karşılaştırılacak "beklenen çıktı" yok, doğrulanacak şema yok, olası dönüş değerlerinin numaralandırması yok.

Bu belirsizlik, YZ sistemlerinin kendi gözlemlenebilirlik katmanlarına ihtiyaç duymasının temel nedenidir. Yalnızca altyapı sağlığını takip etmiyorsunuz -- dört sütun üzerinden çıktı kalitesini takip ediyorsunuz:

  • Veri kalitesi -- RAG belgeleriniz güncel mi? Gömmeler sapıyor mu?
  • Model davranışı -- Model geçen haftaya kıyasla daha fazla mı halüsinasyon yapıyor? Bir sağlayıcı güncellemesi çıktı kalıplarını değiştirdi mi?
  • Altyapı performansı -- Gecikme, verim, hata oranları, önbellek isabet oranları
  • Pipeline bütünlüğü -- Zincirinizdeki tüm adımlar doğru sırayla doğru girdilerle çalışıyor mu?

İzleme size bir şeyin bozulduğunu söyler. Gözlemlenebilirlik size neden olduğunu söyler -- ve sisteminizin başarısızlıkları tam olarak başarılar gibi göründüğünde bu ayrım çok daha fazla önem taşır.

YZ Sistemleri Neden Özelleştirilmiş Gözlemlenebilirliğe İhtiyaç Duyar?

Belki şöyle düşünüyorsunuzdur: "LLM çağrılarımı günlük kayıt sistemiyle saracağım ve bu yeter." İşte bunun uzun süre işe yaramamasının nedenleri:

Sessiz başarısızlıklar varsayılandır. Geleneksel bir API başarısız olduğunda bir hata alırsınız. Bir LLM başarısız olduğunda, tamamen yanlış olmakla birlikte makul görünen bir paragraf alırsınız. Kullanıcılarınız bunu fark etmeyebilir bile -- sadece halüsine edilmiş verilere dayanarak kararlar alırlar. Canlı trafik üzerinde kalite değerlendirmesi olmadan körü körüne uçuyorsunuz demektir.

Maliyetler uyarısız patlar. Tek bir optimize edilmemiş ajan döngüsü bir gecede yüzlerce dolarlık token harcayabilir. Tanıdığım bir ekip, bir yeniden deneme döngüsünün her seferinde tam konuşma bağlamıyla GPT-4'e ulaşması nedeniyle 3.200 $ faturayla uyandı. Token düzeyinde maliyet atfı isteğe bağlı değil -- zorunlu.

Model sürüklenmesi görünmezdir. OpenAI, Anthropic ve Google modellerini düzenli olarak günceller. Bazen değişiklikler kullanım durumunuzu iyileştirir, bazen bozar. Temel kalite ölçümleri ve otomatik değerlendirme olmadan, kullanıcılar şikayet edene -- ya da ayrılana -- kadar bozulmayı fark etmezsiniz.

Ajanlar sorunu katlar. Basit bir sohbet tamamlaması bir LLM çağrısıdır. Bir ajan 5-20 çağrıyı birbirine bağlayabilir, araçlar kullanabilir, kararlar alabilir ve geri adım atabilir. Oturum düzeyinde izleme olmadan kötü bir ajan çıktısını hata ayıklamak, yalnızca print ifadeleriyle dağıtılmış bir sistemi hata ayıklamak gibidir. Mümkün ama acı verici.

Uyumluluk isteğe bağlı değildir. LLM'iniz kişisel veri, toksik içerik veya önyargılı çıktı üretiyorsa, denetim izine ihtiyacınız vardır. "Modeli yaptı" düzenleyiciler için kabul edilebilir bir yanıt değildir. Gözlemlenebilirlik, bu sorunları araştırmak ve önlemek için iz düzeyinde kanıt sağlar.

YZ Gözlemlenebilirliğinin Ardındaki İzleme Mimarisi

İzleme, YZ gözlemlenebilirliğinin omurgasıdır. Mikro hizmetler için dağıtık izleme kullandıysanız kavramlar tanıdık gelecektir -- ancak LLM izlemesi bazı önemli nüanslar ekler.

Bir iz uçtan uca bir işlemi temsil eder. LLM bağlamında bu genellikle tek bir kullanıcı isteğidir. Her iz, "sorguyu göm", "belgeleri al", "yanıt oluştur" veya "koruma rail kontrolü çalıştır" gibi bireysel adımlar olan yayılımlar içerir. Yayılımlar iç içe olabilir: Bir RAG pipeline izi, her birinin kendi zamanlaması, token sayıları ve meta verisiyle bir geri alma yayılımı ve bir oluşturma yayılımı içeren bir üst yayılıma sahip olabilir.

Buradaki oyun değiştirici, Üretken YZ için OpenTelemetry'nin anlamsal kurallarıdır. Bu kurallar, LLM telemetrisinin nasıl adlandırıldığını ve yapılandırıldığını standartlaştırır -- gen_ai.system, gen_ai.request.model, gen_ai.usage.input_tokens ve gen_ai.usage.output_tokens gibi öznitelikler. Bu standartlaştırma, izlerinizin backend'ler arasında taşınabilir olduğu anlamına gelir. Bir kez OTEL ile enstrümanlayın, bugün Langfuse'a gönderin, yarın Datadog'a geçin.

Bir LLM çağrısı için temel OpenTelemetry enstrümanlama şöyle görünür:

python
from opentelemetry import trace
from opentelemetry.semconv.ai import SpanAttributes

tracer = trace.get_tracer("my-llm-app")

def call_llm(prompt: str, model: str = "gpt-4o") -> str:
    with tracer.start_as_current_span("llm.chat") as span:
        span.set_attribute("gen_ai.system", "openai")
        span.set_attribute("gen_ai.request.model", model)
        span.set_attribute("gen_ai.usage.input_tokens", len(prompt.split()) * 1.3)

        response = openai_client.chat.completions.create(
            model=model,
            messages=[{"role": "user", "content": prompt}]
        )

        span.set_attribute("gen_ai.usage.output_tokens", response.usage.completion_tokens)
        span.set_attribute("gen_ai.response.model", response.model)
        return response.choices[0].message.content

RAG pipeline'ları için iz daha zengin olur. Üst yayılımınız tam isteği sarar; gömme, vektör arama, yeniden sıralama ve oluşturma için alt yayılımlarla. Her yayılım kendi gecikmesini, token sayılarını ve özel özniteliklerini (alınan parça sayısı veya benzerlik puanı eşiği gibi) taşır. Bu iç içe yapı, yavaş veya düşük kaliteli bir yanıtın tam olarak nerede yanlış gittiğini belirlemenizi sağlar.

<!-- IMAGE: İç içe yayılımlara sahip bir izi gösteren mimari diyagram -- kullanıcı isteği -> gömme -> alma -> oluşturma -> yanıt -->

Çoğu gözlemlenebilirlik platformu -- Langfuse, Braintrust, Arize -- ya OTEL izlerini yerel olarak kabul eder ya da eşdeğer iz yapıları üreten hafif SDK'lar sağlar. Eğilim açıkça OTEL'i ortak standart olarak benimser; dolayısıyla şimdi OTEL enstrümanlamasına yatırım yapmak size daha sonra maksimum esneklik sağlar.

LLM'ler için Hangi Ölçümler Gerçekten Önemlidir?

Tüm ölçümler eşit değildir. Takip edilecekler, her birinin sizi ne kadar hızlı paradan kurtaracağına veya olayları önleyeceğine göre kabaca sıralanmıştır.

Gecikme ilk sinyalinizdir. P50, P95 ve P99'u ayrı ayrı takip edin -- P50 size tipik deneyimi, P99 en şanssız kullanıcılarınız için ne kadar kötü olduğunu söyler. İlk token zamanı (TTFT), algılanan hızın her şey olduğu akış uygulamaları için önemlidir.

Token kullanımı maliyeti ve kaliteyi aynı anda yönlendirir. İstek başına giriş tokenlarını, çıkış tokenlarını ve toplamı takip edin. Giriş tokenlarında ani bir artış, RAG almanızın çok fazla parça döndürdüğü anlamına gelebilir. Çıkış tokenlarında artış, modelin aşırı açıklama yaptığı veya ayrıntılı bir döngüde sıkıştığı anlamına gelebilir.

Maliyet atfı token sayılarını liraya/dolara dönüştürür. İstek başına, kullanıcı başına, özellik başına ve model başına döküm yapın. Burada kullanıcılarınızın %5'inin maliyetlerinizin %60'ını ürettiğini ya da özetleme özelliğinizin arama özelliğinizden 10 kat daha pahalı olduğunu keşfedeceksiniz.

"Modele Göre 1.000 İstek Başına Tipik Maliyet"

"GPT-4o, 1.000 istek başına yaklaşık 12,50 $ maliyetle, Claude 3.5 Haiku gibi daha küçük modeller ise 1,00 $'a kadar düşerken, bu 12 katlık fark model seçimini en yüksek kaldıraçlı maliyet kararlarından biri yapar."
Veri tablosu
"Modele Göre 1.000 İstek Başına Tipik Maliyet"
"Model""Maliyet"
"GPT-4o"12.5
"Claude 3.5 Sonnet"9
"Gemini 1.5 Pro"7.5
"GPT-4o mini"1.5
"Claude 3.5 Haiku"1

Modeller arasındaki maliyet farkı çarpıcıdır. Basit sorguları daha küçük bir modele yönlendirmek ve GPT-4o veya Claude Sonnet'i karmaşık olanlar için rezerve etmek, faturanızı fark edilir bir kalite düşüşü olmadan %60-80 azaltabilir. Ancak hangi sorguların "basit" olduğunu bilmek için ölçümlere ihtiyacınız var.

Kalite puanları izlemesi daha zordur ama sonuç olarak en önemlidir. Bunlar, özel değerlendirme puanlarını (bir sonraki bölümde daha fazlası), RAG sistemleri için halüsinasyon oranlarını ve modelin çıktısının alınan bağlamda temellendirilip temellendirilmediğini ölçen sadakat ölçümlerini içerir.

Operasyonel ölçümler tabloyu tamamlar: API hata oranları, koruma rail tetikleme oranları, zaman aşımı oranları, önbellek isabet oranları ve geri dönüş tetikleme sayıları. Artan zaman aşımı oranı, sağlayıcınızın kapasite sorunları yaşadığı anlamına gelebilir. Düşen önbellek isabet oranı, kullanıcılarınızın daha çeşitli sorular sorduğu anlamına gelebilir.

Değerlendirme Döngüleri Kalite Açığını Nasıl Kapatır?

İşte çok az ekibin gerçekten içselleştirdiği bir bakış açısı: değerlendirme bir test sorunu değil -- bir gözlemlenebilirlik sorunudur. Değerlendirmeleriniz, dağıtımdan önce bir CI/CD pipeline'ında değil, üretim trafiği üzerinde sürekli çalışmalıdır.

Neden basittir. Kullanıcılarınızın göndereceği her girdiyi tahmin edemezsiniz. Dağıtım öncesi test paketleri bilinen kalıpları kapsar, ancak üretim trafiği tuhaf, düşmanca ve sürekli değişkendir. Çevrimiçi değerlendirme -- örneklenmiş canlı istekler üzerinde kalite kontrolleri çalıştırma -- test paketinizin hiç hayal etmediği başarısızlıkları yakalar.

Yargıç olarak LLM otomatik çevrimiçi değerlendirme için en pratik kalıptır. Başka bir modelin çıktısını alaka, sadakat, yardımseverlik ve güvenlik gibi boyutlarda puanlamak için ayrı bir model (genellikle daha ucuz bir tane) kullanırsınız. Mükemmel değil -- yargıç modelin kendi önyargıları var -- ancak sonsuz ölçeklenir ve kalite sorunlarının büyük çoğunluğunu yakalar.

Hamel Husain'in savunduğu gibi, değerlendirmeler YZ geliştirme yaşam döngünüzde neredeyse her şeyden önce gelmeli. Ölçemediğinizi iyileştiremezsiniz. İşte minimal bir yargıç-olarak-LLM işlevi:

python
async def evaluate_faithfulness(question: str, context: str, answer: str) -> float:
    """Yanıtın verilen bağlamda temellendirilip temellendirilmediğini puanlar (0.0-1.0)."""
    judge_prompt = f"""Bu yanıtın bağlama sadık olup olmadığını değerlendirin.
    Soru: {question}
    Bağlam: {context}
    Yanıt: {answer}
    Sadece 0.0 (halüsine edilmiş) ile 1.0 (tamamen temellendirilmiş) arasında bir puan döndürün."""

    response = await openai_client.chat.completions.create(
        model="gpt-4o-mini",  # ucuz yargıç modeli
        messages=[{"role": "user", "content": judge_prompt}],
        temperature=0
    )
    return float(response.choices[0].message.content.strip())

Alaka, toksisite ve tutarlılık gibi değerlendirme ölçümleri hakkında daha derin bir bakış için Confident AI'nin LLM değerlendirme ölçümleri rehberi her birini pratik puanlama rubrikleriyle açıklar.

Döngüde insan değerlendirmesi otomatik yaklaşımı tamamlar. Alan uzmanları üretim izlerinin bir örneğini açıklamalar ekler -- kötü çıktıları işaretler, puanları düzeltir ve sınır vakalarını etiketler. Bu açıklamalar, otomatik değerlendirmelerinizi zamanla daha akıllı hale getirerek değerlendirme veri setlerinizi besler.

Sonuç, değerlendirme volan çarkı olarak adlandırdığım şeydir: üretim çıktılarını gözlemle, kaliteyi değerlendir (otomatik + insan), istemleri ve almayı iyileştir, değişiklikleri dağıt, tekrar gözlemle. Her döngü sisteminizi ölçülebilir şekilde daha iyi hale getirir. Bu volan çarkını haftalık çalıştıran ekipler, üç aylık değerlendirme sprintleri yapan ekiplerin eşleşemeyeceği kalite iyileştirmeleri görür.

YZ Ajanlarını Gözlemlemek: 2026'nın Zorluğu

Tek LLM çağrılarını gözlemlemek zorsa, ajanlar bir büyüklük sırası daha zordur. Bir ajan yalnızca metin üretmez -- akıl yürütür, planlar, araçlar kullanır, kararlar alır ve bazen geri adım atar. Tek bir kullanıcı isteği, her biri bir öncekinin üzerine inşa edilerek 5, 10 hatta 50 LLM çağrısını tetikleyebilir.

Üretimde ajan dağıtıyorsanız, gözlemlenebilirlik katmanına geri dönmeden önce iş dünyası için YZ ajanlarını anlamak isteyeceksiniz.

Temel değişim, istek düzeyi izlemeden oturum düzeyi izlemeye geçiştir. Tek bir ajan oturumu, birden fazla araç çağrısı, bellek alımı ve alt ajan delegasyonuyla dakikalar veya saatler sürebilir. İzinizin yalnızca bireysel LLM çağrılarını değil, tam karar ağacını yakalaması gerekir.

İşte ajan izlemenin standart LLM izlemenin yapmadığı şeyleri yakalaması gerekenler:

  • Araç çağrıları ve sonuçları -- Ajan hangi araçları çağırdı? Ne döndürdüler? Ajan sonuçları doğru yorumladı mı?
  • Akıl yürütme zincirleri -- Her adımda ajanın planı neydi? Oturum ortasında yaklaşımını değiştirdi mi?
  • Çok ajanlı sistemlerde devirler -- Bir ajan başkasına devrettiğinde, izin devri temiz şekilde izlemesi gerekir
  • Durum geçişleri -- Ajanın kararlarını her karar noktasında tam bağlamı görerek adım adım yeniden oynatabilme becerisi
  • Token bütçeleri -- Ajanlar doğrudan LLM çağrısının 10-100 katı token harcayabilir. Oturum başına kümülatif token harcamasını takip etmek maliyet kontrolü için kritiktir

OpenTelemetry topluluğu, ajan-spesifik izleme standartları üzerinde aktif olarak çalışmaktadır; GenAI anlamsal kurallarını araç çağrıları, planlama adımları ve ajan devretmeleri için span türleriyle genişletmektedir. Hâlâ gelişiyor ama yön açık: ajanların gözlemlenebilirlik yığınında birinci sınıf desteğe ihtiyacı var, sonradan eklenen geçici çözümlere değil.

Pratikte, ajan izleme için şu anda en iyi donanımlı araçlar, her ikisi de oturum düzeyi gruplama, iç içe çok adımlı izler ve araç çağrısı atfını destekleyen Langfuse ve Braintrust'tır. LangChain veya LangGraph ile inşa ediyorsanız, LangSmith düşünce zinciri görünürlüğüyle derin yerel entegrasyon sunar.

YZ Gözlemlenebilirlik Araçları Karşılaştırması: Hangisini Seçmelisiniz?

Araç ortamı 2024'ten bu yana patlamış durumda. İşte 2026'da değerlendirmeye değer sekiz platform ve ardından bir karşılaştırma matrisi.

Langfuse açık kaynak lideridir. MIT lisanslı, kendi sunucunuzda barındırılabilir ve v3 itibarıyla tamamen OpenTelemetry-yerel. İzleme, değerlendirme, istem yönetimi ve maliyet takibini kapsar. Verileriniz üzerinde tam kontrol ve sıfır satıcı bağımlılığı istiyorsanız, Langfuse varsayılan tercihtir.

Braintrust değerlendirme odaklı bir yaklaşım benimser. Puanlama çerçevesi tartışmasız kategorinin en iyisidir -- özel puanlayıcılar tanımlar, üretim trafiği üzerinde çalıştırır ve zaman içinde kalite eğilimlerini takip edersiniz. Çıktı kalitesinin en öncelikli konu olduğu ekipler için mükemmel.

Arize Phoenix geleneksel ML gözlemlenebilirlik dünyasından gelir. Elastic License 2.0 ile dağıtılır; yani OSI onaylı açık kaynak değil, kaynağı erişilebilir (source-available) bir lisanstır: kodu okuyabilir, fork edebilir ve kendi sunucunuzda barındırabilirsiniz. Sapma tespiti ve gömme kümelemesinde güçlü ve özellikle LLM'lere uygulanan tanıdık kavramları görmek isteyen ML mühendislik geçmişine sahip ekipler için iyi.

Helicone radikal olarak farklı bir yaklaşım benimser: bir proxy. LLM trafiğinizi Helicone üzerinden yönlendirin ve tam anlamıyla sıfır kod değişikliğiyle izleme, maliyet takibi ve önbelleğe alma elde edersiniz. Kurulum hızı önceliğinizse, hiçbir şey bunu yenemez.

LangSmith, LangChain ekibinin gözlemlenebilirlik platformudur. LangChain veya LangGraph kullanıyorsanız entegrasyon sorunsuzdur -- derin zincir izleme, oyun alanı hata ayıklama ve veri kümesi yönetimi elde edersiniz. Dezavantajı LangChain ekosistemine satıcı bağımlılığıdır.

Weights & Biases Weave, W&B'nin deney takibini üretime genişletir. Ekibiniz model eğitimi ve değerlendirmesi için zaten W&B kullanıyorsa, Weave başka bir satıcı eklemeden üretim gözlemlenebilirliğine köprü kurar.

Datadog LLM Observability kurumsal seçenektir. LLM izlerini doğrudan Datadog'un APM, panoları ve uyarılarına entegre eder. Operasyon ekibiniz zaten Datadog'da yaşıyorsa, bu en az dirençli yoldur.

Elastic Observability LLM izlemeyi ELK yığınına taşır. Açık (SSPL lisansı), kendi sunucunuzda barındırılabilir ve log analizi için zaten Elasticsearch ve Kibana çalıştırıyorsanız doğal bir uyum.

AraçAçık Kaynak?Kendi Sunucunda?İzlemeDeğerlendirmeMaliyet TakibiAjan DesteğiÜcretsiz KatmanBaşlangıç Fiyatı
LangfuseEvet (MIT)EvetGüçlüGüçlüEvetGüçlüEvet$0 (kendi sunucu)
BraintrustKısmiHayırGüçlüSınıfının en iyisiEvetGüçlüEvet$25/ay
Arize PhoenixKaynağı erişilebilir (Elastic License 2.0, OSI onaylı değil)EvetGüçlüİyiTemelOrtaEvet$0 (kendi sunucu)
HeliconeEvetEvetİyiTemelSınıfının en iyisiOrtaEvet$0 (kendi sunucu)
LangSmithHayırHayırLangChain için en iyiİyiEvetİyi (LangGraph)Sınırlı$39/ay
W&B WeaveKısmiHayırİyiİyiEvetOrtaEvet$50/ay
Datadog LLMHayırHayırİyiTemelEvetOrtaDenemeÖzel
ElasticEvet (SSPL)EvetİyiTemelTemelTemelDenemeÖzel

Uygulamalı testlerle derinlemesine araç incelemeleri için En İyi YZ Gözlemlenebilirlik Platformları [yakında] rehberimize bakın.

Karar: Tek bir kazanan yok -- yığınınıza, ekibinize ve önceliklerinize bağlı. Langfuse çoğu ekip için en güvenli varsayılan tercihtir. Braintrust değerlendirme kalitesinde öne çıkar. Helicone kurulum hızında kazanır. Datadog zaten ekosistemindeyseniz kazanır.

Doğru YZ Gözlemlenebilirlik Aracını Nasıl Seçersiniz?

Özellik matrislerinde bunalmak yerine kendinize bu soruları sorun ve yanıtların seçiminizi daraltmasına izin verin.

Eğer...DüşününNeden
Tam kontrol ve kendi sunucunuzda barındırma istiyorsanızLangfuse veya Arize PhoenixLangfuse MIT, Phoenix ise Elastic License 2.0 ile kaynağı erişilebilir. Satıcı bağımlılığı yok, veriler altyapınızda kalır
LangChain/LangGraph kullanıyorsanızLangSmithYerel entegrasyon, derin düşünce zinciri izleme
Değerlendirme kalitesini her şeyin üstünde tutuyorsanızBraintrustDeğerlendirme odaklı mimari, en iyi puanlama çerçevesi
Kurumsal APM entegrasyonuna ihtiyaç duyuyorsanızDatadog LLM ObservabilityMevcut altyapı izlemenizle birleşik pano
Mümkün olan en hızlı kurulumu istiyorsanızHeliconeProxy tabanlı, başlamak için harfiyen tek satır kod
ML deneyleri için zaten W&B kullanıyorsanızWeaveDeney takibinden üretime sorunsuz köprü
Çok ajanlı sistemler inşa ediyorsanızLangfuse veya Braintrust2026'da en iyi ajan ve oturum düzeyi izleme desteği

En önemli tavsiye? Basit başlayın ve geliştirin. Bir araç seçin, kritik yolunuzu enstrümanlayın ve bu hafta temel izlemeyi çalışır hale getirin. Daha sonra değerlendirme ekleyebilir, platform değiştirebilir veya kendi sunucunuzda barındırabilirsiniz. En kötü karar, karar vermemektir -- üretimde gözlemlenebilirlik olmadan LLM çalıştırmak, gece far olmadan araba sürmek gibidir.

Doğru yığını seçmek gözlemlenebilirlik ihtiyaçlarınızı da etkiler -- farklı mimari seçimlerin izleme gereksinimlerinizi nasıl şekillendirdiğini görmek için SaaS için en iyi YZ yığını rehberimize bakın.

Uygulama Yol Haritası: 5 Adımda Sıfırdan Gözlemlenebilire

İşte önerdiğimiz pratik yol. Her adım bir öncekinin üzerine inşa eder ve 1-3. adımları tek bir sprint içinde tamamlayabilmelisiniz.

Adım 1: Enstrümanlama

Her LLM çağrısına izleme ekleyin. Sıfırdan başlıyorsanız, OpenTelemetry kullanın -- satıcı bağımsız ve geleceğe hazır. Daha hızlı değer elde etmek istiyorsanız, seçtiğiniz platformun SDK'sını (Langfuse, Braintrust vb.) kullanın. Önemli olan şunları yakalamak: model adı, giriş/çıkış tokenleri, gecikme ve istem/tamamlama çifti.

Adım 2: İzleme

Enstrümanlamanızı bir backend'e bağlayın ve izlerin doğru aktığını doğrulayın. RAG pipeline'ları ve çok adımlı zincirler için iç içe yayılımların düzgün şekilde oluşturulduğunu kontrol edin. Büyük üç için panolar kurun: gecikme (P50/P95), token kullanımı ve hata oranı. Bu operasyonel temel çizginizdir.

Adım 3: Değerlendirme

Örneklenmiş üretim trafiği üzerinde otomatik kalite puanlaması kurun. RAG için sadakat (ya da sohbet için yardımseverlik) üzerinde basit bir yargıç-olarak-LLM değerlendiricisiyle başlayın. Başlangıçta trafiğin %5-10'unda çalıştırın. Kalite temel çizgisi oluşturmak için zaman içinde puanları takip edin.

Adım 4: Uyarı

En önemli ölçümler için uyarılar yapılandırın. Önerilen başlangıç eşikleri:

  • Maliyet: Günlük harcama 7 günlük ortalamanın %150'sini aşarsa uyar
  • Gecikme: P95, 15+ dakika boyunca temel çizginin 2 katını aşarsa uyar
  • Kalite: Ortalama değerlendirme puanı temel çizginin %10'dan fazla altına düşerse uyar
  • Hatalar: Herhangi bir 10 dakikalık pencerede hata oranı %5'i aşarsa uyar

Adım 5: Yineleme

İşte volan çarkının devreye girdiği yer burası. Değerlendirme veri kümeleri oluşturmak için üretim izlerini kullanın. Zayıf istemleri belirlemek için değerlendirme puanlarını kullanın. Model yönlendirmesini optimize etmek için maliyet verilerini kullanın. İyileştirmeleri üretime geri besleyin ve etkiyi ölçün. Haftalık tekrarlayın.

Gözlemlenebilirlikten en fazla değer elde eden ekipler en süslü panolara sahip olanlar değil -- bu geri bildirim döngüsünü tutarlı şekilde çalıştıranlardır.

Techsy YZ Gözlemlenebilirliğine Nasıl Yaklaşıyor?

Techsy olarak, birden fazla sektörde YZ uygulamaları inşa edip dağıttık ve gözlemlenebilirlik, birinci günden itibaren her üretim sisteminin vazgeçilmez bir parçası oldu.

Müşteri projeleri için standart yaklaşımımız üç ilkeyi izler:

  1. OTEL-önce enstrümanlama -- Varsayılan olarak OpenTelemetry ile enstrümanlarız; yeniden enstrümanlama olmadan backend'leri değiştirme seçeneğini açık tutarız. Bu, ihtiyaçları geliştiğinde müşterilere önemli miktarda taşıma çabası tasarrufu sağladı.
  2. Değerlendirme odaklı geliştirme -- Değerlendirme döngülerini ilk üretim dağıtımından önce, sonra değil, kurarız. Otomatik kalite puanlaması birinci günden itibaren çalışarak bize üzerine gelişebileceğimiz bir temel sağlar.
  3. Maliyet-bilinçli mimari -- Model yönlendirmeyi mimariye erken yerleştiririz; kalite kaybı olmadan daha ucuz modeller tarafından işlenebilecek sorguları belirlemek için gözlemlenebilirlik verilerini kullanırız. Çoğu proje optimizasyonun ilk ayı içinde %40-60 maliyet azalması görür.

Açık kaynak kontrolü isteyen ekipler için genellikle Langfuse'u, değerlendirme kalitesinin en öncelikli konu olduğu ekipler için Braintrust'ı öneririz. Zaten Datadog çalıştıran kurumsal müşteriler için LLM gözlemlenebilirliğini mevcut yığınlarına entegre ederiz.

Bir YZ uygulaması inşa ediyorsunuz ve gözlemlenebilirlik kurulumunda yardıma mı ihtiyacınız var? Ücretsiz danışmanlık alın.

SSS

YZ gözlemlenebilirliği nedir?

YZ gözlemlenebilirliği, üretimdeki YZ sistemlerinin -- özellikle LLM'lerin -- iç davranışını anlama pratiğidir. Çıkış kalitesi, maliyet takibi, gecikme profili oluşturma ve iz düzeyi hata ayıklama için çalışma süresi izlemenin ötesine geçer. Amaç "model çalışıyor mu?" değil, "model bu çıktıyı neden üretti?" sorusunu yanıtlamaktır.

YZ izleme ile YZ gözlemlenebilirliği arasındaki fark nedir?

İzleme, önceden tanımlanmış ölçümleri takip eder ve eşikler aşıldığında uyarı verir -- "bir sorun var mı?" sorusunu yanıtlar. Gözlemlenebilirlik, öngörmediğiniz arıza modları için bile neyin yanlış olduğunu araştırmanız için araçlar sağlar. LLM'lerle bu ayrım daha fazla önem taşır çünkü çoğu arıza yenidir: model çökmez, yalnızca hiçbir önceden tanımlanmış uyarının yakalamayacağı ince şekilde yanlış çıktılar üretir.

2026'da en iyi YZ gözlemlenebilirlik araçları nelerdir?

Ücretsiz olarak kendi sunucunuzda barındırabileceğiniz en iyi seçenekler Langfuse (MIT, en popüler), Arize Phoenix (Elastic License 2.0, kaynağı erişilebilir, ML odaklı) ve Helicone (proxy tabanlı, en kolay kurulum). Ticari platformlar için Braintrust değerlendirmede öne çıkar, LangSmith LangChain kullanıcıları için en iyisi, Datadog LLM Observability ise kurumsal tercihtir. Tam dökümü için yukarıdaki karşılaştırma tablosuna bakın.

LLM gözlemlenebilirliği nasıl uygulanır?

LLM çağrılarınıza izleme ekleyerek başlayın -- OpenTelemetry veya seçtiğiniz platformun SDK'sı ile. Model adı, token kullanımı, gecikme ve giriş/çıkış çiftlerini yakalayın. Bir backend bağlayın (Langfuse, Braintrust vb.), gecikme ve maliyet için panolar kurun, örneklenmiş trafiğe otomatik değerlendirme ekleyin ve uyarıları yapılandırın. Temel izlemeyi bir saatten kısa sürede çalışır hale getirebilirsiniz.

YZ gözlemlenebilirlik araçlarının maliyeti ne kadardır?

Langfuse (MIT), Arize Phoenix (Elastic License 2.0 ile kaynağı erişilebilir) ve Helicone gibi araçları kendi sunucunuzda barındırmak ücretsizdir -- yalnızca altyapı için ödeme yaparsınız. Bulutta barındırılan katmanlar $25/ay (Braintrust) ile $50/ay (W&B Weave) arasında başlar. Datadog gibi kurumsal platformlar özel fiyatlandırma kullanır. Çoğu ekip ücretsiz başlayabilir ve yalnızca ayda 50.000'den fazla iz geçtikten sonra ücretli katamanlarına ihtiyaç duyar.

LLM gözlemlenebilirliği için hangi ölçümler takip edilmeli?

Temel ölçümler şunlardır: gecikme (P50/P95/P99 ve ilk token süresi), token kullanımı (istek başına giriş/çıkış), maliyet (istek, kullanıcı ve özellik başına atıf), kalite puanları (otomatik değerlendirmelerden) ve hata oranları (API hataları, koruma rail tetiklemeleri, zaman aşımları). Gecikme ve maliyetle başlayın, olgunlaştıkça kalite puanlaması ekleyin.

Üretimdeki halüsinasyonlar nasıl tespit edilir?

En pratik yaklaşım sadakat puanlamasıdır -- modelin çıktısının alınan bağlamda temellendirilip temellendirilmediğini değerlendirmek için yargıç-olarak-LLM kullanmak (RAG sistemleri için). Bu değerlendirmeyi örneklenmiş üretim trafiğinde çalıştırır ve puanı zaman içinde takip edersiniz. Sadakat eşiğinizin altına düştüğünde, belirli izleri araştırırsınız. Daha yüksek doğruluk için bunu işaretlenmiş çıktılar üzerinde döngüde insan incelemesiyle birleştirin.

LLM'ler için OpenTelemetry nedir?

OpenTelemetry (OTEL), dağıtık izleme için endüstri standardı haline gelen açık kaynaklı bir gözlemlenebilirlik çerçevesidir. GenAI anlamsal kuralları, OTEL'i LLM telemetrisi için standartlaştırılmış öznitelik adlarıyla genişletir -- gen_ai.request.model, gen_ai.usage.input_tokens ve gen_ai.system gibi şeyler. Bu, bir kez enstrümanladığınız ve izleri herhangi bir uyumlu backend'e gönderebildiğiniz anlamına gelir.

Çok ajanlı YZ sistemleri nasıl gözlemlenir?

Ajan gözlemlenebilirliği, birden fazla LLM çağrısı, araç çağrısı ve alt ajan devretmelerinde tam karar ağacını yakalayan oturum düzeyi izleme gerektirir. Oturum başına akıl yürütme zincirlerini, araç çağrısı sonuçlarını, durum geçişlerini ve kümülatif token bütçelerini takip etmeniz gerekir. Langfuse ve Braintrust şu anda en iyi ajan izleme desteğini sunar ve OpenTelemetry topluluğu ajan-spesifik anlamsal kurallar geliştirmektedir.

Langfuse, LangSmith'ten daha mı iyi?

Yığınınıza bağlı. Langfuse, açık kaynak, kendi sunucunda barındırma, satıcı bağımsızlığı ve OpenTelemetry-yerel alımı istiyorsanız daha iyidir. LangSmith, LangChain/LangGraph ekosistemine yoğun yatırım yapmış ve yerel düşünce zinciri hata ayıklaması istiyorsanız daha iyidir. Langfuse herhangi bir çerçeveyle çalışır; LangSmith LangChain için optimize edilmiştir. Sıfırdan başlayan çoğu ekip için Langfuse daha fazla esneklik sunar.

LLM gözlemlenebilirliği için mevcut APM araçlarını kullanabilir miyim?

Kısmen. Datadog ve Elastic gibi araçlar LLM'e özgü özellikler ekledi, bu nedenle zaten kullanıyorsanız yeni bir satıcı eklemeden temel izleme ve maliyet takibi alırsınız. Ancak değerlendirme yetenekleri, istem yönetimi ve ajan izlemede genellikle amaca yönelik araçların (Langfuse, Braintrust) gerisinde kalırlar. Birçok ekip mevcut APM'lerini altyapı ölçümleri için kullanır ve kalite ve değerlendirme için özelleştirilmiş bir LLM gözlemlenebilirlik aracı ekler.

Kaynaklar

Etiketler

ai observabilityllm monitoringllm tracingai agentslangfuseopentelemetryllm evaluationproduction ai

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.