ai-machine-learning

Online vs Offline LLM Değerlendirme: Hangisine İhtiyacınız Var (ve Ne Zaman)?

Yazan Mert Batur
Aug 1, 2026
10 okuma
Online vs Offline LLM Değerlendirme: Hangisine İhtiyacınız Var (ve Ne Zaman)?

Online vs Offline LLM Değerlendirme: Hangisine İhtiyacınız Var (ve Ne Zaman)?

Online vs offline LLM değerlendirme tek bir karardır, iki ayrı karar değil; promptfoo paketimiz bunu geçen salı kanıtladı: yeniden yazılmış bir sistem prompt'u, 47 test vakası ve yaklaşık 90 saniyelik CI süresinde 0,91'den 0,74'e düşen faithfulness. Offline kontrol bu regresyonu merge öncesinde yakaladı; üretim izleme ise onunla daha sonra, bir destek talebi kılığında karşılaşacaktı. Offline ya da online, hüküm aynı: iki şerit, farklı işler.

Offline LLM değerlendirmesi, modelinizi dağıtımdan önce sabit bir veri setine karşı çalıştırır ve yapılan değişikliğin ölçülen kaliteyi bozmadığını kanıtlar. Online değerlendirme ise lansman sonrasında canlı üretim trafiğini puanlayarak veri setinin hiç içermediği sorunları ortaya çıkarır. Çoğu ekip ikisine de sırayla ihtiyaç duyar: offline dağıtımı kapıda durdurur, online kaymayı yakalar.

Öne Çıkanlar

  • Offline değerlendirme, dağıtımdan önce sabit bir veri setine karşı çalışır; online değerlendirme, lansman sonrası canlı trafiği puanlar.
  • Çoğu ekip ikisine de ihtiyaç duyar: offline dağıtımları kapıda durdurur, online ise veri setinin kaçırdıklarını yakalar.
  • Offline; prompt regresyonlarını ve biçim bozulmalarını yakalar. Online; kaymayı (drift), yük altındaki gecikmeyi ve entegrasyon tuhaflıklarını yakalar.
  • Offline eval'ları CI merge kapısı olarak bağlayın; online puanları üretim izlerinden eval setinize akıtın.

Online ve Offline Değerlendirme Gerçekte Nasıl Farklılaşır? (9 Boyut)

İki mod dokuz eksende farklılaşır, ama belirleyici olan veri kaynağıdır: offline değerlendirme, dağıtımdan önce sabit ve versiyonlanmış bir veri setini puanlarken online değerlendirme, lansman sonrası canlı trafiği puanlar. Maliyet, gecikme, risk ve yönetişim dahil diğer her fark bu ayrımdan doğar.

Label Studio'nun öğrenim merkezi bu ikiliyi rakip değil, birbirini tamamlayan modlar olarak çerçeveliyor ve biz de katılıyoruz. Aşağıdaki tablo bu çerçeveyi, onların genel ML versiyonunda yer almayan LLM'e özgü metriklerle genişletiyor.

BoyutOfflineOnline
Veri kaynağıSabit altın veri seti, git'te versiyonluCanlı üretim izleri, örneklenmiş
ZamanlamaDağıtım öncesi, her PR'daLansman sonrası, sürekli
Çalıştırma başına maliyetPaket başına judge token'ları; marjinal maliyet sıfıra yakınÖrneklenen trafikte judge token'ları; hacimle ölçeklenir
Gecikme kısıtıYok; toplu halde, rahatçaSıcak yollarda saniye altı bütçeler
Kullanıcıya riskSıfır; hatalar kullanıcıya hiç ulaşmazGerçek; kötü çıktılar canlı oturumlara yansır
Geri bildirim hızıPR başına dakikalarAkışlarda saniyeler ile dakikalar arası
Metrik türleriFaithfulness, answer relevancy, biçim uyumu, benchmark skorlarıGecikme yüzdelikleri, hata oranı, halüsinasyon oranı, kullanıcı geri bildirimi
TekrarlanabilirlikSabitlenmiş model ve veri setiyle deterministikDeterministik değil; trafik karışımı her gün değişir
Yönetişim ve denetimVersiyonlu çıktılar, sürümler arası diff alınabilirPanolar ve alarmlar; yeniden üretmesi daha zor

Bizim yorumumuz: offline sütunu "bu değişiklik bir şeyleri bozdu mu?" sorusuna, online sütunu ise "üretim, test ettiğimizden uzaklaşıyor mu?" sorusuna yanıt verir. İki modun en keskin ayrıştığı satır metrik türleridir; LLM değerlendirme metrikleri rehberimiz her birini ayrıntısıyla anlatır.

Her Mod Neyi Yakalar ve İkisinin de Kaçırdığı Ne?

Her mod, diğerinin göremediği kendine özel bir hata sınıfına sahiptir. Offline, sizin yaptığınız değişiklikleri yakalar; online, dünyanın sizin etrafınızda yaptığı değişiklikleri. Her iki ağdan da kurtulan pahalı hatalar ise insan incelemesi gerektirir. Bu sınıflandırma, her modun bildirdiklerinden çıkardığımız bir sentezdir, yayımlanmış bir standart değil.

ÇeyrekÖrneklerAksiyon
Yalnızca offlinePrompt regresyonları, bozuk çıktı biçimleri, benchmark skor düşüşleri, eşiğin altına inen faithfulnessCI'da merge'ü engelle
Yalnızca onlineDağılım kayması, yük altında gecikme, entegrasyon tuhaflıkları, düşmanca kötüye kullanım örüntüleriAlarm ver, izleri örnekleyip eval setine yönlendir
İkisinin de yakaladığıHalüsinasyon oranı sıçramaları, olgusal tutarlılık aşınmasıİkisini de tut; çabayı azalt, kapsama alanını değil
İkisinin de yakalayamadığıYeni uç vakalar, öznel kalite kararları, marka sesi kaymasıİnsan inceleme kuyruğu; etiketlenen vakalar offline sete girer

Yalnızca offline çeyreği, CI kapılarının neden var olduğunu kanıtladığı yerdir: biçim uyumunu sessizce %99'dan %91'e düşüren yeniden yazılmış bir prompt, kod incelemesinde görünmez ama 47 vakalık bir pakette apaçık ortadadır. Yalnızca online çeyreği daha sinsi. Gerçek kullanıcılar, altın veri setinizin hiç görmediği şekilde ifade eder; üçüncü parti API'ler staging'in hiç denk gelmediği zamanlarda zaman aşımına uğrar ve birileri, sırf ne olacağını görmek için sohbet botunuza 40.000 karakterlik bir prompt gönderir. Bu taraf için üretimde ajan değerlendirme rehberimiz, tek tek çıktıları değil, çok adımlı yörüngelerin puanlanmasını ele alır.

Alt satır, ekiplerin atladığı ve sonunda canlarını yakan satırdır. Kullanıcı kaybettiren hatalar, iki modun da tek başına yakalayamadığı hatalardır. Bunlar için döngüde bir insan gerekir.

Offline Eval'ları CI Kapısına Nasıl Bağlarsınız? (Kimsenin Göstermediği Yapılandırma)

Prompt'u, modeli ya da retrieval yapılandırmasını etkileyen her pull request'e, gerekli statü kontrolü olarak bir eval çalıştırıcısı ekleyin. Bir eşik belirleyin. Eşiğin altında merge'ü engelleyin. promptfoo dokümantasyonu tam da bu CI örüntüsünü anlatır ve bizim çalıştırdığımız da budur.

GitHub Actions adımı

Bugün çalıştırdığımız kapının sadeleştirilmiş hali:

yaml
name: llm-eval-gate

on:
  pull_request:
    paths: ["prompts/**", "evals/**", "src/rag/**"]

jobs:
  faithfulness-gate:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-node@v4
        with:
          node-version: 22
      - name: Run offline evals, fail the PR on regression
        run: npx promptfoo@latest eval --config evals/support-agent.yaml
        env:
          OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }}  # LLM-as-judge

YAML yapılandırması test vakalarını ve assertion'ları bildirir; paket eşiğin altına düştüğünde eval sıfır olmayan bir kodla çıkar, GitHub gerekli kontrolü başarısız olarak işaretler ve merge düğmesi griye döner. paths filtresi önemlidir: bir README düzeltmesi judge token'larını yakmamalı.

Kapı gerçekte neyi yakalar

Canlı versiyon, prompt'u etkileyen her PR'da destek ajanı RAG zincirimizi 47 altın vakaya karşı puanlar. Tam bir çalıştırma yaklaşık 90 saniye CI süresi alır ve faithfulness 0,82'nin altına düşerse merge otomatik olarak engellenir. Üç ay içinde, başka türlü yayına girecek iki regresyonu yakaladı: faithfulness'ı 0,91'den 0,74'e iten bir sistem prompt'u yeniden yazımı ve bağlam uzunluğunu ikiye katlayıp answer relevancy'yi eşiğin altına çeken bir retriever değişikliği. İkisi de incelemede tehlikeli görünmüyordu.

CI'da bir faithfulness kapısı, PR başına 90 saniyeye mal olur. Üretimde bir faithfulness regresyonu ise bir destek talebine ve bir geri alım operasyonuna mal olur.

Bu örüntüye takabileceğiniz çalıştırıcıları (promptfoo, DeepEval ve diğerlerini) LLM değerlendirme araçları karşılaştırmamızda inceledik.

Hangi Araç Hangi Modu Çalıştırır? (Araç-Mod Matrisi)

Hiçbir araç iki şeridi de tek başına temiz biçimde sahiplenmez. promptfoo ve DeepEval, dışa aktarılan üretim verisini belirli bir takvimde puanlayabilen offline öncelikli çalıştırıcılardır; Langfuse ve LangSmith ise içeri alınan izlere LLM-as-a-judge puanlayıcıları ekleyen online öncelikli iz depolarıdır. Matris, her sağlayıcının dokümantasyonuna dair bizim okumamızdır: yorumdur, kesin hüküm değil.

AraçOffline çalıştırıcıOnline puanlayıcıİkisi de yerleşik mi?Yapmadığı şey
promptfooEvet: YAML paketleri, CI yerleşik, red-team paketleriKısmen: aynı yapılandırmalar dışa aktarılan loglara karşıOffline öncelikli; online bir dışa aktarım adımı gerektirirCanlı izleri içeri almak; izleme panosu olarak çalışmak
DeepEvalEvet: pytest tarzı testler, 14+ metrikEvet, Confident AI platformu üzerindenEvet, barındırılan eklentiyleYalnızca açık kaynak kütüphane offline ile sınırlı
LangfuseKısmen: SDK üzerinden veri seti deneyleriEvet: içeri alınan izlerde judge değerlendiricilerEvet: veri setleri ve iz puanlayıcılarCI merge kapınızı çalıştırmak; onu kendiniz bağlarsınız
LangSmithEvet: veri setleri ve offline deneylerEvet: otomasyonlar örneklenen izleri puanlarEvetLangChain yığınının dışında sürtünmesiz çalışmak
OpenAI EvalsEvet: kayıt defteri tarzı YAML eval'larıHayırHayırÜretim izi işlem hatları; OpenAI dışı modeller
Arize PhoenixEvet: notebook öncelikli deneylerEvet: satır içi değerlendiricilerle span ve izlerEvetHafif kurulum; gözlemlenebilirlik önce gelir

İlk ihtiyacınız CI'da kötü prompt'ları engelleyen bir merge kapısıysa promptfoo ya da DeepEval seçin. İlk ihtiyacınız canlı trafiği puanlamaksa Langfuse ya da LangSmith seçin; Langfuse vs LangSmith karşılaştırmamız bu seçimi ayrıntılı biçimde ele alır. OpenAI Evals ise aykırı isim olmaya devam ediyor: üretim tarafı olmayan, kayıt defteri tarzı bir offline çalıştırıcı.

promptfoo PR'larınızı kapıda durdurur. Langfuse üretim izlerinizi puanlar. Hiçbiri diğerinin yerini tutmaz.

Geri Bildirim Döngüsü, Online Hataları Offline Testlere Nasıl Dönüştürür?

Düşük puanlı üretim izlerini örnekleyin, etiketleyin ve offline eval setine işleyin. Böylece regresyon paketi, üretimin size çıkardığı her sürprizle büyür ve bir sonraki dağıtım genişlemiş sete karşı kapıdan geçer. Volan (flywheel) çerçevelemesi bize ait; çoğu ekibin hiç kurmadığı parça da tam olarak bu.

Bizim çalıştırdığımız haliyle döngü:

  1. Online puanlayıcılar, 0,7 judge skorunun altındaki izleri işaretler.
  2. Haftada 20-30 işaretli iz örnekliyoruz.
  3. Bir insan her birini etiketler: beklenen çıktı ve hata sınıfı.
  4. Etiketlenen vakalar, yeni altın örnekler olarak offline eval setine katılır.
  5. Bir sonraki PR genişlemiş pakete karşı çalışır ve döngü yeniden başlar.

Örnekleme, LLM gözlemlenebilirlik katmanınızda başlar, çünkü hammaddeniz izlerdir. Kadans konusunda: haftalık, aylıktan iyidir, çünkü kayma bileşik büyür. Haftada 10-15 vaka etiketliyoruz ve set, yeni etiketler geçiş oranını oynatmayı bıraktığında "yeterince büyük" demektir; dar kapsamlı bir destek ajanı için bu, 150-250 vaka civarıdır. Modlar arasındaki çizgi giderek bulanıklaşıyor: Deepchecks'ın aktardığına göre Union.ai mühendisleri "offline" değerlendirmelerini birkaç dakikada bir planlayarak onları fiilen gerçeğe yakın zamanlı kontrollere dönüştürüyor.

Eval setiniz sabit bir çıktı değildir. Üretimin sizi şaşırttığı her hafta büyür.

İkisine Ne Zaman İhtiyaç Duyarsınız? (Aşamaya Göre Online vs Offline LLM Değerlendirme)

Lansman haftasından itibaren ikisine de ihtiyaç duyarsınız, ancak denge aşamaya göre kayar: dağıtım öncesi işi offline tek başına taşır, lansman haftası gölge (shadow) ya da kanarya (canary) puanlamayı ekler, kararlı durumda online izleme dönemsel offline yeniden çalıştırmalarla birlikte yürür ve bir kayma alarmı, yeniden üretilmiş bir offline testi ve daha büyük bir eval setiyle sonuçlanmalıdır.

AşamaOfflineOnlineAksiyon
Dağıtım öncesiHer PR'da regresyon kapısıHenüz yokEşiğin altında merge'ü engelle
Lansman haftasıSürüm adayında tam paketTrafiğin %5-10'unda gölge veya kanarya puanlamaOnline skorları offline taban çizgisiyle karşılaştır
Kararlı durumYenilenmiş veri setinde dönemsel yeniden değerlendirme, haftalık veya aylıkSürekli örneklenmiş puanlama ve alarmlarKaymayı izle; çeyreklik dönemlerle taban çizgisini yenile
Kayma tespit edildiBaşarısız izleri offline'da yeniden üretAlarmı tetleyen tarafEtiketlenmiş izleri eval setine ekle; sonraki dağıtımı yeniden kapıya al

Dağıtım öncesi, katı olmanın en ucuz olduğu yerdir: engellenen bir merge dakikalar kaybettirir; kötü bir sürüm güven kaybettirir. Lansman haftası, ekiplerin en az yatırım yaptığı aşamadır; oysa küçük bir trafik diliminde gölge puanlama ucuza gelir ve altın veri setinin yanılıp yanılmadığını ortaya koyar. Kararlı durum, rehavetin yerleştiği yerdir; bu yüzden yeniden değerlendirmeyi takvime bağlayın.

Peki ya AB Yapay Zekâ Yasası?

AB Yapay Zekâ Yasası'nın (EU AI Act) yüksek riskli sistem yükümlülükleri Ağustos 2026'ya kadar kademeli olarak yürürlüğe giriyor; tam son tarih takvimi EUR-Lex üzerinde yayımlanmış durumda ve uygunluk örüntüsü iki moda temiz biçimde oturuyor. Belgelenmiş offline kanıtlar, sistemin yayından önce kalite hedeflerini karşıladığını gösterir; süregelen online izleme ise yayından sonra karşılamaya devam ettiğini gösterir. Bizim okumamıza göre denetim izi her iki çıktıya da ihtiyaç duyar, çünkü yalnızca offline logları sistemin uyumlu kaldığını kanıtlamaz ve yalnızca panolar da uyumlu biçimde yayına girdiğini kanıtlamaz. Bu bir yorumdur, hukuki tavsiye değildir; LLM değerlendirme işlem hattı pillar yazımız gereksinim setinin tamamını haritalar.

Offline değerlendirme kanıtınızdır. Online değerlendirme erken uyarı sisteminizdir. Düzenleyiciler ikisini de ister.

Yazar hakkında: Mert Batur, B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR işlem hatları geliştiren Techsy.io'nun Kurucu Ortağıdır. Techsy ekibinin üretimde fiilen kullandığı LLM araç yığını hakkında yazar. LinkedIn üzerinden bağlanabilirsiniz.

Sıkça Sorulan Sorular

Offline LLM değerlendirmesi nedir?

Offline LLM değerlendirmesi, bir modeli ya da prompt'u dağıtımdan önce sabit ve versiyonlanmış bir veri setine karşı çalıştırır. Tipik kontroller arasında alınan bağlama faithfulness, answer relevancy, biçim uyumu ve benchmark skorları bulunur. Veri seti çalıştırma sırasında hiç değişmediği için sonuçlar tekrarlanabilir ve diff alınabilir; offline paketlerin CI merge kapısı olarak çalışabilmesinin tam nedeni de budur.

Online LLM değerlendirmesi nedir?

Online LLM değerlendirme, lansman sonrasında canlı üretim trafiğini puanlar. Bir LLM-as-a-judge puanlayıcısı, örneklenen izleri halüsinasyon, ton ya da araç çağrısı doğruluğu açısından değerlendirir ve skorlar bir panoya akar. Ayrıca offline testlerin göremediği sinyalleri de toplar: yük altında gecikme, kullanıcı geri bildirimi ve gerçek sorguların altın veri setinizden nasıl saptığı.

Offline ve online LLM değerlendirmeyi ne zaman kullanmalıyım?

Dağıtımları kapıda durdurmak için offline değerlendirme kullanın: her prompt, model ya da retrieval değişikliği, merge öncesinde paketten geçmelidir. Yayına gireni izlemek için online değerlendirme kullanın. Çoğu ekip birini seçmek yerine ikisini sıraya koyar: önce offline, lansman haftasından itibaren online ve üretim hataları offline sete geri akar.

Online ve offline LLM değerlendirmeye bir örnek nedir?

Offline örnek: bir promptfoo paketi, her pull request'te 200 altın destek sorusunu çalıştırır ve faithfulness 0,82'nin altına düşerse merge'ü engeller. Online örnek: Langfuse, canlı izlerin %10'unu bir LLM-as-a-judge halüsinasyon kontrolüyle puanlar ve haftalık ortalama gerilediğinde alarm verir. Aynı rubrik, farklı veri kaynağı.

Human-in-the-loop, LLM değerlendirmesine nasıl oturur?

İnsanlar, iki modun da kapsamadığı boşluğu kapatır: yeni uç vakalar, öznel kalite kararları ve marka sesi kayması. Uygulanabilir bir kadans, haftada 10-20 düşük puanlı örneği etiketleyip etiketlenen vakaları offline eval setine işlemektir. İnceleme kuyruğu bir yan proje değil, bir işlem hattı girdisidir.

Online puanlamada Langfuse değerlendirmeleri nasıl çalışır?

Langfuse, uygulamanızdan izleri içeri alır, ardından her izi bir rubriğe göre puanlayan LLM-as-a-judge değerlendiriciler ekler: halüsinasyon, alaka, toksisite ya da özel bir prompt. Skorlar, oturumlara ve kullanıcılara bağlı bir panoya düşer. Ekipler, kalıcı biçimde düşük puanlı izleri regresyon testi için bir offline veri setine aktarır. Gözlemlenebilirlik platformları karşılaştırmamız, bu örüntüyü besleyen iz depolarını karşılaştırır.

CI/CD işlem hattına offline eval'ları nasıl eklerim?

Prompt'ları, modelleri ya da retrieval yapılandırmasını etkileyen pull request'lere, gerekli statü kontrolü olarak bir eval çalıştırıcısı ekleyin. Hem promptfoo hem DeepEval headless çalışır ve assertion başarısızlığında sıfır olmayan kodla çıkar; bu da merge'ü otomatik olarak engeller. Bu yazının başındaki YAML kapısı çalışan bir şablondur; 30-50 vakayla başlayın.

AB Yapay Zekâ Yasası offline mı online değerlendirme mi gerektirir?

Fiiliyatta ikisini de. Yasa, yüksek riskli sistemler için yayından önce kalite hedeflerinin karşılandığına dair belgelenmiş kanıt (yani offline çıktıları) ve dağıtım sonrasında süregelen izleme (yani online telemetri) bekler. EUR-Lex'e göre kademeli son tarihler Ağustos 2026'ya kadar uzanır. Bu, uygunluk örüntüsüne dair bizim okumamızdır, hukuki tavsiye değildir.

LLM-as-a-judge hem offline hem online modda çalışabilir mi?

Evet ve çalışmalıdır da, çünkü rubrik taşınabilir. Offline'da judge, CI sırasında eval setindeki her çıktıyı toplu halde puanlar. Online'da aynı judge prompt'u, örneklenen üretim izlerini gerçeğe yakın zamanlı puanlar. İki modda tek bir rubrik tutmak, offline taban çizginizi online kayma sinyalinizle karşılaştırılabilir kılan şeydir.

Offline ve online değerlendirme arasında hangi metrikler farklılaşır?

Offline metrikler, çıktı kalitesini gerçeğe karşı ölçer: faithfulness, answer relevancy, biçim uyumu, benchmark skorları. Online metrikler, operasyonel ve davranışsal sinyaller ekler: p95 gecikme, hata oranı, canlı trafikte halüsinasyon oranı, kayma skoru ve kullanıcı memnuniyeti. Offline listesi "iyi mi?" diye sorar; online listesi "hâlâ iyi mi?" diye sorar.

Kısa Versiyon

  • Offline ve online değerlendirme birbirini tamamlayan şeritlerdir, ya/ya da değildir: biri yayınladığınızı kapıda durdurur, diğeri yayınladığınızı izler.
  • Bu hafta CI kapısıyla başlayın, lansmanda online iz puanlamayı ekleyin ve eval setiniz bayatlamadan geri bildirim döngüsünü bağlayın.
  • Döngü, sistemin kendisidir. Statik bir altın veri seti çürür; büyüyen bir set bileşik değer üretir.

Eval işlem hattınıza ikinci bir göz isterseniz, ücretsiz danışmanlık alın.

Etiketler

online vs offline llm değerlendirmellm değerlendirmellm-as-a-judgeci değerlendirme kapısıllm üretim izleme

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.