![LLM Router: İstekleri Yönlendirin, Maliyeti %60 Düşürün [2026]](/_next/image?url=https%3A%2F%2Fmedia.techsy.io%2Ftechsy-io%2Fhero-506-1200x630.webp&w=3840&q=75)
LLM Router: İstekleri Yönlendirin, Maliyeti %60 Düşürün [2026]
LLM router, uygulamanızla birkaç dil modeli arasına giren ince bir katmandır ve her isteğe hangi modelin yanıt vereceğini seçer. İsteği inceler (görev türü, karmaşıklık, token bütçesi), en uygun modele iletir ve o model hata verirse yedeğe geçer. Hedef: en düşük token maliyetiyle işe tam oturan yanıtlar.
"İade politikanız nedir?" sorusunu yanıtlaması için frontier modele para ödemek, faturaların şişmesinin başlıca nedenidir. AWS Nisan 2025'te alternatifi ölçtü: sınıflandırıcı tabanlı router 0,53 saniye ek gecikme getiriyor, semantik router 0,10 saniye getiriyor ve tek model ailesi içinde yönlendirme faturayı %30'a kadar düşürüyor. Aynı hesabı Temmuz 2026 liste fiyatlarıyla sağlayıcılar arasında yeniden kurarsanız, aşağıda yaptığımız gibi, kesinti %70'e ulaşıyor. Tasarrufun büyük bölümü, tek bir token bile üretilmeden önce verilen tek bir karardan geliyor.
Öne Çıkanlar
- LLM router; görev türüne, maliyete veya ölçülen kaliteye bakarak her isteğe hangi modelin yanıt vereceğine karar verir.
- Beş strateji vardır: kural tabanlı, maliyet duyarlı, gecikme duyarlı, semantik (embedding) ve LLM sınıflandırıcılı yönlendirme.
- Kural tabanlı yönlendirme istek başına yaklaşık 0 ms ve 0 $ ekler; sınıflandırıcılı yönlendirme 300-800 ms artı sınıflandırıcı token maliyeti ekler.
- Basit trafiğin çoğu 10-20 kat daha ucuz bir modele geçtiğinde, yönlendirme token harcamasını %60'a kadar kesebilir.
- Tek sağlayıcı, günde 10 bin istek altı, maliyet baskısı yok mu? Router'ı atlayın. Düz yedekler yeterlidir.
LLM Router Gerçekte Ne Yapar?
LLM router, her model çağrısından önce küçük bir karar adımı çalıştırır: isteği okur, bir yönlendirme kuralına göre puanlar, bir model seçer, çağrıyı gönderir ve ilk model hata verirse yedekte yeniden dener. Uygulamanızın geri kalanında hiçbir şey değişmez. Hâlâ tek istek yapar ve tek yanıt alırsınız.
İsteğin yaşam döngüsü, sırasıyla:
- İstek ulaşır. Router endpoint'ine, tıpkı bir model API'sine gider gibi gelir.
- Analiz. Router prompt'u inceler: anahtar kelimeler, token sayısı, bir embedding veya bir sınıflandırıcı puanı.
- Seçim. Yönlendirme stratejisi bu sinyali bir model katmanına eşler (ucuz, orta, frontier veya yerel).
- İletim. Çağrı, seçilen modele OpenAI uyumlu bir API üzerinden gider.
- Yedek. Zaman aşımı, hız sınırı veya hatada istek zincirdeki bir sonraki katmanda yeniden denenir.
İnsanlar "llm gateway vs router" araması yapıyor, çünkü sağlayıcı dokümanları terimleri birbirine karıştırıyor. Tek cümle bunu düzeltir: gateway borudur, router karardır. Bunlar rakip değil katmandır ve çoğu gateway içinde bir router barındırır.
| Katman | Neye karar verir | Tipik özellikler | Örnekler |
|---|---|---|---|
| Proxy | Yalnızca taşıma | Endpoint URL, auth geçişi, istek logları | nginx, Kong |
| Gateway | Boru düzeyinde politika | API anahtarları, hız sınırları, bütçeler, kullanım logları, yeniden denemeler | LiteLLM proxy, OpenRouter, Portkey |
| Router | Hangi modelin yanıt vereceği | Görev kuralları, maliyet eşikleri, semantik eşleştirme, sınıflandırıcı puanlama | LiteLLM router, RouteLLM, özel kod |
LiteLLM dokümanlarına göre, sanal anahtarlarınızı tutan aynı proxy, router'ı da çalıştırır. Özel olarak boru düzeyindeki araçları mı karşılaştırıyorsunuz? En iyi LLM gateway araçları listemiz on tanesini sıralıyor.
Gerçekten Bir LLM Router'a İhtiyacınız Var mı?
Çoğu küçük uygulamanın yoktur. Router şu durumlarda kendini amorti eder: trafik açıkça farklı görev türlerine bölündüğünde, token faturası en büyük altyapı gideriniz olduğunda veya birden fazla sağlayıcı çalıştırıp failover'a ihtiyaç duyduğunuzda. Bu eşiklerin altında, düz yeniden denemeler artı tek yedek model, hareketli parça olmadan aynı güvenilirliği satın alır.
Açık konuşacağız, çünkü bu alanda başka kimse söylemez: günde 10 bin isteğin altında tek sağlayıcı çalıştırıyorsanız, router ihtiyacınız olmayan bir yüktür. Düz yedekler kazanır.
| Durumunuz | Karar |
|---|---|
| Tek sağlayıcı, günde <10 bin istek, maliyet baskısı yok | Atlayın. Yeniden deneme artı tek yedek model kullanın |
| Karışık trafik (destek SSS'si ve zor akıl yürütme) | Görev türüne göre yönlendirin (kural tabanlı) |
| Token faturası en büyük altyapı kaleminiz | Maliyet katmanına göre yönlendirin (maliyet duyarlı veya kademeli) |
| İki veya daha fazla sağlayıcı | Aralarında yönlendirin ve failover yapın |
| CI'da eval'leri olan kalite kritik ürün | Ölçülen kaliteye göre yönlendirin (sınıflandırıcı veya eval tabanlı) |
Neden bu kadar açık? Her yönlendirme kuralı bir iddiadır ("bu görev sınıfı ucuz modelde güvenlidir") ve modeller, fiyatlar ve ürününüz değiştikçe bayatlar. Bu bakım maliyetine yalnızca tasarruf açıkça ağır bastığında katlanın.
5 LLM Yönlendirme Stratejisi (Ve Her Birini Ne Zaman Kullanmalı)
Her LLM yönlendirme stratejisi tek bir soruya yanıt verir: model seçecek kadar hangi sinyale güveniyorsunuz? Kurallar anahtar kelimelere güvenir. Maliyet yönlendirmesi token bütçesine güvenir. Gecikme yönlendirmesi kronometreye güvenir. Semantik yönlendirme embedding'lere güvenir. Sınıflandırıcı yönlendirmesi başka bir LLM'e güvenir. Ödünleşim hep aynı şekildedir: daha fazla sinyal kalitesi, istek başına daha fazla ek gecikme ve maliyet.
Otomatik tamamlama bunları "llm routing strategies", "llm task routing", "llm intent routing" ve "llm dynamic routing" olarak öne çıkarır. Beş kalıba karşılık gelirler:
| Strateji | Nasıl karar verir | Ek gecikme | Ek maliyet | Ne zaman kullanılır |
|---|---|---|---|---|
| Kural / görev yönlendirmesi | Anahtar kelime veya regex bir yönlendirme haritasıyla eşleşir | ~0 ms | 0 $ | Öngörülebilir niyetler: iade, özetleme, SQL düzeltme |
| Maliyet duyarlı yönlendirme | Token sayısı veya bütçe eşiği | ~0 ms | 0 $ | Yüksek hacim, ince marj |
| Gecikme duyarlı yönlendirme | Model katmanı başına canlı p95 | ~0 ms (metrik gerekir) | 0 $ | SLA'sı olan kullanıcıya dönük sohbet |
| Semantik yönlendirme | Örnek prompt'ların embedding'leriyle benzerlik | 50-150 ms | Embedding token'ları | Bulanık, ucu açık kullanıcı girdisi |
| LLM sınıflandırıcılı yönlendirme | Ucuz bir model zorluğu puanlar | 300-800 ms | Sınıflandırıcı token'ları | Karışık zorlukta trafik, kalite her şeyden önce |
Bir kalıp beşinin de üzerinden geçer: kademeli yapı (cascade), model katmanlama da denir. Ucuzdan başlayın ve yalnızca hata veya düşük güvende bir üst katmana çıkın. Bir destek botu, milyon token başına 0,25 $'lık bir modelden yanıt verir; güveni 0,7'nin altına düşerse aynı istek bir frontier modelde yeniden denenir. Zekâya yalnızca ucuz katman sıkıştığını kabul ettiğinde para ödersiniz.
Akademik derinlik için, ulab-uiuc'nin LLMRouter kütüphanesi 16'dan fazla araştırılmış yönlendirme algoritmasını kataloglar (KNN, SVM, MLP, matris faktörizasyonu, Elo, graf ve BERT tarzı). Tercihiniz semantik yönlendirme ise, örnek embedding'ler neredeyse her şeyi belirler; en iyi embedding modelleri rehberimiz hangilerinin gerçek veri kümelerinde ayakta kaldığını ele alıyor.
Python'da LLM Router Nasıl Kurulur?
Herhangi bir OpenAI uyumlu endpoint'e karşı, yaklaşık 80 satır sade Python ile kurarsınız. Framework gerekmez. Aşağıdaki dört router giderek gelişir: anahtar kelime kuralları, maliyet eşiği, embedding benzerliği ve failover'lı bir sınıflandırıcı modeli. Her biri seçtiği modeli yazdırır, böylece kararın verilişini izleyebilirsiniz.
"how to build an llm router" araması yapıp yalnızca AWS CDK yığınları ve akademik repolar bulduysanız, bu bölüm sade yanıttır. AWS'nin referans uygulaması sağlamdır ama Bedrock, Lambda ve CDK'ya kaynar. Bizimki OpenAI istemcisinin işaret ettiği her yerde çalışır: OpenAI, proxy üzerinden Anthropic, dizüstünde Ollama, GPU kutusunda vLLM. İşte müşterilere önce çizdiğimiz router.
Adım 1: Kural tabanlı router (anahtar kelimelerden modellere)
Sıfır gecikmeli başlangıç noktası. Bir regex haritası karar verir; eşleşmeyen her şey frontier katmanına gider.
import re
from openai import OpenAI
client = OpenAI() # works with OpenAI, Ollama, vLLM, or a LiteLLM proxy
def ask(model: str, prompt: str) -> str:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return r.choices[0].message.content
ROUTES = [
(re.compile(r"\b(refund|cancel|invoice|password|hours)\b", re.I), "gpt-5-mini"),
(re.compile(r"\b(summarize|translate|rewrite)\b", re.I), "gpt-5-mini"),
]
FRONTIER = "gpt-5"
def rule_router(prompt: str) -> str:
for pattern, model in ROUTES:
if pattern.search(prompt):
return model
return FRONTIER
prompt = "How do I cancel my subscription?"
model = rule_router(prompt)
print(model) # gpt-5-mini: regex hit on "cancel"
print(ask(model, prompt))Girdi: bir destek sorusu. Karar: "cancel" ile regex eşleşmesi. Seçilen model: gpt-5-mini. Yönlendirmek için API çağrısı gerekmez, bu yüzden varsayılan olarak bu kalır.
Adım 2: Maliyet duyarlı router (token bütçe eşiği)
Aynı fikir, ama sinyal anahtar kelimeler yerine istek boyutudur. Küçük çıktı bütçeli kısa prompt'lar ucuza gider; geri kalan her şey frontier'a gider.
def cost_router(prompt: str, max_output_tokens: int = 500) -> str:
word_count = len(prompt.split())
if word_count < 60 and max_output_tokens <= 300:
return "gpt-5-mini" # $0.25 in / $2 out per M tokens
return "gpt-5" # $1.25 in / $10 out per M tokens
prompt = "Write a two-line product description for a ceramic mug."
model = cost_router(prompt, max_output_tokens=120)
print(model) # gpt-5-mini: short prompt, small output budgetKaba mı? Evet. Etkili mi? O da evet, çünkü token hacmi görev boyutuyla çoğu insanın beklediğinden daha iyi ilişkilidir. Bu, birkaç ücretli "cheap llm router" ürününün tüm stratejisidir.
Adım 3: Semantik router (embedding'lerden örneklere)
Anahtar kelimelerden kaçan bulanık kullanıcı girdisi için, prompt'u embedding'e çevirin ve gömülü örnek prompt'larla karşılaştırın. En yakın küme isteği sahiplenir.
import numpy as np
EXEMPLARS = {
"gpt-5-mini": [
"classify this support ticket into a category",
"extract the shipping address from this email",
],
"gpt-5": [
"debug this race condition in our worker pool",
"design a multi-tenant billing schema",
],
}
def embed(texts: list[str]) -> np.ndarray:
r = client.embeddings.create(model="text-embedding-3-small", input=texts)
return np.array([d.embedding for d in r.data])
CENTROIDS = {m: embed(xs).mean(axis=0) for m, xs in EXEMPLARS.items()}
def semantic_router(prompt: str) -> str:
v = embed([prompt])[0]
scores = {
m: float(np.dot(v, c) / (np.linalg.norm(v) * np.linalg.norm(c)))
for m, c in CENTROIDS.items()
}
return max(scores, key=scores.get)
print(semantic_router("pull the tracking number out of this message"))
# gpt-5-mini: closest to the extraction exemplarsYönlendirme çağrısı bir embedding'e (birkaç yüz token) ve 50-150 ms'ye mal olur. Merkez noktaları (centroid) istek başına değil, başlangıçta önceden hesaplayın.
Adım 4: Fallback'lı LLM sınıflandırıcılı router
En güçlü sinyal: ucuz bir model prompt'u okur ve zorluğunu puanlar. Bu, AWS'nin 0,53 saniye ek gecikme ölçtüğü stratejidir, bu yüzden onu bir fallback zincirine sararız.
def classify_router(prompt: str) -> str:
verdict = client.chat.completions.create(
model="gpt-5-mini",
messages=[{"role": "user", "content":
"Reply HARD or EASY only. Task: " + prompt}],
max_tokens=5,
).choices[0].message.content.strip().upper()
return "gpt-5" if verdict.startswith("HARD") else "gpt-5-mini"
def route_and_call(prompt: str) -> str:
model = classify_router(prompt)
try:
return ask(model, prompt)
except Exception:
backup = "gpt-5-mini" if model == "gpt-5" else "gpt-5"
return ask(backup, prompt) # fallback tier catches the failure
print(route_and_call("Prove this greedy algorithm is optimal."))
# classifier says HARD, so gpt-5 answersİşte tüm llm router örneği: dört fonksiyon, tek istemci, zaten çalıştırdığınızın ötesinde altyapı yok. Üretim için sağlamlaştırma bir sonraki bölüm.
LLM Yönlendirmesi Gerçekte Ne Kadar Tasarruf Sağlar?
AWS, router ek yükünü günde 100.000 soru başına ayda 107,90-188,90 $ olarak ölçtü; sınıflandırıcılı yönlendirme istek başına 0,53 saniye, semantik yönlendirme 0,10 saniye ekliyor. Tasarruf tarafı bu ek yükü gölgede bırakır. Aşağıdaki, Temmuz 2026 liste fiyatlarıyla kurduğumuz çalışma örneğimiz %70,7 harcama düşüşüne ulaşıyor. Püf noktası trafik karışımı: isteklerin çoğunun ucuz katmana uygun düşmesi gerekir.
İki tablo. Önce, router'ın size 1.000 istek başına maliyeti:
| Strateji | Ek gecikme | 1.000 istek başına ek maliyet | Dayanak |
|---|---|---|---|
| Kural tabanlı | ~0 ms | 0 $ | Saf kod yolu |
| Semantik (embedding) | 50-150 ms | 0,02-0,10 $ | Tahmin: text-embedding-3-small fiyatlarıyla prompt başına ~50 token |
| LLM sınıflandırıcı | 300-800 ms | 0,30-1,00 $ | Gecikme AWS tarafından ölçüldü (0,53 s); maliyet ~300 token'lık sınıflandırma çağrısı için gpt-5-mini fiyatlarıyla tahmin edildi |
AWS'nin Nisan 2025 gönderisi, bu alanda bağımsız olarak yayımlanmış tek ölçüm setidir, bu yüzden ona demir atar ve kendi eklediklerimizi çalıştırdığımız sayılar değil tahmin olarak etiketleriz. AWS'ye göre Bedrock Intelligent Prompt Routing, aile içi maliyeti %30'a kadar kesti.
İkincisi, başlığımızı destekleyen tasarruf çalışma örneği:
| Senaryo | Basit trafik (80.000 istek) | Karmaşık trafik (20.000 istek) | Aylık toplam |
|---|---|---|---|
| Router yok: her şey Claude Sonnet 4'te (M token başına 3 $ giriş / 15 $ çıkış) | 432,00 $ | 108,00 $ | 540,00 $ |
| Yönlendirilmiş: basit GPT-5 mini'de (0,25 $ giriş / 2 $ çıkış), karmaşık Sonnet 4'te | 48,00 $ | 108,00 $ | 156,00 $ |
| Sınıflandırıcı ek yükü (GPT-5 nano'da 100 bin sınıflandırma çağrısı, her biri ~300 token) | ~2,10 $ | ||
| Yönlendirmeyle net | ~158,10 $ |
Varsayımlar, etiketli: ayda 100.000 istek; istek başına ortalama 800 giriş artı 200 çıkış token; %80 basit / %20 karmaşık dağılımı; Temmuz 2026 itibarıyla Anthropic fiyat sayfası ve OpenAI fiyat sayfası liste fiyatları, tam oran tablosu LLM API fiyat karşılaştırması yazımızda. İstek başına hesap: Sonnet 4 maliyeti 800 x 3 $/M + 200 x 15 $/M = 0,0054 $; GPT-5 mini maliyeti 800 x 0,25 $/M + 200 x 2 $/M = 0,0006 $.
Sonuç %70,7'lik bir düşüş; başlığımızdaki %60 buradan, rahat bir marjla geliyor. Dürüst uyarılar: bu bir çalışma örneğidir, çalıştırdığımız bir benchmark değil. Ucuz katmanınızın 10-20 kat daha ucuz olduğunu ve trafiğin %80'inin gerçekten uygun düştüğünü varsayar. Aile içi yönlendirme, AWS'nin senaryosu, %30 civarında kalır. Ve yönlendirme birçok kaldıraçtan biridir; prompt önbellekleme ve budama genellikle daha hızlı geri öder, LLM API maliyetlerini düşürme rehberimiz on iki yöntemin tamamını sıralar.
Üretim Yönlendirme Kalıpları
Oyuncak router bir model seçer. Üretim router'ı ayrıca yeniden dener, yükü dengeler, tekrarları önbelleğe alır ve API anahtarlarını ekip başına yalıtır. Günde birkaç bin isteği geçtiğinizde, bunları elle yazmayı bırakın ve içinde router barındıran bir gateway çalıştırın.
Önemli dört kalıp:
- Fallback zincirleri. Önce ucuz katman, hata veya zaman aşımında frontier. Tek başına en yüksek değerli kalıp; güvenilirliğinizin çoğu yalnızca bundan gelir.
- Yük dengeleme. Anahtar başına hız sınırlarından kaçınmak için çağrıları yinelenen dağıtımlara veya API anahtarlarına yayın.
- Yanıt önbellekleme. Özdeş prompt'lar önbelleğe alınmış yanıtları döndürür. Destek trafiği inanamayacağınız kadar tekrar eder; %10-30 isabet oranları yaygındır.
- Sanal anahtarlar ve bütçeler. Ekip başına aylık sınırlı anahtarlar verin ki kontrolden çıkan tek bir döngü tüm faturayı yakmasın.
Bu, hazırlık (staging) ajan yığınımızda çalıştırdığımız yapılandırmaya yakındır (dosya: litellm-router.yaml, LiteLLM proxy konteynerine bağlanır):
model_list:
- model_name: cheap
litellm_params:
model: openai/gpt-5-mini
- model_name: frontier
litellm_params:
model: anthropic/claude-opus-5
router_settings:
routing_strategy: simple-shuffle
fallbacks: [{"cheap": ["frontier"]}]
num_retries: 2
timeout: 30Her aracın nerede durduğu, görüşlerimizle:
- LiteLLM. Self-hosted ve açık kaynak istiyorsanız ve zaten Docker çalıştırıyorsanız seçin. LiteLLM proxy kurulum rehberimiz anahtarlar ve bütçeler dahil tüm dağıtımı adım adım anlatır.
- OpenRouter. Tek anahtarın arkasında yüzlerce model ve sıfır operasyon istiyorsanız seçin. Sıralama sayfası aynı zamanda verim verisi işlevi görür.
- Portkey. Kararı kurumsal gereksinimler (SSO, denetim logları, uyumluluk raporları) veriyorsa seçin.
- Bu yazıdaki özel kod. Günde yaklaşık 50 bin isteğin altındaysanız ve sıfır yeni altyapı istiyorsanız seçin.
Hangisini seçerseniz seçin, LLM gateway araçları listemiz on tanesini birebir karşılaştırır.
Yerel Modeller ile Bulut API'leri Arasında Yönlendirme Yapılabilir mi?
Evet ve token hesabı baştan çıkarıcıdır: yerel bir model token başına 0 $ yazar, bu yüzden Ollama veya vLLM'in yanıtladığı her istek saf tasarruftur. Ödünleşim, watt başına gecikme ve kalitedir. Yerel, zaten sahip olduğunuz donanımda yüksek hacimli basit görevleri kazanır; bulut API'si frontier beyni gerektiren her şeyi yakalar.
Mekanik hayal kırıklığı yaratır, ki mesele de budur. Ollama, localhost:11434/v1 adresinde OpenAI uyumlu bir endpoint sunar ve vLLM de aynı şekli sunar. Yani yukarıdaki her router değişmeden çalışır: base_url'i yerel sunucuya doğrultun, ucuz yuvaya qwen3:8b koyun ve gpt-5'i yedek katman olarak tutun. Self-hosted bir router kutusu için LiteLLM bir Docker imajı olarak gelir; insanların aradığı "llm router docker" kurulumu budur.
İki dürüstlük notu. Tek A100'de bir 70B modeli kabaca saniyede 30-40 token sunar; bulut API'leri ani verimde bunu geçer, bu yüzden yerel yönlendirme dalgalı kullanıcıya dönük sohbetten çok istikrarlı arka plan trafiğine uyar. Ve yerel 8B modeller çok adımlı araç çağrılarında tökezler, bu yüzden zor rotaları buluta doğrultun. Sunum motorunun kendisini seçiyorsanız, vLLM vs SGLang ikisini benchmark'lar.
Yönlendirme ayrıca çok modelleri kodlama ajanı kurulumlarını da çalıştırır. LiteLLM tarzı bir proxy, Claude Code'un tek endpoint üzerinden yerel ve bulut modellerle konuşmasını sağlar; tam bağlantı için Claude Code'da farklı modeller kullanma yazısına bakın.
Yönlendirmenin İşe Yaradığını Nasıl Anlarsınız?
Ya ölçersiniz ya da tahmin ediyorsunuzdur. Her isteğe hangi modelin yanıt verdiğini log'layın, çıktılardan bir örneklemi bir rubriğe göre puanlayın ve puanları yönlendirme kurallarına geri besleyin. Bu adımı atlayan ekipler, modeller ve fiyatlar altında değiştikçe sessizce çürüyen statik bir yapılandırmayla baş başa kalır.
Mezuniyet yayı önce kurallar, sonra maliyet, sonra ölçülen kaliteden geçer:
- Rotayı log'layın. Seçilen modeli, gecikmeyi ve istek başına token sayılarını mevcut trace'lerinizde tek bir sütun olarak saklayın.
- Çıktıları haftalık puanlayın. Bir LLM yargıcı veya insan örneklemi, istek sınıfı başına geçti/kaldı. Sınıf başına elli puanlanmış çıktı, yön vermek için yeterlidir.
- Yeniden ayarlayın. Ucuz katman bir sınıfta %95+ geçiyorsa, o trafiğin daha fazlasını yakalamak için kuralını genişletin. %90'ın altına düşerse sıkılaştırın.
Müşterilere tekrarlayıp durduğumuz satır şudur: hiç yeniden ayarlamadığınız bir router, yalnızca ek gecikmeli statik bir yapılandırmadır. Seçilen modeli log'layın, çıktıları puanlayın, puanları geri besleyin.
Bu döngü, yönlendirmeye uygulanan eval artı gözlemlenebilirliktir. LLM değerlendirme rehberimiz puanlama rubriklerini ele alır; AI gözlemlenebilirlik rehberi trace'lerin nerede durduğunu ele alır.
LLM Yönlendirme Araştırması Nereye Gidiyor?
Akademik çizgi yönlendirmeyi bir yapılandırma dosyası değil, bir öğrenme problemi olarak ele alır. Bu anahtar kelimede birinci sırada yer alan ulab-uiuc'nin LLMRouter kütüphanesi, 11 veri kümesi üzerinde bir benchmark pipeline'ı ile 16'dan fazla algoritmayı (KNN, SVM, MLP, matris faktörizasyonu, Elo, graf, BERT ve RL router'ları) uygular. Son dönemde en çok atıf alan makale, RouteLLM (Ong ve diğerleri, arXiv:2406.18665), router'ları insan tercih verisiyle eğitir ve MMLU ile MT-Bench'ta kalite kaybı olmadan 2 kattan fazla maliyet düşüşü bildirir. En yeni kıvrım: prefill aktivasyon router'ları, "prefill is all you need" çizgisi; bunlar zorluğu üretim başlamadan önce tahmin etmek için prefill sırasında modelin iç aktivasyonlarını okur. Gidiş yönü, kendi eval verinizden kendini eğiten router'lardır; bu tam olarak önceki bölümdeki geri besleme döngüsüdür.
Techsy bu konuya nasıl yaklaşıyor: B2B müşteriler için teslim ettiğimiz ajan yığınları tam olarak bu kalıbı çalıştırır: gateway'e bağlı fallback zincirleriyle maliyet katmanlı bir router, artı eval güdümlü yeniden ayarlama. Yönlendirmenin yığınınıza uyup uymadığını tartıyorsanız, ücretsiz danışmanlık alın; trafik karışımınızı birlikte haritalayalım.
Yazar Hakkında
Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekip B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları teslim eder. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazar. LinkedIn'den bağlanın.
Sıkça Sorulan Sorular
LLM router nedir?
LLM router, uygulamanızla birden fazla dil modeli arasına giren ve her isteğe hangi modelin yanıt vereceğine karar veren bir katmandır. İsteğin görev türünü, boyutunu veya zorluğunu denetler, ardından en uygun modele iletir; o model başarısız olursa bir yedek devreye girer. Bunu model API çağrılarınız için bir trafik kontrolcüsü olarak düşünün.
LLM yönlendirmesi nasıl çalışır?
LLM yönlendirmesi beş adımda çalışır: istek gelir, router onu inceler (anahtar kelimeler, token sayısı veya bir embedding), bir strateji bir model katmanı seçer, çağrı iletilir ve bir yedek model her hatayı yakalar. Tüm karar, üretim başlamadan önce gerçekleşir; bu yüzden saniyeler değil milisaniyeler ekler. Sınıflandırıcı modeli puanlama yapmıyorsa tabii.
LLM router ile LLM gateway aynı şey mi?
Hayır. Gateway borudur: API anahtarları, hız sınırları, bütçeler ve loglar. Router karardır: hangi modelin yanıt vereceği. Bunlar rakip değil katmandır ve çoğu gateway (LiteLLM, Portkey, OpenRouter) içinde bir router barındırır. Router'ı gateway olmadan çalıştırabilirsiniz, ama üretimde genellikle ikisini birlikte istersiniz.
Model yönlendirmesi gerçekten para tasarrufu sağlar mı?
Evet, trafiğinizin çoğu çok daha ucuz bir katmana uygun düştüğünde. Çalışma örneğimiz isteklerin %80'ini M token başına 3 $/15 $'lık bir modelden 0,25 $/2 $'lık bir modele taşıyor ve faturayı %70,7 kesiyor. AWS tek model ailesi içinde yönlendirme için %30'a kadar bildirdi. Trafiğiniz tekdüze şekilde karmaşıksa, tasarruf sıfıra doğru küçülür.
En iyi açık kaynak LLM router hangisi?
Üretim için LiteLLM: self-hosted, aktif olarak bakımı yapılan ve gateway ile router'ı birleştirir. Araştırma düzeyinde algoritmalar için ulab-uiuc'nin LLMRouter'ı akademik literatürden 16'dan fazla yönlendirme stratejisini uygular. RouteLLM, tercih verisiyle eğitilmiş, dolar başına en güçlü kalite router'ıdır. Çoğu ekip LiteLLM ile başlamalı ve araştırma kütüphanelerine yalnızca özel puanlama gerektiğinde uzanmalıdır.
Python'da LLM router nasıl kurarım?
OpenAI istemcisi ve yaklaşık 80 satır kodla başlayın: anahtar kelimelerden modellere bir kural haritası, token sayılarında bir maliyet eşiği, örnek prompt'ların embedding'leriyle benzerlik veya zorluğu puanlayan ucuz bir sınıflandırıcı modeli. Dört kalıbın tamamı yukarıdaki kurulum bölümünde; OpenAI, Ollama veya vLLM'e karşı değişiklik olmadan çalışır.
Yerel modeller ile bulut API'leri arasında yönlendirme yapabilir miyim?
Evet. Ollama (localhost:11434/v1) ve vLLM ikisi de OpenAI uyumlu endpoint sunar, bu yüzden aynı router kodu ucuz trafik için yerel bir modele, zor trafik için bulut API'sine işaret eder. Yerel token'lar 0 $'dır, ama donanım ve gecikme sizindir. Çoğu çok modelli Claude Code kurulumunun arkasındaki kalıp budur.
Semantik yönlendirme nedir?
Semantik yönlendirme, gelen her prompt'u embedding'e çevirir ve gömülü örnek prompt'larla karşılaştırır; isteği en yakın örnek kümesinin sahibi olan modele gönderir. Anahtar kelime kurallarının kaçırdığı bulanık, yeniden ifade edilmiş kullanıcı girdisini ele alır; bedeli istek başına 50-150 ms artı embedding token'larıdır. AWS bunu 0,10 saniye ek gecikme olarak ölçtü.
LLM sınıflandırıcılı router ne kadar gecikme ekler?
AWS, LLM destekli sınıflandırma için 0,53 saniye ek gecikme ölçtü; semantik yönlendirmenin 0,10 saniyesine karşı. Kural tabanlı ve maliyet duyarlı yönlendirme yaklaşık sıfır ekler, çünkü bunlar saf kod yollarıdır. Ürününüzün sıkı bir yanıt süresi SLA'sı varsa kuralları, maliyet eşiklerini veya embedding'leri tercih edin ve sınıflandırıcıyı çevrimdışı veya kuyruklanmış iş yüklerine saklayın.
Kaynaklar
- Seifi, N. ve Chugh, M. (2025-04-09). "Multi-LLM routing strategies for generative AI applications on AWS." AWS Machine Learning Blog. https://aws.amazon.com/blogs/machine-learning/multi-llm-routing-strategies-for-generative-ai-applications-on-aws/ (erişim: 30 Temmuz 2026)
- AWS örnek kodu: sample-multi-llm-dynamic-prompt-routing. https://github.com/aws-samples/sample-multi-llm-dynamic-prompt-routing (erişim: 30 Temmuz 2026)
- LiteLLM dokümantasyonu. https://docs.litellm.ai (erişim: 30 Temmuz 2026)
- Anthropic fiyatlandırma. https://www.anthropic.com/pricing (erişim: 30 Temmuz 2026)
- OpenAI API fiyatlandırma. https://openai.com/api/pricing (erişim: 30 Temmuz 2026)
- ulab-uiuc LLMRouter. https://github.com/ulab-uiuc/LLMRouter (erişim: 30 Temmuz 2026)
- Ong, I. ve diğerleri (2024). "RouteLLM: Learning to Route LLMs with Preference Data." arXiv:2406.18665. https://arxiv.org/abs/2406.18665 (erişim: 30 Temmuz 2026)
- OpenRouter sıralamaları. https://openrouter.ai/rankings (erişim: 30 Temmuz 2026)