guides

LLM Router: İstekleri Yönlendirin, Maliyeti %60 Düşürün [2026]

Yazan Mert Batur
Jul 31, 2026
14 okuma
LLM Router: İstekleri Yönlendirin, Maliyeti %60 Düşürün [2026]

LLM Router: İstekleri Yönlendirin, Maliyeti %60 Düşürün [2026]

LLM router, uygulamanızla birkaç dil modeli arasına giren ince bir katmandır ve her isteğe hangi modelin yanıt vereceğini seçer. İsteği inceler (görev türü, karmaşıklık, token bütçesi), en uygun modele iletir ve o model hata verirse yedeğe geçer. Hedef: en düşük token maliyetiyle işe tam oturan yanıtlar.

"İade politikanız nedir?" sorusunu yanıtlaması için frontier modele para ödemek, faturaların şişmesinin başlıca nedenidir. AWS Nisan 2025'te alternatifi ölçtü: sınıflandırıcı tabanlı router 0,53 saniye ek gecikme getiriyor, semantik router 0,10 saniye getiriyor ve tek model ailesi içinde yönlendirme faturayı %30'a kadar düşürüyor. Aynı hesabı Temmuz 2026 liste fiyatlarıyla sağlayıcılar arasında yeniden kurarsanız, aşağıda yaptığımız gibi, kesinti %70'e ulaşıyor. Tasarrufun büyük bölümü, tek bir token bile üretilmeden önce verilen tek bir karardan geliyor.

Öne Çıkanlar

  • LLM router; görev türüne, maliyete veya ölçülen kaliteye bakarak her isteğe hangi modelin yanıt vereceğine karar verir.
  • Beş strateji vardır: kural tabanlı, maliyet duyarlı, gecikme duyarlı, semantik (embedding) ve LLM sınıflandırıcılı yönlendirme.
  • Kural tabanlı yönlendirme istek başına yaklaşık 0 ms ve 0 $ ekler; sınıflandırıcılı yönlendirme 300-800 ms artı sınıflandırıcı token maliyeti ekler.
  • Basit trafiğin çoğu 10-20 kat daha ucuz bir modele geçtiğinde, yönlendirme token harcamasını %60'a kadar kesebilir.
  • Tek sağlayıcı, günde 10 bin istek altı, maliyet baskısı yok mu? Router'ı atlayın. Düz yedekler yeterlidir.

LLM Router Gerçekte Ne Yapar?

LLM router, her model çağrısından önce küçük bir karar adımı çalıştırır: isteği okur, bir yönlendirme kuralına göre puanlar, bir model seçer, çağrıyı gönderir ve ilk model hata verirse yedekte yeniden dener. Uygulamanızın geri kalanında hiçbir şey değişmez. Hâlâ tek istek yapar ve tek yanıt alırsınız.

İsteğin yaşam döngüsü, sırasıyla:

  1. İstek ulaşır. Router endpoint'ine, tıpkı bir model API'sine gider gibi gelir.
  2. Analiz. Router prompt'u inceler: anahtar kelimeler, token sayısı, bir embedding veya bir sınıflandırıcı puanı.
  3. Seçim. Yönlendirme stratejisi bu sinyali bir model katmanına eşler (ucuz, orta, frontier veya yerel).
  4. İletim. Çağrı, seçilen modele OpenAI uyumlu bir API üzerinden gider.
  5. Yedek. Zaman aşımı, hız sınırı veya hatada istek zincirdeki bir sonraki katmanda yeniden denenir.

İnsanlar "llm gateway vs router" araması yapıyor, çünkü sağlayıcı dokümanları terimleri birbirine karıştırıyor. Tek cümle bunu düzeltir: gateway borudur, router karardır. Bunlar rakip değil katmandır ve çoğu gateway içinde bir router barındırır.

KatmanNeye karar verirTipik özelliklerÖrnekler
ProxyYalnızca taşımaEndpoint URL, auth geçişi, istek loglarınginx, Kong
GatewayBoru düzeyinde politikaAPI anahtarları, hız sınırları, bütçeler, kullanım logları, yeniden denemelerLiteLLM proxy, OpenRouter, Portkey
RouterHangi modelin yanıt vereceğiGörev kuralları, maliyet eşikleri, semantik eşleştirme, sınıflandırıcı puanlamaLiteLLM router, RouteLLM, özel kod

LiteLLM dokümanlarına göre, sanal anahtarlarınızı tutan aynı proxy, router'ı da çalıştırır. Özel olarak boru düzeyindeki araçları mı karşılaştırıyorsunuz? En iyi LLM gateway araçları listemiz on tanesini sıralıyor.

Gerçekten Bir LLM Router'a İhtiyacınız Var mı?

Çoğu küçük uygulamanın yoktur. Router şu durumlarda kendini amorti eder: trafik açıkça farklı görev türlerine bölündüğünde, token faturası en büyük altyapı gideriniz olduğunda veya birden fazla sağlayıcı çalıştırıp failover'a ihtiyaç duyduğunuzda. Bu eşiklerin altında, düz yeniden denemeler artı tek yedek model, hareketli parça olmadan aynı güvenilirliği satın alır.

Açık konuşacağız, çünkü bu alanda başka kimse söylemez: günde 10 bin isteğin altında tek sağlayıcı çalıştırıyorsanız, router ihtiyacınız olmayan bir yüktür. Düz yedekler kazanır.

DurumunuzKarar
Tek sağlayıcı, günde <10 bin istek, maliyet baskısı yokAtlayın. Yeniden deneme artı tek yedek model kullanın
Karışık trafik (destek SSS'si ve zor akıl yürütme)Görev türüne göre yönlendirin (kural tabanlı)
Token faturası en büyük altyapı kaleminizMaliyet katmanına göre yönlendirin (maliyet duyarlı veya kademeli)
İki veya daha fazla sağlayıcıAralarında yönlendirin ve failover yapın
CI'da eval'leri olan kalite kritik ürünÖlçülen kaliteye göre yönlendirin (sınıflandırıcı veya eval tabanlı)

Neden bu kadar açık? Her yönlendirme kuralı bir iddiadır ("bu görev sınıfı ucuz modelde güvenlidir") ve modeller, fiyatlar ve ürününüz değiştikçe bayatlar. Bu bakım maliyetine yalnızca tasarruf açıkça ağır bastığında katlanın.

5 LLM Yönlendirme Stratejisi (Ve Her Birini Ne Zaman Kullanmalı)

Her LLM yönlendirme stratejisi tek bir soruya yanıt verir: model seçecek kadar hangi sinyale güveniyorsunuz? Kurallar anahtar kelimelere güvenir. Maliyet yönlendirmesi token bütçesine güvenir. Gecikme yönlendirmesi kronometreye güvenir. Semantik yönlendirme embedding'lere güvenir. Sınıflandırıcı yönlendirmesi başka bir LLM'e güvenir. Ödünleşim hep aynı şekildedir: daha fazla sinyal kalitesi, istek başına daha fazla ek gecikme ve maliyet.

Otomatik tamamlama bunları "llm routing strategies", "llm task routing", "llm intent routing" ve "llm dynamic routing" olarak öne çıkarır. Beş kalıba karşılık gelirler:

StratejiNasıl karar verirEk gecikmeEk maliyetNe zaman kullanılır
Kural / görev yönlendirmesiAnahtar kelime veya regex bir yönlendirme haritasıyla eşleşir~0 ms0 $Öngörülebilir niyetler: iade, özetleme, SQL düzeltme
Maliyet duyarlı yönlendirmeToken sayısı veya bütçe eşiği~0 ms0 $Yüksek hacim, ince marj
Gecikme duyarlı yönlendirmeModel katmanı başına canlı p95~0 ms (metrik gerekir)0 $SLA'sı olan kullanıcıya dönük sohbet
Semantik yönlendirmeÖrnek prompt'ların embedding'leriyle benzerlik50-150 msEmbedding token'larıBulanık, ucu açık kullanıcı girdisi
LLM sınıflandırıcılı yönlendirmeUcuz bir model zorluğu puanlar300-800 msSınıflandırıcı token'larıKarışık zorlukta trafik, kalite her şeyden önce

Bir kalıp beşinin de üzerinden geçer: kademeli yapı (cascade), model katmanlama da denir. Ucuzdan başlayın ve yalnızca hata veya düşük güvende bir üst katmana çıkın. Bir destek botu, milyon token başına 0,25 $'lık bir modelden yanıt verir; güveni 0,7'nin altına düşerse aynı istek bir frontier modelde yeniden denenir. Zekâya yalnızca ucuz katman sıkıştığını kabul ettiğinde para ödersiniz.

Akademik derinlik için, ulab-uiuc'nin LLMRouter kütüphanesi 16'dan fazla araştırılmış yönlendirme algoritmasını kataloglar (KNN, SVM, MLP, matris faktörizasyonu, Elo, graf ve BERT tarzı). Tercihiniz semantik yönlendirme ise, örnek embedding'ler neredeyse her şeyi belirler; en iyi embedding modelleri rehberimiz hangilerinin gerçek veri kümelerinde ayakta kaldığını ele alıyor.

Python'da LLM Router Nasıl Kurulur?

Herhangi bir OpenAI uyumlu endpoint'e karşı, yaklaşık 80 satır sade Python ile kurarsınız. Framework gerekmez. Aşağıdaki dört router giderek gelişir: anahtar kelime kuralları, maliyet eşiği, embedding benzerliği ve failover'lı bir sınıflandırıcı modeli. Her biri seçtiği modeli yazdırır, böylece kararın verilişini izleyebilirsiniz.

"how to build an llm router" araması yapıp yalnızca AWS CDK yığınları ve akademik repolar bulduysanız, bu bölüm sade yanıttır. AWS'nin referans uygulaması sağlamdır ama Bedrock, Lambda ve CDK'ya kaynar. Bizimki OpenAI istemcisinin işaret ettiği her yerde çalışır: OpenAI, proxy üzerinden Anthropic, dizüstünde Ollama, GPU kutusunda vLLM. İşte müşterilere önce çizdiğimiz router.

Adım 1: Kural tabanlı router (anahtar kelimelerden modellere)

Sıfır gecikmeli başlangıç noktası. Bir regex haritası karar verir; eşleşmeyen her şey frontier katmanına gider.

python
import re
from openai import OpenAI

client = OpenAI()  # works with OpenAI, Ollama, vLLM, or a LiteLLM proxy

def ask(model: str, prompt: str) -> str:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return r.choices[0].message.content

ROUTES = [
    (re.compile(r"\b(refund|cancel|invoice|password|hours)\b", re.I), "gpt-5-mini"),
    (re.compile(r"\b(summarize|translate|rewrite)\b", re.I), "gpt-5-mini"),
]
FRONTIER = "gpt-5"

def rule_router(prompt: str) -> str:
    for pattern, model in ROUTES:
        if pattern.search(prompt):
            return model
    return FRONTIER

prompt = "How do I cancel my subscription?"
model = rule_router(prompt)
print(model)  # gpt-5-mini: regex hit on "cancel"
print(ask(model, prompt))

Girdi: bir destek sorusu. Karar: "cancel" ile regex eşleşmesi. Seçilen model: gpt-5-mini. Yönlendirmek için API çağrısı gerekmez, bu yüzden varsayılan olarak bu kalır.

Adım 2: Maliyet duyarlı router (token bütçe eşiği)

Aynı fikir, ama sinyal anahtar kelimeler yerine istek boyutudur. Küçük çıktı bütçeli kısa prompt'lar ucuza gider; geri kalan her şey frontier'a gider.

python
def cost_router(prompt: str, max_output_tokens: int = 500) -> str:
    word_count = len(prompt.split())
    if word_count < 60 and max_output_tokens <= 300:
        return "gpt-5-mini"  # $0.25 in / $2 out per M tokens
    return "gpt-5"           # $1.25 in / $10 out per M tokens

prompt = "Write a two-line product description for a ceramic mug."
model = cost_router(prompt, max_output_tokens=120)
print(model)  # gpt-5-mini: short prompt, small output budget

Kaba mı? Evet. Etkili mi? O da evet, çünkü token hacmi görev boyutuyla çoğu insanın beklediğinden daha iyi ilişkilidir. Bu, birkaç ücretli "cheap llm router" ürününün tüm stratejisidir.

Adım 3: Semantik router (embedding'lerden örneklere)

Anahtar kelimelerden kaçan bulanık kullanıcı girdisi için, prompt'u embedding'e çevirin ve gömülü örnek prompt'larla karşılaştırın. En yakın küme isteği sahiplenir.

python
import numpy as np

EXEMPLARS = {
    "gpt-5-mini": [
        "classify this support ticket into a category",
        "extract the shipping address from this email",
    ],
    "gpt-5": [
        "debug this race condition in our worker pool",
        "design a multi-tenant billing schema",
    ],
}

def embed(texts: list[str]) -> np.ndarray:
    r = client.embeddings.create(model="text-embedding-3-small", input=texts)
    return np.array([d.embedding for d in r.data])

CENTROIDS = {m: embed(xs).mean(axis=0) for m, xs in EXEMPLARS.items()}

def semantic_router(prompt: str) -> str:
    v = embed([prompt])[0]
    scores = {
        m: float(np.dot(v, c) / (np.linalg.norm(v) * np.linalg.norm(c)))
        for m, c in CENTROIDS.items()
    }
    return max(scores, key=scores.get)

print(semantic_router("pull the tracking number out of this message"))
# gpt-5-mini: closest to the extraction exemplars

Yönlendirme çağrısı bir embedding'e (birkaç yüz token) ve 50-150 ms'ye mal olur. Merkez noktaları (centroid) istek başına değil, başlangıçta önceden hesaplayın.

Adım 4: Fallback'lı LLM sınıflandırıcılı router

En güçlü sinyal: ucuz bir model prompt'u okur ve zorluğunu puanlar. Bu, AWS'nin 0,53 saniye ek gecikme ölçtüğü stratejidir, bu yüzden onu bir fallback zincirine sararız.

python
def classify_router(prompt: str) -> str:
    verdict = client.chat.completions.create(
        model="gpt-5-mini",
        messages=[{"role": "user", "content":
            "Reply HARD or EASY only. Task: " + prompt}],
        max_tokens=5,
    ).choices[0].message.content.strip().upper()
    return "gpt-5" if verdict.startswith("HARD") else "gpt-5-mini"

def route_and_call(prompt: str) -> str:
    model = classify_router(prompt)
    try:
        return ask(model, prompt)
    except Exception:
        backup = "gpt-5-mini" if model == "gpt-5" else "gpt-5"
        return ask(backup, prompt)  # fallback tier catches the failure

print(route_and_call("Prove this greedy algorithm is optimal."))
# classifier says HARD, so gpt-5 answers

İşte tüm llm router örneği: dört fonksiyon, tek istemci, zaten çalıştırdığınızın ötesinde altyapı yok. Üretim için sağlamlaştırma bir sonraki bölüm.

LLM Yönlendirmesi Gerçekte Ne Kadar Tasarruf Sağlar?

AWS, router ek yükünü günde 100.000 soru başına ayda 107,90-188,90 $ olarak ölçtü; sınıflandırıcılı yönlendirme istek başına 0,53 saniye, semantik yönlendirme 0,10 saniye ekliyor. Tasarruf tarafı bu ek yükü gölgede bırakır. Aşağıdaki, Temmuz 2026 liste fiyatlarıyla kurduğumuz çalışma örneğimiz %70,7 harcama düşüşüne ulaşıyor. Püf noktası trafik karışımı: isteklerin çoğunun ucuz katmana uygun düşmesi gerekir.

İki tablo. Önce, router'ın size 1.000 istek başına maliyeti:

StratejiEk gecikme1.000 istek başına ek maliyetDayanak
Kural tabanlı~0 ms0 $Saf kod yolu
Semantik (embedding)50-150 ms0,02-0,10 $Tahmin: text-embedding-3-small fiyatlarıyla prompt başına ~50 token
LLM sınıflandırıcı300-800 ms0,30-1,00 $Gecikme AWS tarafından ölçüldü (0,53 s); maliyet ~300 token'lık sınıflandırma çağrısı için gpt-5-mini fiyatlarıyla tahmin edildi

AWS'nin Nisan 2025 gönderisi, bu alanda bağımsız olarak yayımlanmış tek ölçüm setidir, bu yüzden ona demir atar ve kendi eklediklerimizi çalıştırdığımız sayılar değil tahmin olarak etiketleriz. AWS'ye göre Bedrock Intelligent Prompt Routing, aile içi maliyeti %30'a kadar kesti.

İkincisi, başlığımızı destekleyen tasarruf çalışma örneği:

SenaryoBasit trafik (80.000 istek)Karmaşık trafik (20.000 istek)Aylık toplam
Router yok: her şey Claude Sonnet 4'te (M token başına 3 $ giriş / 15 $ çıkış)432,00 $108,00 $540,00 $
Yönlendirilmiş: basit GPT-5 mini'de (0,25 $ giriş / 2 $ çıkış), karmaşık Sonnet 4'te48,00 $108,00 $156,00 $
Sınıflandırıcı ek yükü (GPT-5 nano'da 100 bin sınıflandırma çağrısı, her biri ~300 token)~2,10 $
Yönlendirmeyle net~158,10 $

Varsayımlar, etiketli: ayda 100.000 istek; istek başına ortalama 800 giriş artı 200 çıkış token; %80 basit / %20 karmaşık dağılımı; Temmuz 2026 itibarıyla Anthropic fiyat sayfası ve OpenAI fiyat sayfası liste fiyatları, tam oran tablosu LLM API fiyat karşılaştırması yazımızda. İstek başına hesap: Sonnet 4 maliyeti 800 x 3 $/M + 200 x 15 $/M = 0,0054 $; GPT-5 mini maliyeti 800 x 0,25 $/M + 200 x 2 $/M = 0,0006 $.

Sonuç %70,7'lik bir düşüş; başlığımızdaki %60 buradan, rahat bir marjla geliyor. Dürüst uyarılar: bu bir çalışma örneğidir, çalıştırdığımız bir benchmark değil. Ucuz katmanınızın 10-20 kat daha ucuz olduğunu ve trafiğin %80'inin gerçekten uygun düştüğünü varsayar. Aile içi yönlendirme, AWS'nin senaryosu, %30 civarında kalır. Ve yönlendirme birçok kaldıraçtan biridir; prompt önbellekleme ve budama genellikle daha hızlı geri öder, LLM API maliyetlerini düşürme rehberimiz on iki yöntemin tamamını sıralar.

Üretim Yönlendirme Kalıpları

Oyuncak router bir model seçer. Üretim router'ı ayrıca yeniden dener, yükü dengeler, tekrarları önbelleğe alır ve API anahtarlarını ekip başına yalıtır. Günde birkaç bin isteği geçtiğinizde, bunları elle yazmayı bırakın ve içinde router barındıran bir gateway çalıştırın.

Önemli dört kalıp:

  • Fallback zincirleri. Önce ucuz katman, hata veya zaman aşımında frontier. Tek başına en yüksek değerli kalıp; güvenilirliğinizin çoğu yalnızca bundan gelir.
  • Yük dengeleme. Anahtar başına hız sınırlarından kaçınmak için çağrıları yinelenen dağıtımlara veya API anahtarlarına yayın.
  • Yanıt önbellekleme. Özdeş prompt'lar önbelleğe alınmış yanıtları döndürür. Destek trafiği inanamayacağınız kadar tekrar eder; %10-30 isabet oranları yaygındır.
  • Sanal anahtarlar ve bütçeler. Ekip başına aylık sınırlı anahtarlar verin ki kontrolden çıkan tek bir döngü tüm faturayı yakmasın.

Bu, hazırlık (staging) ajan yığınımızda çalıştırdığımız yapılandırmaya yakındır (dosya: litellm-router.yaml, LiteLLM proxy konteynerine bağlanır):

yaml
model_list:
  - model_name: cheap
    litellm_params:
      model: openai/gpt-5-mini
  - model_name: frontier
    litellm_params:
      model: anthropic/claude-opus-5

router_settings:
  routing_strategy: simple-shuffle
  fallbacks: [{"cheap": ["frontier"]}]
  num_retries: 2
  timeout: 30

Her aracın nerede durduğu, görüşlerimizle:

  • LiteLLM. Self-hosted ve açık kaynak istiyorsanız ve zaten Docker çalıştırıyorsanız seçin. LiteLLM proxy kurulum rehberimiz anahtarlar ve bütçeler dahil tüm dağıtımı adım adım anlatır.
  • OpenRouter. Tek anahtarın arkasında yüzlerce model ve sıfır operasyon istiyorsanız seçin. Sıralama sayfası aynı zamanda verim verisi işlevi görür.
  • Portkey. Kararı kurumsal gereksinimler (SSO, denetim logları, uyumluluk raporları) veriyorsa seçin.
  • Bu yazıdaki özel kod. Günde yaklaşık 50 bin isteğin altındaysanız ve sıfır yeni altyapı istiyorsanız seçin.

Hangisini seçerseniz seçin, LLM gateway araçları listemiz on tanesini birebir karşılaştırır.

Yerel Modeller ile Bulut API'leri Arasında Yönlendirme Yapılabilir mi?

Evet ve token hesabı baştan çıkarıcıdır: yerel bir model token başına 0 $ yazar, bu yüzden Ollama veya vLLM'in yanıtladığı her istek saf tasarruftur. Ödünleşim, watt başına gecikme ve kalitedir. Yerel, zaten sahip olduğunuz donanımda yüksek hacimli basit görevleri kazanır; bulut API'si frontier beyni gerektiren her şeyi yakalar.

Mekanik hayal kırıklığı yaratır, ki mesele de budur. Ollama, localhost:11434/v1 adresinde OpenAI uyumlu bir endpoint sunar ve vLLM de aynı şekli sunar. Yani yukarıdaki her router değişmeden çalışır: base_url'i yerel sunucuya doğrultun, ucuz yuvaya qwen3:8b koyun ve gpt-5'i yedek katman olarak tutun. Self-hosted bir router kutusu için LiteLLM bir Docker imajı olarak gelir; insanların aradığı "llm router docker" kurulumu budur.

İki dürüstlük notu. Tek A100'de bir 70B modeli kabaca saniyede 30-40 token sunar; bulut API'leri ani verimde bunu geçer, bu yüzden yerel yönlendirme dalgalı kullanıcıya dönük sohbetten çok istikrarlı arka plan trafiğine uyar. Ve yerel 8B modeller çok adımlı araç çağrılarında tökezler, bu yüzden zor rotaları buluta doğrultun. Sunum motorunun kendisini seçiyorsanız, vLLM vs SGLang ikisini benchmark'lar.

Yönlendirme ayrıca çok modelleri kodlama ajanı kurulumlarını da çalıştırır. LiteLLM tarzı bir proxy, Claude Code'un tek endpoint üzerinden yerel ve bulut modellerle konuşmasını sağlar; tam bağlantı için Claude Code'da farklı modeller kullanma yazısına bakın.

Yönlendirmenin İşe Yaradığını Nasıl Anlarsınız?

Ya ölçersiniz ya da tahmin ediyorsunuzdur. Her isteğe hangi modelin yanıt verdiğini log'layın, çıktılardan bir örneklemi bir rubriğe göre puanlayın ve puanları yönlendirme kurallarına geri besleyin. Bu adımı atlayan ekipler, modeller ve fiyatlar altında değiştikçe sessizce çürüyen statik bir yapılandırmayla baş başa kalır.

Mezuniyet yayı önce kurallar, sonra maliyet, sonra ölçülen kaliteden geçer:

  1. Rotayı log'layın. Seçilen modeli, gecikmeyi ve istek başına token sayılarını mevcut trace'lerinizde tek bir sütun olarak saklayın.
  2. Çıktıları haftalık puanlayın. Bir LLM yargıcı veya insan örneklemi, istek sınıfı başına geçti/kaldı. Sınıf başına elli puanlanmış çıktı, yön vermek için yeterlidir.
  3. Yeniden ayarlayın. Ucuz katman bir sınıfta %95+ geçiyorsa, o trafiğin daha fazlasını yakalamak için kuralını genişletin. %90'ın altına düşerse sıkılaştırın.

Müşterilere tekrarlayıp durduğumuz satır şudur: hiç yeniden ayarlamadığınız bir router, yalnızca ek gecikmeli statik bir yapılandırmadır. Seçilen modeli log'layın, çıktıları puanlayın, puanları geri besleyin.

Bu döngü, yönlendirmeye uygulanan eval artı gözlemlenebilirliktir. LLM değerlendirme rehberimiz puanlama rubriklerini ele alır; AI gözlemlenebilirlik rehberi trace'lerin nerede durduğunu ele alır.

LLM Yönlendirme Araştırması Nereye Gidiyor?

Akademik çizgi yönlendirmeyi bir yapılandırma dosyası değil, bir öğrenme problemi olarak ele alır. Bu anahtar kelimede birinci sırada yer alan ulab-uiuc'nin LLMRouter kütüphanesi, 11 veri kümesi üzerinde bir benchmark pipeline'ı ile 16'dan fazla algoritmayı (KNN, SVM, MLP, matris faktörizasyonu, Elo, graf, BERT ve RL router'ları) uygular. Son dönemde en çok atıf alan makale, RouteLLM (Ong ve diğerleri, arXiv:2406.18665), router'ları insan tercih verisiyle eğitir ve MMLU ile MT-Bench'ta kalite kaybı olmadan 2 kattan fazla maliyet düşüşü bildirir. En yeni kıvrım: prefill aktivasyon router'ları, "prefill is all you need" çizgisi; bunlar zorluğu üretim başlamadan önce tahmin etmek için prefill sırasında modelin iç aktivasyonlarını okur. Gidiş yönü, kendi eval verinizden kendini eğiten router'lardır; bu tam olarak önceki bölümdeki geri besleme döngüsüdür.

Techsy bu konuya nasıl yaklaşıyor: B2B müşteriler için teslim ettiğimiz ajan yığınları tam olarak bu kalıbı çalıştırır: gateway'e bağlı fallback zincirleriyle maliyet katmanlı bir router, artı eval güdümlü yeniden ayarlama. Yönlendirmenin yığınınıza uyup uymadığını tartıyorsanız, ücretsiz danışmanlık alın; trafik karışımınızı birlikte haritalayalım.

Yazar Hakkında

Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekip B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları teslim eder. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazar. LinkedIn'den bağlanın.

Sıkça Sorulan Sorular

LLM router nedir?

LLM router, uygulamanızla birden fazla dil modeli arasına giren ve her isteğe hangi modelin yanıt vereceğine karar veren bir katmandır. İsteğin görev türünü, boyutunu veya zorluğunu denetler, ardından en uygun modele iletir; o model başarısız olursa bir yedek devreye girer. Bunu model API çağrılarınız için bir trafik kontrolcüsü olarak düşünün.

LLM yönlendirmesi nasıl çalışır?

LLM yönlendirmesi beş adımda çalışır: istek gelir, router onu inceler (anahtar kelimeler, token sayısı veya bir embedding), bir strateji bir model katmanı seçer, çağrı iletilir ve bir yedek model her hatayı yakalar. Tüm karar, üretim başlamadan önce gerçekleşir; bu yüzden saniyeler değil milisaniyeler ekler. Sınıflandırıcı modeli puanlama yapmıyorsa tabii.

LLM router ile LLM gateway aynı şey mi?

Hayır. Gateway borudur: API anahtarları, hız sınırları, bütçeler ve loglar. Router karardır: hangi modelin yanıt vereceği. Bunlar rakip değil katmandır ve çoğu gateway (LiteLLM, Portkey, OpenRouter) içinde bir router barındırır. Router'ı gateway olmadan çalıştırabilirsiniz, ama üretimde genellikle ikisini birlikte istersiniz.

Model yönlendirmesi gerçekten para tasarrufu sağlar mı?

Evet, trafiğinizin çoğu çok daha ucuz bir katmana uygun düştüğünde. Çalışma örneğimiz isteklerin %80'ini M token başına 3 $/15 $'lık bir modelden 0,25 $/2 $'lık bir modele taşıyor ve faturayı %70,7 kesiyor. AWS tek model ailesi içinde yönlendirme için %30'a kadar bildirdi. Trafiğiniz tekdüze şekilde karmaşıksa, tasarruf sıfıra doğru küçülür.

En iyi açık kaynak LLM router hangisi?

Üretim için LiteLLM: self-hosted, aktif olarak bakımı yapılan ve gateway ile router'ı birleştirir. Araştırma düzeyinde algoritmalar için ulab-uiuc'nin LLMRouter'ı akademik literatürden 16'dan fazla yönlendirme stratejisini uygular. RouteLLM, tercih verisiyle eğitilmiş, dolar başına en güçlü kalite router'ıdır. Çoğu ekip LiteLLM ile başlamalı ve araştırma kütüphanelerine yalnızca özel puanlama gerektiğinde uzanmalıdır.

Python'da LLM router nasıl kurarım?

OpenAI istemcisi ve yaklaşık 80 satır kodla başlayın: anahtar kelimelerden modellere bir kural haritası, token sayılarında bir maliyet eşiği, örnek prompt'ların embedding'leriyle benzerlik veya zorluğu puanlayan ucuz bir sınıflandırıcı modeli. Dört kalıbın tamamı yukarıdaki kurulum bölümünde; OpenAI, Ollama veya vLLM'e karşı değişiklik olmadan çalışır.

Yerel modeller ile bulut API'leri arasında yönlendirme yapabilir miyim?

Evet. Ollama (localhost:11434/v1) ve vLLM ikisi de OpenAI uyumlu endpoint sunar, bu yüzden aynı router kodu ucuz trafik için yerel bir modele, zor trafik için bulut API'sine işaret eder. Yerel token'lar 0 $'dır, ama donanım ve gecikme sizindir. Çoğu çok modelli Claude Code kurulumunun arkasındaki kalıp budur.

Semantik yönlendirme nedir?

Semantik yönlendirme, gelen her prompt'u embedding'e çevirir ve gömülü örnek prompt'larla karşılaştırır; isteği en yakın örnek kümesinin sahibi olan modele gönderir. Anahtar kelime kurallarının kaçırdığı bulanık, yeniden ifade edilmiş kullanıcı girdisini ele alır; bedeli istek başına 50-150 ms artı embedding token'larıdır. AWS bunu 0,10 saniye ek gecikme olarak ölçtü.

LLM sınıflandırıcılı router ne kadar gecikme ekler?

AWS, LLM destekli sınıflandırma için 0,53 saniye ek gecikme ölçtü; semantik yönlendirmenin 0,10 saniyesine karşı. Kural tabanlı ve maliyet duyarlı yönlendirme yaklaşık sıfır ekler, çünkü bunlar saf kod yollarıdır. Ürününüzün sıkı bir yanıt süresi SLA'sı varsa kuralları, maliyet eşiklerini veya embedding'leri tercih edin ve sınıflandırıcıyı çevrimdışı veya kuyruklanmış iş yüklerine saklayın.

Kaynaklar

Etiketler

llm router model yönlendirmellm yönlendirme stratejilerimodel routerllm api maliyetlerilitellm

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.