![موجّه LLM: وجّه الطلبات وخفّض التكاليف 60% [2026]](/_next/image?url=https%3A%2F%2Fmedia.techsy.io%2Ftechsy-io%2Fhero-506-1200x630.webp&w=3840&q=75)
موجّه LLM: وجّه الطلبات وخفّض التكاليف 60% [2026]
موجّه LLM طبقة رقيقة بين تطبيقك وعدة نماذج لغوية تختار النموذج الذي يعالج كل طلب. يفحص الموجّه الطلب (نوع المهمة، التعقيد، ميزانية الرموز)، ويحيله إلى النموذج الأنسب، ثم ينتقل إلى نسخة احتياطية إذا أخفق ذلك النموذج. الهدف: إجابات بحجم مناسب بأقل تكلفة رموز ممكنة.
دفع تكلفة نموذج رائد للإجابة عن "ما سياسة الاسترداد لديكم؟" هو الطريقة التي تنتفخ بها الفواتير. قاست AWS البديل في أبريل 2025: موجّه مصنِّف يضيف 0,53 ثانية من زمن الاستجابة، وموجّه دلالي يضيف 0,10 ثانية، وخصم يصل إلى 30% من الفاتورة عند التوجيه داخل عائلة نماذج واحدة. أعد حساب تلك الأرقام عبر عدة مزودين بأسعار القائمة المعلنة في يوليو 2026، كما نفعل أدناه، وسيبلغ الخفض 70%. معظم التوفير يأتي من قرار واحد يُتخذ قبل توليد رمز واحد.
أبرز النقاط
- يقرر موجّه LLM أي نموذج يعالج كل طلب، بناءً على نوع المهمة أو التكلفة أو الجودة المقاسة.
- توجد خمس استراتيجيات: التوجيه بالقواعد، والواعي بالتكلفة، والواعي بزمن الاستجابة، والدلالي (التضمينات)، وتوجيه بمصنِّف LLM.
- التوجيه بالقواعد يضيف نحو 0 مللي ثانية و0 دولار؛ وتوجيه بالمصنِّف يضيف 300 إلى 800 مللي ثانية إضافة إلى تكلفة رموز المصنِّف لكل طلب.
- يستطيع التوجيه خفض إنفاق الرموز حتى 60% عندما تنتقل معظم الحركة البسيطة إلى نموذج أرخص بعشر إلى عشرين مرة.
- مزود واحد، وأقل من 10 آلاف طلب يوميًا، ولا ضغط على التكاليف؟ تخطَّ الموجّه. البدائل الاحتياطية البسيطة تكفي.
ماذا يفعل موجّه LLM فعليًا؟
يشغّل موجّه LLM خطوة قرار صغيرة قبل كل استدعاء نموذج: يقرأ الطلب، ويقيّمه وفق قاعدة توجيه، ويختار نموذجًا، ويرسل الاستدعاء، ويعيد المحاولة على بديل احتياطي إذا أخفق النموذج الأول. لا شيء آخر يتغير في تطبيقك. ما زلت ترسل طلبًا واحدًا وتتلقى ردًا واحدًا.
دورة حياة الطلب، بالترتيب:
- وصول الطلب إلى نقطة نهاية الموجّه، تمامًا كما يصل إلى API النموذج.
- التحليل. يفحص الموجّه الموجه النصي: الكلمات المفتاحية، عدد الرموز، تضمينًا، أو درجة مصنِّف.
- الاختيار. تربط استراتيجية التوجيه تلك الإشارة بطبقة نموذج (رخيصة، متوسطة، رائدة، أو محلية).
- الإحالة. يذهب الاستدعاء إلى النموذج المختار عبر API متوافق مع OpenAI.
- البديل الاحتياطي. عند انتهاء المهلة أو بلوغ حد المعدل أو وقوع خطأ، تُعاد محاولة الطلب على الطبقة التالية في السلسلة.
يبحث الناس عن "الفرق بين بوابة LLM والموجّه" لأن توثيق المزودين يخلط بين المصطلحين. جملة واحدة تحسم الأمر: البوابة هي الأنبوب، والموجّه هو القرار. هما طبقتان وليسا متنافسين، ومعظم البوابات تضمّن موجّهًا في داخلها.
| الطبقة | ما تقرره | مزايا نموذجية | أمثلة |
|---|---|---|---|
| الوسيط (Proxy) | النقل فقط | عنوان نقطة النهاية، تمرير المصادقة، سجلات الطلبات | nginx، Kong |
| البوابة (Gateway) | سياسات مستوى الأنبوب | مفاتيح API، حدود المعدل، الميزانيات، سجلات الاستخدام، إعادة المحاولة | وسيط LiteLLM، OpenRouter، Portkey |
| الموجّه (Router) | أي نموذج يجيب | قواعد المهام، عتبات التكلفة، المطابقة الدلالية، تقييم المصنِّف | موجّه LiteLLM، RouteLLM، كود مخصص |
وفق توثيق LiteLLM، فإن الوسيط نفسه الذي يحتفظ بمفاتيحك الافتراضية يشغّل الموجّه أيضًا. هل تقارن بين أدوات مستوى الأنبوب تحديدًا؟ تجمع مراجعتنا لـأفضل أدوات بوابات LLM عشر أدوات في تصنيف واحد.
هل تحتاج إلى موجّه LLM أصلًا؟
معظم التطبيقات الصغيرة لا تحتاجه. يبرّر الموجّه وجوده عندما تنقسم الحركة إلى أنواع مهام مختلفة بوضوح، أو عندما تكون فاتورة الرموز أكبر بند في تكاليف بنيتك التحتية، أو عندما تشغّل أكثر من مزود واحد وتحتاج إلى انتقال احتياطي. دون تلك العتبات، تمنحك إعادة المحاولة البسيطة مع نموذج احتياطي واحد الموثوقية نفسها دون قطعة متحركة إضافية.
نقولها بصراحة، لأن أحدًا غيرنا في هذا المجال لن يقولها: إذا كنت تشغّل مزودًا واحدًا بأقل من 10 آلاف طلب يوميًا، فالموجّه عبء لا تحتاجه. البدائل الاحتياطية البسيطة هي الفائز.
| وضعك | الحكم |
|---|---|
| مزود واحد، أقل من 10 آلاف طلب يوميًا، لا ضغط على التكاليف | تخطَّه. استخدم إعادة المحاولة مع نموذج احتياطي واحد |
| حركة مختلطة (أسئلة دعم شائعة واستدلال معقد) | وجّه حسب نوع المهمة (بالقواعد) |
| فاتورة الرموز هي أكبر بند في بنيتك التحتية | وجّه حسب طبقة التكلفة (واعٍ بالتكلفة أو متدرّج) |
| مزودان أو أكثر | وجّه وانتقل احتياطيًا بينهم |
| منتج حساس للجودة مع تقييمات في CI | وجّه حسب الجودة المقاسة (مصنِّف أو تقييمات) |
لماذا هذه الصراحة؟ كل مسار توجيه هو ادعاء ("فئة المهام هذه آمنة على النموذج الرخيص") يتآكل مع تغيّر النماذج والأسعار ومنتجك. لا تشترِ تكلفة الصيانة تلك إلا عندما يتفوق التوفير عليها بوضوح.
استراتيجيات توجيه LLM الخمس (ومتى تستخدم كلًا منها)
تجيب كل استراتيجية توجيه عن سؤال واحد: ما الإشارة التي تثق بها بما يكفي لاختيار نموذج؟ القواعد تثق بالكلمات المفتاحية. التوجيه بالتكلفة يثق بميزانية الرموز. التوجيه بزمن الاستجابة يثق بمؤقّت. التوجيه الدلالي يثق بالتضمينات. التوجيه بالمصنِّف يثق بنموذج LLM آخر. والمقايضة دائمًا بالشكل نفسه: جودة إشارة أعلى تعني زمن استجابة وتكلفة إضافية أكبر لكل طلب.
يقترح الإكمال التلقائي صيغًا مثل "استراتيجيات توجيه llm" و"توجيه مهام llm" و"توجيه نوايا llm" و"التوجيه الديناميكي llm". وهي تنطوي على خمسة أنماط:
| الاستراتيجية | كيف تقرر | زمن الاستجابة المضاف | التكلفة المضافة | متى تستخدمها |
|---|---|---|---|---|
| التوجيه بالقواعد/المهام | كلمة مفتاحية أو تعبير نمطي يطابق خريطة مسارات | نحو 0 مللي ثانية | 0 دولار | نوايا متوقعة: استردادات، ملخصات، إصلاحات SQL |
| التوجيه الواعي بالتكلفة | عدد الرموز أو عتبة ميزانية | نحو 0 مللي ثانية | 0 دولار | أحجام كبيرة، هوامش ربح ضيقة |
| التوجيه الواعي بزمن الاستجابة | p95 الحي لكل طبقة نموذج | نحو 0 مللي ثانية (يحتاج مقاييس) | 0 دولار | دردشة موجهة للمستخدم مع اتفاقية مستوى خدمة |
| التوجيه الدلالي | تشابه التضمين مع موجهات مرجعية | 50 إلى 150 مللي ثانية | رموز التضمين | مدخلات مستخدم غامضة ومفتوحة |
| التوجيه بمصنِّف LLM | نموذج رخيص يقيّم الصعوبة | 300 إلى 800 مللي ثانية | رموز المصنِّف | حركة مختلطة الصعوبة، الجودة أولًا |
نمط واحد يقطع الاستراتيجيات الخمس جميعها: التدرّج (cascade)، ويُسمى أيضًا تدرّج النماذج. ابدأ رخيصًا وصعّد فقط عند الفشل أو انخفاض الثقة. يجيب روبوت دعم من نموذج بسعر 0,25 دولار لكل مليون رمز؛ وإذا هبطت ثقته دون 0,7، تُعاد محاولة الطلب نفسه على نموذج رائد. لا تدفع مقابل الذكاء إلا عندما تعترف الطبقة الرخيصة بأنها عاجزة.
للتعمق الأكاديمي، تفهرس مكتبة LLMRouter من ulab-uiuc أكثر من 16 خوارزمية توجيه بحثية (KNN وSVM وMLP وتحليل المصفوفات وElo والرسوم البيانية وأنماط BERT). إذا كان التوجيه الدلالي هو اختيارك، فإن تضمينات الأمثلة المرجعية تحسم كل شيء تقريبًا؛ ويغطي دليلنا لـأفضل نماذج التضمين أيّها يصمد على المدونات النصية الحقيقية.
كيف تبني موجّه LLM بلغة Python؟
تبنيه بنحو 80 سطرًا من Python الصريح مقابل أي نقطة نهاية متوافقة مع OpenAI. لا حاجة إلى إطار عمل. الموجّهات الأربعة أدناه تتصاعد في تطورها: قواعد كلمات مفتاحية، عتبة تكلفة، تشابه تضمينات، ونموذج مصنِّف مع انتقال احتياطي. كل واحد منها يطبع النموذج الذي اختاره، لتراقب القرار وهو يحدث.
إذا بحثت عن "كيف أبني موجّه llm" ولم تجد سوى حزم AWS CDK ومستودعات أكاديمية، فهذا القسم هو الإجابة الصريحة. التنفيذ المرجعي من AWS متين لكنه ملحوم بـ Bedrock وLambda وCDK. تنفيذنا يعمل في أي مكان يشير إليه عميل OpenAI: OpenAI، وAnthropic عبر وسيط، وOllama على حاسوب محمول، وvLLM على جهاز بمعالج رسومي. هذا هو الموجّه الذي نرسمه للعملاء أولًا.
الخطوة 1: موجّه بالقواعد (كلمات مفتاحية إلى نماذج)
خط الأساس بصفر زمن استجابة إضافي. خريطة تعبيرات نمطية تقرر؛ وكل ما لا يطابق يذهب إلى الطبقة الرائدة.
import re
from openai import OpenAI
client = OpenAI() # works with OpenAI, Ollama, vLLM, or a LiteLLM proxy
def ask(model: str, prompt: str) -> str:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return r.choices[0].message.content
ROUTES = [
(re.compile(r"\b(refund|cancel|invoice|password|hours)\b", re.I), "gpt-5-mini"),
(re.compile(r"\b(summarize|translate|rewrite)\b", re.I), "gpt-5-mini"),
]
FRONTIER = "gpt-5"
def rule_router(prompt: str) -> str:
for pattern, model in ROUTES:
if pattern.search(prompt):
return model
return FRONTIER
prompt = "How do I cancel my subscription?"
model = rule_router(prompt)
print(model) # gpt-5-mini: regex hit on "cancel"
print(ask(model, prompt))المدخل: سؤال دعم. القرار: مطابقة تعبير نمطي على "cancel". النموذج المختار: gpt-5-mini. لا حاجة إلى استدعاء API لتوجيهه، ولهذا يبقى الخيار الافتراضي.
الخطوة 2: موجّه واعٍ بالتكلفة (عتبة ميزانية الرموز)
الفكرة نفسها، لكن الإشارة هي حجم الطلب بدلًا من الكلمات المفتاحية. الموجهات القصيرة ذات ميزانيات الإخراج الصغيرة تذهب إلى الرخيص؛ وكل ما عداها يذهب إلى الرائد.
def cost_router(prompt: str, max_output_tokens: int = 500) -> str:
word_count = len(prompt.split())
if word_count < 60 and max_output_tokens <= 300:
return "gpt-5-mini" # $0.25 in / $2 out per M tokens
return "gpt-5" # $1.25 in / $10 out per M tokens
prompt = "Write a two-line product description for a ceramic mug."
model = cost_router(prompt, max_output_tokens=120)
print(model) # gpt-5-mini: short prompt, small output budgetبدائي؟ نعم. فعّال؟ نعم أيضًا، لأن حجم الرموز يرتبط بحجم المهمة أفضل مما يتوقع معظم الناس. هذه هي الاستراتيجية الكاملة وراء عدة منتجات مدفوعة لـ"موجّه llm رخيص".
الخطوة 3: موجّه دلالي (تضمينات إلى أمثلة مرجعية)
لمدخلات المستخدم الغامضة التي تراوغ الكلمات المفتاحية، ضمّن الموجه النصي وقارنه بموجهات مرجعية مضمّنة. أي عنقود هو الأقرب يستحوذ على الطلب.
import numpy as np
EXEMPLARS = {
"gpt-5-mini": [
"classify this support ticket into a category",
"extract the shipping address from this email",
],
"gpt-5": [
"debug this race condition in our worker pool",
"design a multi-tenant billing schema",
],
}
def embed(texts: list[str]) -> np.ndarray:
r = client.embeddings.create(model="text-embedding-3-small", input=texts)
return np.array([d.embedding for d in r.data])
CENTROIDS = {m: embed(xs).mean(axis=0) for m, xs in EXEMPLARS.items()}
def semantic_router(prompt: str) -> str:
v = embed([prompt])[0]
scores = {
m: float(np.dot(v, c) / (np.linalg.norm(v) * np.linalg.norm(c)))
for m, c in CENTROIDS.items()
}
return max(scores, key=scores.get)
print(semantic_router("pull the tracking number out of this message"))
# gpt-5-mini: closest to the extraction exemplarsتكلفة استدعاء التوجيه تضمين واحد (بضعة مئات من الرموز) و50 إلى 150 مللي ثانية. احسب المراكز المسبقة عند الإقلاع، لا عند كل طلب.
الخطوة 4: موجّه بمصنِّف LLM مع بديل احتياطي
أقوى إشارة: نموذج رخيص يقرأ الموجه النصي ويقيّم صعوبته. هذه هي الاستراتيجية التي قاست AWS لها 0,53 ثانية من زمن الاستجابة المضاف، لذلك نغلفها بسلسلة بدائل احتياطية.
def classify_router(prompt: str) -> str:
verdict = client.chat.completions.create(
model="gpt-5-mini",
messages=[{"role": "user", "content":
"Reply HARD or EASY only. Task: " + prompt}],
max_tokens=5,
).choices[0].message.content.strip().upper()
return "gpt-5" if verdict.startswith("HARD") else "gpt-5-mini"
def route_and_call(prompt: str) -> str:
model = classify_router(prompt)
try:
return ask(model, prompt)
except Exception:
backup = "gpt-5-mini" if model == "gpt-5" else "gpt-5"
return ask(backup, prompt) # fallback tier catches the failure
print(route_and_call("Prove this greedy algorithm is optimal."))
# classifier says HARD, so gpt-5 answersهذا هو مثال موجّه LLM كاملًا: أربع دوال، وعميل واحد، ولا بنية تحتية تتجاوز ما تشغّله بالفعل. تحصين الإنتاج هو القسم التالي.
كم يوفّر توجيه LLM فعليًا؟
قاست AWS تكلفة الموجّه عند 107,90 إلى 188,90 دولارًا شهريًا لكل 100 ألف سؤال يوميًا، مع إضافة التوجيه بالمصنِّف 0,53 ثانية لكل طلب والتوجيه الدلالي 0,10 ثانية. جانب التوفير يطغى على تلك التكلفة. مثالنا المحسوب أدناه، المبني على أسعار القائمة المعلنة في يوليو 2026، يستقر عند خفض إنفاق بنسبة 70,7%. العقبة هي مزيج الحركة: تحتاج إلى أن تستحق معظم الطلبات الطبقة الرخيصة.
جدولان. أولًا، ما يكلّفك الموجّه نفسه لكل 1,000 طلب:
| الاستراتيجية | زمن الاستجابة المضاف | التكلفة المضافة لكل 1,000 طلب | الأساس |
|---|---|---|---|
| بالقواعد | نحو 0 مللي ثانية | 0 دولار | مسار كود صِرف |
| دلالي (تضمينات) | 50 إلى 150 مللي ثانية | 0,02 إلى 0,10 دولار | تقدير: نحو 50 رمزًا لكل موجه بأسعار text-embedding-3-small |
| مصنِّف LLM | 300 إلى 800 مللي ثانية | 0,30 إلى 1,00 دولار | زمن الاستجابة قاسته AWS (0,53 ثانية)؛ والتكلفة مقدّرة بأسعار gpt-5-mini لاستدعاء تصنيف بنحو 300 رمز |
منشور AWS في أبريل 2025 هو مجموعة القياسات الوحيدة المنشورة باستقلالية في هذا المجال، لذلك نرسو عليه ونوسم إضافاتنا بأنها تقديرات لا أرقامًا قسناها بأنفسنا. خفض التوجيه الذكي للموجهات داخل العائلة الواحدة في Bedrock التكلفة بنسبة تصل إلى 30%، وفق AWS.
ثانيًا، مثال التوفير المحسوب الذي يدعم عنواننا:
| السيناريو | الحركة البسيطة (80,000 طلب) | الحركة المعقدة (20,000 طلب) | الإجمالي الشهري |
|---|---|---|---|
| دون موجّه: كل شيء على Claude Sonnet 4 (3 دولارات دخول / 15 دولارًا خروج لكل مليون رمز) | 432,00 دولار | 108,00 دولارات | 540,00 دولار |
| مع التوجيه: البسيط على GPT-5 mini (0,25 دولار دخول / 2 دولار خروج)، والمعقد على Sonnet 4 | 48,00 دولارًا | 108,00 دولارات | 156,00 دولارًا |
| تكلفة المصنِّف (100 ألف استدعاء تصنيف على GPT-5 nano، نحو 300 رمز لكل منها) | نحو 2,10 دولار | ||
| الصافي مع التوجيه | نحو 158,10 دولارًا |
الافتراضات، موسومة: 100 ألف طلب شهريًا؛ 800 رمز إدخال إضافة إلى 200 رمز إخراج لكل طلب في المتوسط؛ انقسام 80% بسيط / 20% معقد؛ أسعار القائمة من صفحة أسعار Anthropic وصفحة أسعار OpenAI كما هي في يوليو 2026، مع جدول الأسعار الكامل في مقارنة أسعار LLM API. حساب الطلب الواحد: يكلّف Sonnet 4 ما مقداره 800 × 3 دولارات/مليون + 200 × 15 دولارًا/مليون = 0,0054 دولار؛ ويكلّف GPT-5 mini ما مقداره 800 × 0,25 دولار/مليون + 200 × 2 دولار/مليون = 0,0006 دولار.
النتيجة خفض بنسبة 70,7%، ومنها تأتي نسبة 60% في عنواننا، مع هامش أمان إضافي. محاذير صادقة: هذا مثال محسوب، لا اختبار أداء قسناه. وهو يفترض أن طبقتك الرخيصة أرخص بعشر إلى عشرين مرة وأن 80% من الحركة تستحقها فعلًا. التوجيه داخل العائلة الواحدة، وهو سيناريو AWS، يبقى قرب 30%. والتوجيه رافعة واحدة من روافع كثيرة؛ غالبًا ما يردّ التخزين المؤقت للموجهات وتقليمها التكلفة أسرع، ويصنّف دليلنا لطرق خفض تكاليف LLM API الطرق الاثنتي عشرة جميعها.
أنماط التوجيه في الإنتاج
الموجّه التجريبي يختار نموذجًا. موجّه الإنتاج يعيد المحاولة أيضًا، ويوازن الحمل، ويخزّن المكررات مؤقتًا، ويعزل مفاتيح API لكل فريق. بعد بضعة آلاف من الطلبات يوميًا، كفّ عن بناء هذه الأشياء يدويًا وشغّل بوابة تضمّن موجّهًا.
الأنماط الأربعة التي تهم:
- سلاسل البدائل الاحتياطية. الطبقة الرخيصة أولًا، والرائدة عند الخطأ أو انتهاء المهلة. النمط الأعلى قيمة على الإطلاق؛ معظم موثوقيتك يأتي منه وحده.
- موازنة الحمل. وزّع الاستدعاءات على نشرات مكررة أو مفاتيح API متعددة لتفادي حدود المعدل لكل مفتاح.
- التخزين المؤقت للردود. الموجهات المتطابقة تعيد إجابات مخزنة. حركة الدعم تتكرر أكثر مما تظن؛ ومعدلات إصابة 10 إلى 30% شائعة.
- المفاتيح الافتراضية والميزانيات. أصدر مفاتيح لكل فريق بسقوف شهرية حتى لا تحرق حلقة جامحة واحدة الفاتورة كلها.
هذا قريب من الإعداد الذي نشغّله على حزمة وكلاء مرحلة الاختبار لدينا (الملف: litellm-router.yaml، محمّل داخل حاوية وسيط LiteLLM):
model_list:
- model_name: cheap
litellm_params:
model: openai/gpt-5-mini
- model_name: frontier
litellm_params:
model: anthropic/claude-opus-5
router_settings:
routing_strategy: simple-shuffle
fallbacks: [{"cheap": ["frontier"]}]
num_retries: 2
timeout: 30أين يناسب كل أداة، مع آرائنا:
- LiteLLM. اختره إذا أردت استضافة ذاتية ومصدرًا مفتوحًا وكنت تشغّل Docker بالفعل. يغطي دليل إعداد وسيط LiteLLM النشر كاملًا، بما فيه المفاتيح والميزانيات.
- OpenRouter. اختره إذا أردت مئات النماذج خلف مفتاح واحد وصفر عمليات تشغيل. صفحة الترتيب لديهم تصلح أيضًا بيانات إنتاجية.
- Portkey. اختره إذا كانت متطلبات المؤسسات (SSO، سجلات التدقيق، تقارير الامتثال) هي ما يقود القرار.
- كود مخصص من هذا المنشور. اختره إذا كنت دون نحو 50 ألف طلب يوميًا وتريد صفر بنية تحتية جديدة.
مهما اخترت، تقارن مراجعة أدوات بوابات LLM بينها وجهًا لوجه.
هل يمكنك التوجيه بين النماذج المحلية وواجهات API المستضافة؟
نعم، وحساب الرموز مغرٍ: النموذج المحلي يحاسب بصفر دولار لكل رمز، لذا كل طلب يجيب عنه Ollama أو vLLM هو توفير صافٍ. المقايضة هي زمن الاستجابة والجودة لكل واط. المحلي يفوز في المهام البسيطة عالية الحجم على عتاد تملكه بالفعل؛ ويلتقط API المستضاف كل ما يحتاج إلى عقل رائد.
التفاصيل التقنية مخيبة للآمال، وهذه هي الفكرة. يكشف Ollama نقطة نهاية متوافقة مع OpenAI عند localhost:11434/v1، ويقدّم vLLM الشكل نفسه. لذا يعمل كل موجّه أعلاه دون تغيير: وجّه base_url إلى الخادم المحلي، وضع qwen3:8b في الخانة الرخيصة، وأبقِ gpt-5 طبقة احتياطية. ولصندوق موجّه ذاتي الاستضافة، تُشحن LiteLLM كصورة Docker، وهو إعداد "موجّه llm docker" الذي يبحث عنه الناس.
ملاحظتا صدق. نموذج بحجم 70B على شريحة A100 واحدة يخدم نحو 30 إلى 40 رمزًا في الثانية؛ وتتفوق واجهات API المستضافة على ذلك في الإنتاجية اللحظية، لذا يناسب التوجيه المحلي الحركة الخلفية المستقرة أكثر من دردشة المستخدم المتقلبة. والنماذج المحلية بحجم 8B تتعثر في استدعاءات الأدوات متعددة الخطوات، لذا أبقِ المسارات الصعبة موجهة نحو السحابة. إذا كنت تختار محرك الخدمة نفسه، يقارن vLLM مقابل SGLang بينهما بالأرقام.
يشغّل التوجيه أيضًا إعدادات وكلاء البرمجة متعددة النماذج. يتيح وسيط بأسلوب LiteLLM لـ Claude Code التحدث إلى النماذج المحلية والمستضافة عبر نقطة نهاية واحدة؛ راجع كيفية استخدام نماذج مختلفة في Claude Code للتوصيلات الدقيقة.
كيف تعرف أن التوجيه يعمل؟
تقيسه، أو أنك تخمّن. سجّل أي نموذج أجاب عن كل طلب، وقيّم عينة من المخرجات مقابل سلّم تقييم، وأعد تغذية الدرجات إلى قواعد التوجيه. الفرق التي تتخطى هذه الخطوة تنتهي بإعداد ثابت يتعفن بهدوء بينما تتغيّر النماذج والأسعار تحته.
مسار التدرّج يسير هكذا: القواعد أولًا، ثم التكلفة، ثم الجودة المقاسة:
- سجّل المسار. خزّن النموذج المختار وزمن الاستجابة وأعداد الرموز لكل طلب كعمود واحد في آثار التتبع الموجودة لديك.
- قيّم المخرجات أسبوعيًا. قاضٍ من LLM أو عينة بشرية، نجاح/فشل لكل فئة طلبات. خمسون مخرجًا مُقيّمًا لكل فئة تكفي لتوجيه الدفة.
- أعد الضبط. إذا تجاوزت الطبقة الرخيصة 95% في فئة ما، وسّع قاعدتها لتلتقط مزيدًا من تلك الحركة. وإذا هبطت دون 90%، ضيّقها.
هذا هو السطر الذي نكرره للعملاء: موجّه لا تعيد ضبطه أبدًا هو مجرد إعداد ثابت بزمن استجابة إضافي. سجّل النموذج المختار، قيّم المخرجات، أعد تغذية الدرجات.
تلك الحلقة هي التقييمات وقابلية الملاحظة مطبقة على التوجيه. يغطي دليل تقييم LLM سلالم التقييم؛ ويغطي دليل قابلية ملاحظة الذكاء الاصطناعي مكان وجود آثار التتبع.
إلى أين يتجه بحث توجيه LLM؟
يتعامل الخط الأكاديمي مع التوجيه كمسألة تعلّم، لا كملف إعداد. LLMRouter من ulab-uiuc، المكتبة التي تحتل المرتبة الأولى لهذه الكلمة المفتاحية، تنفّذ أكثر من 16 خوارزمية (موجّهات KNN وSVM وMLP وتحليل المصفوفات وElo والرسوم البيانية وBERT والتعلم المعزز) مع خط أنابيب قياس أداء على 11 مجموعة بيانات. الورقة الأكثر استشهادًا حديثًا، RouteLLM (Ong وآخرون، arXiv:2406.18665)، تدرّب الموجّهات على بيانات تفضيلات بشرية وتبلّغ عن خفض تكلفة يتجاوز الضعفين دون فقدان جودة على MMLU وMT-Bench. أحدث منعطف: موجّهات تنشيطات ما قبل الملء، خط "التنشيط المسبق هو كل ما تحتاجه"، التي تقرأ تنشيطات النموذج الداخلية أثناء مرحلة ما قبل الملء للتنبؤ بالصعوبة قبل بدء التوليد. اتجاه المسار هو موجّهات تدرّب نفسها من بيانات تقييمك، وهي حلقة التغذية الراجعة نفسها من القسم السابق.
كيف تتعامل Techsy مع هذا: حزم الوكلاء التي نشحنها لعملاء B2B تشغّل هذا النمط بالضبط، موجّه طبقات تكلفة مع سلاسل بدائل احتياطية موصولة بالبوابة، إضافة إلى إعادة ضبط مدفوعة بالتقييمات. إذا كنت تزن ما إذا كان التوجيه يناسب حزمة تقنياتك، احصل على استشارة مجانية وسنرسم مزيج حركتك معك.
عن الكاتب
مرت باتور شريك مؤسس في Techsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية/لمندوبي مبيعات لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج. تواصل عبر LinkedIn.
الأسئلة الشائعة
ما موجّه LLM؟
موجّه LLM طبقة بين تطبيقك وعدة نماذج لغوية تقرر أي نموذج يعالج كل طلب. تفحص نوع مهمة الطلب أو حجمه أو صعوبته، ثم تحيله إلى النموذج الأنسب، مع بديل احتياطي إذا أخفق ذلك النموذج. فكّر فيه كمراقب حركة جوية لاستدعاءات API النماذج الخاصة بك.
كيف يعمل توجيه LLM؟
يعمل توجيه LLM في خمس خطوات: يصل الطلب، ويفحصه الموجّه (كلمات مفتاحية، عدد رموز، أو تضمين)، وتختار استراتيجية ما طبقة نموذج، ويُحال الاستدعاء، ويلتقط نموذج احتياطي أي فشل. يحدث القرار كله قبل بدء التوليد، لذا يضيف مللي ثوانٍ لا ثوانٍ، إلا إذا كان نموذج مصنِّف هو من يقيّم.
هل موجّه LLM هو نفسه بوابة LLM؟
لا. البوابة هي الأنبوب: مفاتيح API، حدود المعدل، الميزانيات، والسجلات. الموجّه هو القرار: أي نموذج يجيب. هما طبقتان وليسا متنافسين، ومعظم البوابات (LiteLLM وPortkey وOpenRouter) تضمّن موجّهًا في داخلها. يمكنك تشغيل موجّه دون بوابة، لكن في الإنتاج تريد كليهما معًا غالبًا.
هل يوفّر توجيه النماذج مالًا فعلًا؟
نعم، عندما تستحق معظم حركتك طبقة أرخص بكثير. مثالنا المحسوب ينقل 80% من الطلبات من نموذج بسعر 3 دولارات/15 دولارًا لكل مليون رمز إلى نموذج بسعر 0,25 دولار/2 دولار ويخفض الفاتورة 70,7%. أبلغت AWS عن نسبة تصل إلى 30% للتوجيه داخل عائلة نماذج واحدة. إذا كانت حركتك معقدة بالتساوي، يتقلص التوفير نحو الصفر.
ما أفضل موجّه LLM مفتوح المصدر؟
للإنتاج، LiteLLM: ذاتي الاستضافة، وصيانته نشطة، ويجمع بوابة مع موجّه. وللخوارزميات من الدرجة البحثية، تنفّذ LLMRouter من ulab-uiuc أكثر من 16 استراتيجية توجيه من الأدبيات الأكاديمية. وRouteLLM هو أقوى موجّه من حيث الجودة مقابل الدولار مدرّب على بيانات تفضيلات. على معظم الفرق أن تبدأ بـ LiteLLM ولا تلجأ إلى المكتبات البحثية إلا إذا احتاجت تقييمًا مخصصًا.
كيف أبني موجّه LLM بلغة Python؟
ابدأ بعميل OpenAI ونحو 80 سطرًا من الكود: خريطة قواعد من كلمات مفتاحية إلى نماذج، أو عتبة تكلفة على أعداد الرموز، أو تشابه تضمينات مع موجهات مرجعية، أو نموذج مصنِّف رخيص يقيّم الصعوبة. الأنماط الأربعة كلها في قسم البناء أعلاه، جاهزة للتشغيل مقابل OpenAI أو Ollama أو vLLM دون تغييرات.
هل يمكنني التوجيه بين النماذج المحلية وواجهات API السحابية؟
نعم. يكشف Ollama (localhost:11434/v1) وvLLM كلاهما نقاط نهاية متوافقة مع OpenAI، لذا يشير كود الموجّه نفسه إلى نموذج محلي للحركة الرخيصة وإلى API مستضاف للحركة الصعبة. الرموز المحلية تكلف 0 دولار، لكنك تملك العتاد وزمن الاستجابة. هذا هو النمط وراء معظم إعدادات Claude Code متعددة النماذج.
ما التوجيه الدلالي؟
يضمّن التوجيه الدلالي كل موجه وارد ويقارنه بموجهات مرجعية مضمّنة، ويرسل الطلب إلى النموذج الذي يملك أقرب عنقود مرجعي. يعالج مدخلات المستخدم الغامضة والمعاد صياغتها التي تفوّتها قواعد الكلمات المفتاحية، بتكلفة 50 إلى 150 مللي ثانية إضافة إلى رموز التضمين لكل طلب. قاسته AWS عند 0,10 ثانية من زمن الاستجابة المضاف.
كم زمن الاستجابة الذي يضيفه موجّه بمصنِّف LLM؟
قاست AWS 0,53 ثانية من زمن الاستجابة المضاف للتصنيف بمساعدة LLM، مقابل 0,10 ثانية للتوجيه الدلالي. التوجيه بالقواعد والواعي بالتكلفة يضيفان نحو الصفر، لأنهما مسارا كود صِرفان. إذا كان لمنتجك اتفاقية مستوى خدمة صارمة لزمن الاستجابة، فضّل القواعد أو عتبات التكلفة أو التضمينات، واحتفظ بالمصنِّف للأحمال غير المتزامنة أو المجدولة.
المصادر
- Seifi, N. and Chugh, M. (2025-04-09). "Multi-LLM routing strategies for generative AI applications on AWS." AWS Machine Learning Blog. https://aws.amazon.com/blogs/machine-learning/multi-llm-routing-strategies-for-generative-ai-applications-on-aws/ (accessed July 30, 2026)
- AWS sample code: sample-multi-llm-dynamic-prompt-routing. https://github.com/aws-samples/sample-multi-llm-dynamic-prompt-routing (accessed July 30, 2026)
- LiteLLM documentation. https://docs.litellm.ai (accessed July 30, 2026)
- Anthropic pricing. https://www.anthropic.com/pricing (accessed July 30, 2026)
- OpenAI API pricing. https://openai.com/api/pricing (accessed July 30, 2026)
- ulab-uiuc LLMRouter. https://github.com/ulab-uiuc/LLMRouter (accessed July 30, 2026)
- Ong, I. et al. (2024). "RouteLLM: Learning to Route LLMs with Preference Data." arXiv:2406.18665. https://arxiv.org/abs/2406.18665 (accessed July 30, 2026)
- OpenRouter rankings. https://openrouter.ai/rankings (accessed July 30, 2026)