guides

موجّه LLM: وجّه الطلبات وخفّض التكاليف 60% [2026]

بقلم Mert Batur
Jul 31, 2026
14 قراءة
موجّه LLM: وجّه الطلبات وخفّض التكاليف 60% [2026]

موجّه LLM: وجّه الطلبات وخفّض التكاليف 60% [2026]

موجّه LLM طبقة رقيقة بين تطبيقك وعدة نماذج لغوية تختار النموذج الذي يعالج كل طلب. يفحص الموجّه الطلب (نوع المهمة، التعقيد، ميزانية الرموز)، ويحيله إلى النموذج الأنسب، ثم ينتقل إلى نسخة احتياطية إذا أخفق ذلك النموذج. الهدف: إجابات بحجم مناسب بأقل تكلفة رموز ممكنة.

دفع تكلفة نموذج رائد للإجابة عن "ما سياسة الاسترداد لديكم؟" هو الطريقة التي تنتفخ بها الفواتير. قاست AWS البديل في أبريل 2025: موجّه مصنِّف يضيف 0,53 ثانية من زمن الاستجابة، وموجّه دلالي يضيف 0,10 ثانية، وخصم يصل إلى 30% من الفاتورة عند التوجيه داخل عائلة نماذج واحدة. أعد حساب تلك الأرقام عبر عدة مزودين بأسعار القائمة المعلنة في يوليو 2026، كما نفعل أدناه، وسيبلغ الخفض 70%. معظم التوفير يأتي من قرار واحد يُتخذ قبل توليد رمز واحد.

أبرز النقاط

  • يقرر موجّه LLM أي نموذج يعالج كل طلب، بناءً على نوع المهمة أو التكلفة أو الجودة المقاسة.
  • توجد خمس استراتيجيات: التوجيه بالقواعد، والواعي بالتكلفة، والواعي بزمن الاستجابة، والدلالي (التضمينات)، وتوجيه بمصنِّف LLM.
  • التوجيه بالقواعد يضيف نحو 0 مللي ثانية و0 دولار؛ وتوجيه بالمصنِّف يضيف 300 إلى 800 مللي ثانية إضافة إلى تكلفة رموز المصنِّف لكل طلب.
  • يستطيع التوجيه خفض إنفاق الرموز حتى 60% عندما تنتقل معظم الحركة البسيطة إلى نموذج أرخص بعشر إلى عشرين مرة.
  • مزود واحد، وأقل من 10 آلاف طلب يوميًا، ولا ضغط على التكاليف؟ تخطَّ الموجّه. البدائل الاحتياطية البسيطة تكفي.

ماذا يفعل موجّه LLM فعليًا؟

يشغّل موجّه LLM خطوة قرار صغيرة قبل كل استدعاء نموذج: يقرأ الطلب، ويقيّمه وفق قاعدة توجيه، ويختار نموذجًا، ويرسل الاستدعاء، ويعيد المحاولة على بديل احتياطي إذا أخفق النموذج الأول. لا شيء آخر يتغير في تطبيقك. ما زلت ترسل طلبًا واحدًا وتتلقى ردًا واحدًا.

دورة حياة الطلب، بالترتيب:

  1. وصول الطلب إلى نقطة نهاية الموجّه، تمامًا كما يصل إلى API النموذج.
  2. التحليل. يفحص الموجّه الموجه النصي: الكلمات المفتاحية، عدد الرموز، تضمينًا، أو درجة مصنِّف.
  3. الاختيار. تربط استراتيجية التوجيه تلك الإشارة بطبقة نموذج (رخيصة، متوسطة، رائدة، أو محلية).
  4. الإحالة. يذهب الاستدعاء إلى النموذج المختار عبر API متوافق مع OpenAI.
  5. البديل الاحتياطي. عند انتهاء المهلة أو بلوغ حد المعدل أو وقوع خطأ، تُعاد محاولة الطلب على الطبقة التالية في السلسلة.

يبحث الناس عن "الفرق بين بوابة LLM والموجّه" لأن توثيق المزودين يخلط بين المصطلحين. جملة واحدة تحسم الأمر: البوابة هي الأنبوب، والموجّه هو القرار. هما طبقتان وليسا متنافسين، ومعظم البوابات تضمّن موجّهًا في داخلها.

الطبقةما تقررهمزايا نموذجيةأمثلة
الوسيط (Proxy)النقل فقطعنوان نقطة النهاية، تمرير المصادقة، سجلات الطلباتnginx، Kong
البوابة (Gateway)سياسات مستوى الأنبوبمفاتيح API، حدود المعدل، الميزانيات، سجلات الاستخدام، إعادة المحاولةوسيط LiteLLM، OpenRouter، Portkey
الموجّه (Router)أي نموذج يجيبقواعد المهام، عتبات التكلفة، المطابقة الدلالية، تقييم المصنِّفموجّه LiteLLM، RouteLLM، كود مخصص

وفق توثيق LiteLLM، فإن الوسيط نفسه الذي يحتفظ بمفاتيحك الافتراضية يشغّل الموجّه أيضًا. هل تقارن بين أدوات مستوى الأنبوب تحديدًا؟ تجمع مراجعتنا لـأفضل أدوات بوابات LLM عشر أدوات في تصنيف واحد.

هل تحتاج إلى موجّه LLM أصلًا؟

معظم التطبيقات الصغيرة لا تحتاجه. يبرّر الموجّه وجوده عندما تنقسم الحركة إلى أنواع مهام مختلفة بوضوح، أو عندما تكون فاتورة الرموز أكبر بند في تكاليف بنيتك التحتية، أو عندما تشغّل أكثر من مزود واحد وتحتاج إلى انتقال احتياطي. دون تلك العتبات، تمنحك إعادة المحاولة البسيطة مع نموذج احتياطي واحد الموثوقية نفسها دون قطعة متحركة إضافية.

نقولها بصراحة، لأن أحدًا غيرنا في هذا المجال لن يقولها: إذا كنت تشغّل مزودًا واحدًا بأقل من 10 آلاف طلب يوميًا، فالموجّه عبء لا تحتاجه. البدائل الاحتياطية البسيطة هي الفائز.

وضعكالحكم
مزود واحد، أقل من 10 آلاف طلب يوميًا، لا ضغط على التكاليفتخطَّه. استخدم إعادة المحاولة مع نموذج احتياطي واحد
حركة مختلطة (أسئلة دعم شائعة واستدلال معقد)وجّه حسب نوع المهمة (بالقواعد)
فاتورة الرموز هي أكبر بند في بنيتك التحتيةوجّه حسب طبقة التكلفة (واعٍ بالتكلفة أو متدرّج)
مزودان أو أكثروجّه وانتقل احتياطيًا بينهم
منتج حساس للجودة مع تقييمات في CIوجّه حسب الجودة المقاسة (مصنِّف أو تقييمات)

لماذا هذه الصراحة؟ كل مسار توجيه هو ادعاء ("فئة المهام هذه آمنة على النموذج الرخيص") يتآكل مع تغيّر النماذج والأسعار ومنتجك. لا تشترِ تكلفة الصيانة تلك إلا عندما يتفوق التوفير عليها بوضوح.

استراتيجيات توجيه LLM الخمس (ومتى تستخدم كلًا منها)

تجيب كل استراتيجية توجيه عن سؤال واحد: ما الإشارة التي تثق بها بما يكفي لاختيار نموذج؟ القواعد تثق بالكلمات المفتاحية. التوجيه بالتكلفة يثق بميزانية الرموز. التوجيه بزمن الاستجابة يثق بمؤقّت. التوجيه الدلالي يثق بالتضمينات. التوجيه بالمصنِّف يثق بنموذج LLM آخر. والمقايضة دائمًا بالشكل نفسه: جودة إشارة أعلى تعني زمن استجابة وتكلفة إضافية أكبر لكل طلب.

يقترح الإكمال التلقائي صيغًا مثل "استراتيجيات توجيه llm" و"توجيه مهام llm" و"توجيه نوايا llm" و"التوجيه الديناميكي llm". وهي تنطوي على خمسة أنماط:

الاستراتيجيةكيف تقررزمن الاستجابة المضافالتكلفة المضافةمتى تستخدمها
التوجيه بالقواعد/المهامكلمة مفتاحية أو تعبير نمطي يطابق خريطة مساراتنحو 0 مللي ثانية0 دولارنوايا متوقعة: استردادات، ملخصات، إصلاحات SQL
التوجيه الواعي بالتكلفةعدد الرموز أو عتبة ميزانيةنحو 0 مللي ثانية0 دولارأحجام كبيرة، هوامش ربح ضيقة
التوجيه الواعي بزمن الاستجابةp95 الحي لكل طبقة نموذجنحو 0 مللي ثانية (يحتاج مقاييس)0 دولاردردشة موجهة للمستخدم مع اتفاقية مستوى خدمة
التوجيه الدلاليتشابه التضمين مع موجهات مرجعية50 إلى 150 مللي ثانيةرموز التضمينمدخلات مستخدم غامضة ومفتوحة
التوجيه بمصنِّف LLMنموذج رخيص يقيّم الصعوبة300 إلى 800 مللي ثانيةرموز المصنِّفحركة مختلطة الصعوبة، الجودة أولًا

نمط واحد يقطع الاستراتيجيات الخمس جميعها: التدرّج (cascade)، ويُسمى أيضًا تدرّج النماذج. ابدأ رخيصًا وصعّد فقط عند الفشل أو انخفاض الثقة. يجيب روبوت دعم من نموذج بسعر 0,25 دولار لكل مليون رمز؛ وإذا هبطت ثقته دون 0,7، تُعاد محاولة الطلب نفسه على نموذج رائد. لا تدفع مقابل الذكاء إلا عندما تعترف الطبقة الرخيصة بأنها عاجزة.

للتعمق الأكاديمي، تفهرس مكتبة LLMRouter من ulab-uiuc أكثر من 16 خوارزمية توجيه بحثية (KNN وSVM وMLP وتحليل المصفوفات وElo والرسوم البيانية وأنماط BERT). إذا كان التوجيه الدلالي هو اختيارك، فإن تضمينات الأمثلة المرجعية تحسم كل شيء تقريبًا؛ ويغطي دليلنا لـأفضل نماذج التضمين أيّها يصمد على المدونات النصية الحقيقية.

كيف تبني موجّه LLM بلغة Python؟

تبنيه بنحو 80 سطرًا من Python الصريح مقابل أي نقطة نهاية متوافقة مع OpenAI. لا حاجة إلى إطار عمل. الموجّهات الأربعة أدناه تتصاعد في تطورها: قواعد كلمات مفتاحية، عتبة تكلفة، تشابه تضمينات، ونموذج مصنِّف مع انتقال احتياطي. كل واحد منها يطبع النموذج الذي اختاره، لتراقب القرار وهو يحدث.

إذا بحثت عن "كيف أبني موجّه llm" ولم تجد سوى حزم AWS CDK ومستودعات أكاديمية، فهذا القسم هو الإجابة الصريحة. التنفيذ المرجعي من AWS متين لكنه ملحوم بـ Bedrock وLambda وCDK. تنفيذنا يعمل في أي مكان يشير إليه عميل OpenAI: OpenAI، وAnthropic عبر وسيط، وOllama على حاسوب محمول، وvLLM على جهاز بمعالج رسومي. هذا هو الموجّه الذي نرسمه للعملاء أولًا.

الخطوة 1: موجّه بالقواعد (كلمات مفتاحية إلى نماذج)

خط الأساس بصفر زمن استجابة إضافي. خريطة تعبيرات نمطية تقرر؛ وكل ما لا يطابق يذهب إلى الطبقة الرائدة.

python
import re
from openai import OpenAI

client = OpenAI()  # works with OpenAI, Ollama, vLLM, or a LiteLLM proxy

def ask(model: str, prompt: str) -> str:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return r.choices[0].message.content

ROUTES = [
    (re.compile(r"\b(refund|cancel|invoice|password|hours)\b", re.I), "gpt-5-mini"),
    (re.compile(r"\b(summarize|translate|rewrite)\b", re.I), "gpt-5-mini"),
]
FRONTIER = "gpt-5"

def rule_router(prompt: str) -> str:
    for pattern, model in ROUTES:
        if pattern.search(prompt):
            return model
    return FRONTIER

prompt = "How do I cancel my subscription?"
model = rule_router(prompt)
print(model)  # gpt-5-mini: regex hit on "cancel"
print(ask(model, prompt))

المدخل: سؤال دعم. القرار: مطابقة تعبير نمطي على "cancel". النموذج المختار: gpt-5-mini. لا حاجة إلى استدعاء API لتوجيهه، ولهذا يبقى الخيار الافتراضي.

الخطوة 2: موجّه واعٍ بالتكلفة (عتبة ميزانية الرموز)

الفكرة نفسها، لكن الإشارة هي حجم الطلب بدلًا من الكلمات المفتاحية. الموجهات القصيرة ذات ميزانيات الإخراج الصغيرة تذهب إلى الرخيص؛ وكل ما عداها يذهب إلى الرائد.

python
def cost_router(prompt: str, max_output_tokens: int = 500) -> str:
    word_count = len(prompt.split())
    if word_count < 60 and max_output_tokens <= 300:
        return "gpt-5-mini"  # $0.25 in / $2 out per M tokens
    return "gpt-5"           # $1.25 in / $10 out per M tokens

prompt = "Write a two-line product description for a ceramic mug."
model = cost_router(prompt, max_output_tokens=120)
print(model)  # gpt-5-mini: short prompt, small output budget

بدائي؟ نعم. فعّال؟ نعم أيضًا، لأن حجم الرموز يرتبط بحجم المهمة أفضل مما يتوقع معظم الناس. هذه هي الاستراتيجية الكاملة وراء عدة منتجات مدفوعة لـ"موجّه llm رخيص".

الخطوة 3: موجّه دلالي (تضمينات إلى أمثلة مرجعية)

لمدخلات المستخدم الغامضة التي تراوغ الكلمات المفتاحية، ضمّن الموجه النصي وقارنه بموجهات مرجعية مضمّنة. أي عنقود هو الأقرب يستحوذ على الطلب.

python
import numpy as np

EXEMPLARS = {
    "gpt-5-mini": [
        "classify this support ticket into a category",
        "extract the shipping address from this email",
    ],
    "gpt-5": [
        "debug this race condition in our worker pool",
        "design a multi-tenant billing schema",
    ],
}

def embed(texts: list[str]) -> np.ndarray:
    r = client.embeddings.create(model="text-embedding-3-small", input=texts)
    return np.array([d.embedding for d in r.data])

CENTROIDS = {m: embed(xs).mean(axis=0) for m, xs in EXEMPLARS.items()}

def semantic_router(prompt: str) -> str:
    v = embed([prompt])[0]
    scores = {
        m: float(np.dot(v, c) / (np.linalg.norm(v) * np.linalg.norm(c)))
        for m, c in CENTROIDS.items()
    }
    return max(scores, key=scores.get)

print(semantic_router("pull the tracking number out of this message"))
# gpt-5-mini: closest to the extraction exemplars

تكلفة استدعاء التوجيه تضمين واحد (بضعة مئات من الرموز) و50 إلى 150 مللي ثانية. احسب المراكز المسبقة عند الإقلاع، لا عند كل طلب.

الخطوة 4: موجّه بمصنِّف LLM مع بديل احتياطي

أقوى إشارة: نموذج رخيص يقرأ الموجه النصي ويقيّم صعوبته. هذه هي الاستراتيجية التي قاست AWS لها 0,53 ثانية من زمن الاستجابة المضاف، لذلك نغلفها بسلسلة بدائل احتياطية.

python
def classify_router(prompt: str) -> str:
    verdict = client.chat.completions.create(
        model="gpt-5-mini",
        messages=[{"role": "user", "content":
            "Reply HARD or EASY only. Task: " + prompt}],
        max_tokens=5,
    ).choices[0].message.content.strip().upper()
    return "gpt-5" if verdict.startswith("HARD") else "gpt-5-mini"

def route_and_call(prompt: str) -> str:
    model = classify_router(prompt)
    try:
        return ask(model, prompt)
    except Exception:
        backup = "gpt-5-mini" if model == "gpt-5" else "gpt-5"
        return ask(backup, prompt)  # fallback tier catches the failure

print(route_and_call("Prove this greedy algorithm is optimal."))
# classifier says HARD, so gpt-5 answers

هذا هو مثال موجّه LLM كاملًا: أربع دوال، وعميل واحد، ولا بنية تحتية تتجاوز ما تشغّله بالفعل. تحصين الإنتاج هو القسم التالي.

كم يوفّر توجيه LLM فعليًا؟

قاست AWS تكلفة الموجّه عند 107,90 إلى 188,90 دولارًا شهريًا لكل 100 ألف سؤال يوميًا، مع إضافة التوجيه بالمصنِّف 0,53 ثانية لكل طلب والتوجيه الدلالي 0,10 ثانية. جانب التوفير يطغى على تلك التكلفة. مثالنا المحسوب أدناه، المبني على أسعار القائمة المعلنة في يوليو 2026، يستقر عند خفض إنفاق بنسبة 70,7%. العقبة هي مزيج الحركة: تحتاج إلى أن تستحق معظم الطلبات الطبقة الرخيصة.

جدولان. أولًا، ما يكلّفك الموجّه نفسه لكل 1,000 طلب:

الاستراتيجيةزمن الاستجابة المضافالتكلفة المضافة لكل 1,000 طلبالأساس
بالقواعدنحو 0 مللي ثانية0 دولارمسار كود صِرف
دلالي (تضمينات)50 إلى 150 مللي ثانية0,02 إلى 0,10 دولارتقدير: نحو 50 رمزًا لكل موجه بأسعار text-embedding-3-small
مصنِّف LLM300 إلى 800 مللي ثانية0,30 إلى 1,00 دولارزمن الاستجابة قاسته AWS (0,53 ثانية)؛ والتكلفة مقدّرة بأسعار gpt-5-mini لاستدعاء تصنيف بنحو 300 رمز

منشور AWS في أبريل 2025 هو مجموعة القياسات الوحيدة المنشورة باستقلالية في هذا المجال، لذلك نرسو عليه ونوسم إضافاتنا بأنها تقديرات لا أرقامًا قسناها بأنفسنا. خفض التوجيه الذكي للموجهات داخل العائلة الواحدة في Bedrock التكلفة بنسبة تصل إلى 30%، وفق AWS.

ثانيًا، مثال التوفير المحسوب الذي يدعم عنواننا:

السيناريوالحركة البسيطة (80,000 طلب)الحركة المعقدة (20,000 طلب)الإجمالي الشهري
دون موجّه: كل شيء على Claude Sonnet 4 (‏3 دولارات دخول / 15 دولارًا خروج لكل مليون رمز)432,00 دولار108,00 دولارات540,00 دولار
مع التوجيه: البسيط على GPT-5 mini (‏0,25 دولار دخول / 2 دولار خروج)، والمعقد على Sonnet 448,00 دولارًا108,00 دولارات156,00 دولارًا
تكلفة المصنِّف (100 ألف استدعاء تصنيف على GPT-5 nano، نحو 300 رمز لكل منها)نحو 2,10 دولار
الصافي مع التوجيهنحو 158,10 دولارًا

الافتراضات، موسومة: 100 ألف طلب شهريًا؛ 800 رمز إدخال إضافة إلى 200 رمز إخراج لكل طلب في المتوسط؛ انقسام 80% بسيط / 20% معقد؛ أسعار القائمة من صفحة أسعار Anthropic وصفحة أسعار OpenAI كما هي في يوليو 2026، مع جدول الأسعار الكامل في مقارنة أسعار LLM API. حساب الطلب الواحد: يكلّف Sonnet 4 ما مقداره 800 × 3 دولارات/مليون + 200 × 15 دولارًا/مليون = 0,0054 دولار؛ ويكلّف GPT-5 mini ما مقداره 800 × 0,25 دولار/مليون + 200 × 2 دولار/مليون = 0,0006 دولار.

النتيجة خفض بنسبة 70,7%، ومنها تأتي نسبة 60% في عنواننا، مع هامش أمان إضافي. محاذير صادقة: هذا مثال محسوب، لا اختبار أداء قسناه. وهو يفترض أن طبقتك الرخيصة أرخص بعشر إلى عشرين مرة وأن 80% من الحركة تستحقها فعلًا. التوجيه داخل العائلة الواحدة، وهو سيناريو AWS، يبقى قرب 30%. والتوجيه رافعة واحدة من روافع كثيرة؛ غالبًا ما يردّ التخزين المؤقت للموجهات وتقليمها التكلفة أسرع، ويصنّف دليلنا لطرق خفض تكاليف LLM API الطرق الاثنتي عشرة جميعها.

أنماط التوجيه في الإنتاج

الموجّه التجريبي يختار نموذجًا. موجّه الإنتاج يعيد المحاولة أيضًا، ويوازن الحمل، ويخزّن المكررات مؤقتًا، ويعزل مفاتيح API لكل فريق. بعد بضعة آلاف من الطلبات يوميًا، كفّ عن بناء هذه الأشياء يدويًا وشغّل بوابة تضمّن موجّهًا.

الأنماط الأربعة التي تهم:

  • سلاسل البدائل الاحتياطية. الطبقة الرخيصة أولًا، والرائدة عند الخطأ أو انتهاء المهلة. النمط الأعلى قيمة على الإطلاق؛ معظم موثوقيتك يأتي منه وحده.
  • موازنة الحمل. وزّع الاستدعاءات على نشرات مكررة أو مفاتيح API متعددة لتفادي حدود المعدل لكل مفتاح.
  • التخزين المؤقت للردود. الموجهات المتطابقة تعيد إجابات مخزنة. حركة الدعم تتكرر أكثر مما تظن؛ ومعدلات إصابة 10 إلى 30% شائعة.
  • المفاتيح الافتراضية والميزانيات. أصدر مفاتيح لكل فريق بسقوف شهرية حتى لا تحرق حلقة جامحة واحدة الفاتورة كلها.

هذا قريب من الإعداد الذي نشغّله على حزمة وكلاء مرحلة الاختبار لدينا (الملف: litellm-router.yaml، محمّل داخل حاوية وسيط LiteLLM):

yaml
model_list:
  - model_name: cheap
    litellm_params:
      model: openai/gpt-5-mini
  - model_name: frontier
    litellm_params:
      model: anthropic/claude-opus-5

router_settings:
  routing_strategy: simple-shuffle
  fallbacks: [{"cheap": ["frontier"]}]
  num_retries: 2
  timeout: 30

أين يناسب كل أداة، مع آرائنا:

  • LiteLLM. اختره إذا أردت استضافة ذاتية ومصدرًا مفتوحًا وكنت تشغّل Docker بالفعل. يغطي دليل إعداد وسيط LiteLLM النشر كاملًا، بما فيه المفاتيح والميزانيات.
  • OpenRouter. اختره إذا أردت مئات النماذج خلف مفتاح واحد وصفر عمليات تشغيل. صفحة الترتيب لديهم تصلح أيضًا بيانات إنتاجية.
  • Portkey. اختره إذا كانت متطلبات المؤسسات (SSO، سجلات التدقيق، تقارير الامتثال) هي ما يقود القرار.
  • كود مخصص من هذا المنشور. اختره إذا كنت دون نحو 50 ألف طلب يوميًا وتريد صفر بنية تحتية جديدة.

مهما اخترت، تقارن مراجعة أدوات بوابات LLM بينها وجهًا لوجه.

هل يمكنك التوجيه بين النماذج المحلية وواجهات API المستضافة؟

نعم، وحساب الرموز مغرٍ: النموذج المحلي يحاسب بصفر دولار لكل رمز، لذا كل طلب يجيب عنه Ollama أو vLLM هو توفير صافٍ. المقايضة هي زمن الاستجابة والجودة لكل واط. المحلي يفوز في المهام البسيطة عالية الحجم على عتاد تملكه بالفعل؛ ويلتقط API المستضاف كل ما يحتاج إلى عقل رائد.

التفاصيل التقنية مخيبة للآمال، وهذه هي الفكرة. يكشف Ollama نقطة نهاية متوافقة مع OpenAI عند localhost:11434/v1، ويقدّم vLLM الشكل نفسه. لذا يعمل كل موجّه أعلاه دون تغيير: وجّه base_url إلى الخادم المحلي، وضع qwen3:8b في الخانة الرخيصة، وأبقِ gpt-5 طبقة احتياطية. ولصندوق موجّه ذاتي الاستضافة، تُشحن LiteLLM كصورة Docker، وهو إعداد "موجّه llm docker" الذي يبحث عنه الناس.

ملاحظتا صدق. نموذج بحجم 70B على شريحة A100 واحدة يخدم نحو 30 إلى 40 رمزًا في الثانية؛ وتتفوق واجهات API المستضافة على ذلك في الإنتاجية اللحظية، لذا يناسب التوجيه المحلي الحركة الخلفية المستقرة أكثر من دردشة المستخدم المتقلبة. والنماذج المحلية بحجم 8B تتعثر في استدعاءات الأدوات متعددة الخطوات، لذا أبقِ المسارات الصعبة موجهة نحو السحابة. إذا كنت تختار محرك الخدمة نفسه، يقارن vLLM مقابل SGLang بينهما بالأرقام.

يشغّل التوجيه أيضًا إعدادات وكلاء البرمجة متعددة النماذج. يتيح وسيط بأسلوب LiteLLM لـ Claude Code التحدث إلى النماذج المحلية والمستضافة عبر نقطة نهاية واحدة؛ راجع كيفية استخدام نماذج مختلفة في Claude Code للتوصيلات الدقيقة.

كيف تعرف أن التوجيه يعمل؟

تقيسه، أو أنك تخمّن. سجّل أي نموذج أجاب عن كل طلب، وقيّم عينة من المخرجات مقابل سلّم تقييم، وأعد تغذية الدرجات إلى قواعد التوجيه. الفرق التي تتخطى هذه الخطوة تنتهي بإعداد ثابت يتعفن بهدوء بينما تتغيّر النماذج والأسعار تحته.

مسار التدرّج يسير هكذا: القواعد أولًا، ثم التكلفة، ثم الجودة المقاسة:

  1. سجّل المسار. خزّن النموذج المختار وزمن الاستجابة وأعداد الرموز لكل طلب كعمود واحد في آثار التتبع الموجودة لديك.
  2. قيّم المخرجات أسبوعيًا. قاضٍ من LLM أو عينة بشرية، نجاح/فشل لكل فئة طلبات. خمسون مخرجًا مُقيّمًا لكل فئة تكفي لتوجيه الدفة.
  3. أعد الضبط. إذا تجاوزت الطبقة الرخيصة 95% في فئة ما، وسّع قاعدتها لتلتقط مزيدًا من تلك الحركة. وإذا هبطت دون 90%، ضيّقها.

هذا هو السطر الذي نكرره للعملاء: موجّه لا تعيد ضبطه أبدًا هو مجرد إعداد ثابت بزمن استجابة إضافي. سجّل النموذج المختار، قيّم المخرجات، أعد تغذية الدرجات.

تلك الحلقة هي التقييمات وقابلية الملاحظة مطبقة على التوجيه. يغطي دليل تقييم LLM سلالم التقييم؛ ويغطي دليل قابلية ملاحظة الذكاء الاصطناعي مكان وجود آثار التتبع.

إلى أين يتجه بحث توجيه LLM؟

يتعامل الخط الأكاديمي مع التوجيه كمسألة تعلّم، لا كملف إعداد. LLMRouter من ulab-uiuc، المكتبة التي تحتل المرتبة الأولى لهذه الكلمة المفتاحية، تنفّذ أكثر من 16 خوارزمية (موجّهات KNN وSVM وMLP وتحليل المصفوفات وElo والرسوم البيانية وBERT والتعلم المعزز) مع خط أنابيب قياس أداء على 11 مجموعة بيانات. الورقة الأكثر استشهادًا حديثًا، RouteLLM (Ong وآخرون، arXiv:2406.18665)، تدرّب الموجّهات على بيانات تفضيلات بشرية وتبلّغ عن خفض تكلفة يتجاوز الضعفين دون فقدان جودة على MMLU وMT-Bench. أحدث منعطف: موجّهات تنشيطات ما قبل الملء، خط "التنشيط المسبق هو كل ما تحتاجه"، التي تقرأ تنشيطات النموذج الداخلية أثناء مرحلة ما قبل الملء للتنبؤ بالصعوبة قبل بدء التوليد. اتجاه المسار هو موجّهات تدرّب نفسها من بيانات تقييمك، وهي حلقة التغذية الراجعة نفسها من القسم السابق.

كيف تتعامل Techsy مع هذا: حزم الوكلاء التي نشحنها لعملاء B2B تشغّل هذا النمط بالضبط، موجّه طبقات تكلفة مع سلاسل بدائل احتياطية موصولة بالبوابة، إضافة إلى إعادة ضبط مدفوعة بالتقييمات. إذا كنت تزن ما إذا كان التوجيه يناسب حزمة تقنياتك، احصل على استشارة مجانية وسنرسم مزيج حركتك معك.

عن الكاتب

مرت باتور شريك مؤسس في Techsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية/لمندوبي مبيعات لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج. تواصل عبر LinkedIn.

الأسئلة الشائعة

ما موجّه LLM؟

موجّه LLM طبقة بين تطبيقك وعدة نماذج لغوية تقرر أي نموذج يعالج كل طلب. تفحص نوع مهمة الطلب أو حجمه أو صعوبته، ثم تحيله إلى النموذج الأنسب، مع بديل احتياطي إذا أخفق ذلك النموذج. فكّر فيه كمراقب حركة جوية لاستدعاءات API النماذج الخاصة بك.

كيف يعمل توجيه LLM؟

يعمل توجيه LLM في خمس خطوات: يصل الطلب، ويفحصه الموجّه (كلمات مفتاحية، عدد رموز، أو تضمين)، وتختار استراتيجية ما طبقة نموذج، ويُحال الاستدعاء، ويلتقط نموذج احتياطي أي فشل. يحدث القرار كله قبل بدء التوليد، لذا يضيف مللي ثوانٍ لا ثوانٍ، إلا إذا كان نموذج مصنِّف هو من يقيّم.

هل موجّه LLM هو نفسه بوابة LLM؟

لا. البوابة هي الأنبوب: مفاتيح API، حدود المعدل، الميزانيات، والسجلات. الموجّه هو القرار: أي نموذج يجيب. هما طبقتان وليسا متنافسين، ومعظم البوابات (LiteLLM وPortkey وOpenRouter) تضمّن موجّهًا في داخلها. يمكنك تشغيل موجّه دون بوابة، لكن في الإنتاج تريد كليهما معًا غالبًا.

هل يوفّر توجيه النماذج مالًا فعلًا؟

نعم، عندما تستحق معظم حركتك طبقة أرخص بكثير. مثالنا المحسوب ينقل 80% من الطلبات من نموذج بسعر 3 دولارات/15 دولارًا لكل مليون رمز إلى نموذج بسعر 0,25 دولار/2 دولار ويخفض الفاتورة 70,7%. أبلغت AWS عن نسبة تصل إلى 30% للتوجيه داخل عائلة نماذج واحدة. إذا كانت حركتك معقدة بالتساوي، يتقلص التوفير نحو الصفر.

ما أفضل موجّه LLM مفتوح المصدر؟

للإنتاج، LiteLLM: ذاتي الاستضافة، وصيانته نشطة، ويجمع بوابة مع موجّه. وللخوارزميات من الدرجة البحثية، تنفّذ LLMRouter من ulab-uiuc أكثر من 16 استراتيجية توجيه من الأدبيات الأكاديمية. وRouteLLM هو أقوى موجّه من حيث الجودة مقابل الدولار مدرّب على بيانات تفضيلات. على معظم الفرق أن تبدأ بـ LiteLLM ولا تلجأ إلى المكتبات البحثية إلا إذا احتاجت تقييمًا مخصصًا.

كيف أبني موجّه LLM بلغة Python؟

ابدأ بعميل OpenAI ونحو 80 سطرًا من الكود: خريطة قواعد من كلمات مفتاحية إلى نماذج، أو عتبة تكلفة على أعداد الرموز، أو تشابه تضمينات مع موجهات مرجعية، أو نموذج مصنِّف رخيص يقيّم الصعوبة. الأنماط الأربعة كلها في قسم البناء أعلاه، جاهزة للتشغيل مقابل OpenAI أو Ollama أو vLLM دون تغييرات.

هل يمكنني التوجيه بين النماذج المحلية وواجهات API السحابية؟

نعم. يكشف Ollama (localhost:11434/v1) وvLLM كلاهما نقاط نهاية متوافقة مع OpenAI، لذا يشير كود الموجّه نفسه إلى نموذج محلي للحركة الرخيصة وإلى API مستضاف للحركة الصعبة. الرموز المحلية تكلف 0 دولار، لكنك تملك العتاد وزمن الاستجابة. هذا هو النمط وراء معظم إعدادات Claude Code متعددة النماذج.

ما التوجيه الدلالي؟

يضمّن التوجيه الدلالي كل موجه وارد ويقارنه بموجهات مرجعية مضمّنة، ويرسل الطلب إلى النموذج الذي يملك أقرب عنقود مرجعي. يعالج مدخلات المستخدم الغامضة والمعاد صياغتها التي تفوّتها قواعد الكلمات المفتاحية، بتكلفة 50 إلى 150 مللي ثانية إضافة إلى رموز التضمين لكل طلب. قاسته AWS عند 0,10 ثانية من زمن الاستجابة المضاف.

كم زمن الاستجابة الذي يضيفه موجّه بمصنِّف LLM؟

قاست AWS 0,53 ثانية من زمن الاستجابة المضاف للتصنيف بمساعدة LLM، مقابل 0,10 ثانية للتوجيه الدلالي. التوجيه بالقواعد والواعي بالتكلفة يضيفان نحو الصفر، لأنهما مسارا كود صِرفان. إذا كان لمنتجك اتفاقية مستوى خدمة صارمة لزمن الاستجابة، فضّل القواعد أو عتبات التكلفة أو التضمينات، واحتفظ بالمصنِّف للأحمال غير المتزامنة أو المجدولة.

المصادر

الوسوم

توجيه موجّه llmاستراتيجيات توجيه llmموجّه النماذجتكاليف llm apilitellm

شارك هذا المقال

مقالات ذات صلة

المزيد في guides

guides
Jul 28, 2026

الـ9 مقاييس SaaS الوحيدة المهمة في 2026 (بمقارنة مرجعية مع أكثر من 1,300 شركة)

معظم أدلة مقاييس SaaS تستشهد بحدود وُضعت في 2021 ولا تنسبها لأحد. هذا الدليل ينشر تسعة مقاييس بوسطاء CY-2025 من تقارير إصدار 2026، ومقاطع الربع الأعلى، وحجم العينة وراء كل رقم، وستة مقاييس ينبغي التوقف عن تتبعها.

13 دقيقة قراءة قراءة
اقرأ
guides
Jul 28, 2026

قالب وثيقة متطلبات المنتج (PRD) + مثال عملي كامل يمكنك نسخه

معظم قوالب PRD تعطيك نموذجًا فارغًا وتتركك وحدك. هذا القالب يأتي بصيغة ماركداون جاهزة للنسخ، ويملأ الأقسام الاثني عشر جميعها بمثال بناء كامل لبوابة فواتير، ويوضح كيف تتغير الوثيقة نفسها حين يكون القارئ وكيل ذكاء اصطناعي مبرمجًا.

13 دقيقة قراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.