Techsy
اتصل بنا
ابدأ
العودة للمدونة
ai-machine-learning

نشر نموذج LLM على GPU بدون خادم: 5 منصات، أسعار حقيقية، وبدايات باردة صادقة

بقلم Mert Batur
Aug 8, 2026
13 قراءة
جدول المحتويات
نشر نموذج LLM على GPU بدون خادم: 5 منصات، أسعار حقيقية، وبدايات باردة صادقة

نشر نموذج LLM على GPU بدون خادم: 5 منصات، أسعار حقيقية، وبدايات باردة صادقة

تتقاضى RunPod مبلغ 2.72 دولار في الساعة مقابل بطاقة A100 80GB. نقطة النهاية الخاصة بك تستقبل اثني عشر طلبًا قبل الغداء. وتبقى البطاقة خاملة بقية اليوم، ثلاثًا وعشرين ساعة، والفاتورة تعمل طوال الوقت. عندما تنشر نموذج LLM على GPU بدون خادم فإنك تدفع فقط أثناء تنفيذ الطلب. خمس منصات تقدم هذا النموذج. وكل منها تحاسب بوحدة قياس مختلفة. ولا أحد يوحد هذه الوحدات.

البطاقة الخاملة تكلف بالضبط ما تكلفه البطاقة المشغولة.

أبرز النقاط

  • GPU بدون خادم يحاسب فقط أثناء تنفيذ الطلب، ويتصفّر بين الطلبات.
  • بطاقة واحدة لكل نسخة على Cloud Run؛ ونماذج 70B تحتاج عدة بطاقات، لذا لا يستطيع النموذج بدون خادم استضافتها غالبًا.
  • أوزان النموذج إما داخل الصورة، أو على وحدة تخزين شبكية، أو يُعاد تنزيلها مع كل بداية باردة.
  • البداية الباردة ثلاثة أشياء: إقلاع الحاوية، وتحميل الأوزان، وتهيئة المحرك. الأول فقط هو السريع.
  • تحت نحو 47,000 طلب يوميًا، يهزم التصفير بطاقةً مستأجرة تعمل على مدار الساعة.

ماذا يعني «GPU بدون خادم» فعلًا لنموذج LLM؟

منصة GPU بدون خادم تشغّل حاوية الاستدلال الخاصة بك على عتاد GPU مشترك، وتقلع عند وصول طلب، وتتصفّر عندما تتوقف الحركة. تدفع بالثانية (أو بالدقيقة أو بالساعة حسب المزود) فقط أثناء عمل الحاوية. لا فاتورة خمول. ولا نسخة محجوزة.

وحدة الفوترة تختلف بين المزودين، ولهذا يوحّد القسم التالي كل الأرقام في صيغة دولار/ساعة-GPU.

هناك قيدان يفاجئان الناس. أولًا، يسمح Google Cloud Run ببطاقة GPU واحدة لكل نسخة كحد أقصى. وهذا يضع سقفًا لذاكرة VRAM عند بطاقة واحدة. ثانيًا، «بدون خادم» لا تعني حالة دائمة. لا توجد عملية طويلة العمر تحتفظ بأوزانك في الذاكرة بين الطلبات. عندما تموت الحاوية، يموت كل ما في الذاكرة معها. هذه الحقيقة وحدها تقود قرار التخزين في قسم أوزان النموذج أدناه.

بدون خادم لا تعني غياب الخادم. تعني غياب الخادم بين طلباتك، وهناك بالضبط تختفي أوزان نموذجك.

أي منصة GPU بدون خادم تختار؟ (أسعار 2026 جنبًا إلى جنب)

نحن لا نبيع أيًا من هذه المنصات ولا نحصل منها على أي عمولة تسويق. من بين المقالات السبعة التي تنافس على هذا الاستعلام وصيغه القريبة، أربعة منشورة من شركات تبيع GPU بدون خادم. هذا الجدول ليس كذلك.

جميع الأسعار قُرئت من صفحات التسعير الرسمية للمزودين في 30 يوليو 2026. الأسعار تتغير؛ تحقق مجددًا قبل الالتزام.

المنصةالوحدة المنشورة (بألفاظهم)$/ساعة-GPU (A100 80GB)$/ساعة-GPU (H100)رصيد مجانياخترها إذا...
Modal0.000694$ / ثانية2.50$3.95$30$ شهريًا (Starter)كنت تريد فوترة بالثانية، وبناءً سريعًا، ولقطات GPU
RunPod2.72$ / ساعة2.72$4.55$لا شيء منشوركنت تريد أوسع قائمة بطاقات بأسعار ساعة ثابتة
Beam0.000625$ / ثانية2.25$3.55$30$ شهريًاكنت تريد صفر فوترة على الإقلاع وتحميل الصورة
Baseten0.06667$ / دقيقة4.00$6.50$نعم، بدون مبلغ منشوركنت تريد استدلالًا مُدارًا بفوترة على الحساب النشط
Cloud Runبالثانية (L4 وRTX PRO 6000 Blackwell؛ لا A100/H100)غير منشور (لا A100)غير منشور (لا H100)300$ رصيد GCPكنت بالفعل على GCP وتحتاج تحكمًا في مناطق الاتحاد الأوروبي/الولايات المتحدة

حسابات التوحيد، معروضة مرة واحدة لتدقيقها: سعر Modal لبطاقة A100 80GB عند 0.000694$ في الثانية مضروبًا في 3600 ثانية يساوي 2.4984$ في الساعة. Beam:‏ 0.000625$ في 3600 يساوي 2.25$ في الساعة. Baseten:‏ 0.06667$ في الدقيقة في 60 يساوي 4.00$ في الساعة. هذا الفارق البالغ 1.8 ضعف بين Beam وBaseten على البطاقة نفسها حقيقي، وهو مختفٍ على مرأى من الجميع لأن أحدًا لا ينشر الوحدة نفسها.

ثلاث ملاحظات. صفحة تسعير Beam تنص صراحة على أنها لا تحاسب على إقلاع الخادم أو تحميل صورة الحاوية. وأسئلة التسعير الشائعة لدى Baseten تجيب عن «هل أدفع مقابل وقت الخمول على Baseten؟» بـ«لا، أنت لا تدفع مقابل وقت الخمول»، ثم تضيف أن الوقت القابل للفوترة هو «الوقت الذي يُنشَر فيه نموذجك فعليًا، أو يتوسع صعودًا أو هبوطًا، أو ينفذ تنبؤات»، أي أن العداد يغطي أكثر من وقت التنبؤ، وهذا هو الجزء الذي يستحق وضع الميزانية له. أما RunPod فتنشر أسعارًا بالساعة دون أي رقم للبداية الباردة على صفحة التسعير.

إذا كانت Modal هي خيارك، فقد كتبنا شرح Modal الكامل في مقال منفصل.

هل يتسع نموذجك أصلًا؟ VRAM وحدود البطاقة الواحدة والحصص

هل يمكنك تشغيل نموذج 70B على GPU بدون خادم؟ غالبًا لا. بدقة FP16 يحتاج 70B إلى نحو 140GB من VRAM. ويضع Cloud Run حدًا أقصى بطاقة واحدة لكل نسخة (96GB كحد أقصى على RTX PRO 6000). والحساب لا يستقيم دون تكميم (FP8/GGUF) أو منصة متعددة البطاقات.

البطاقةVRAMالحد الأدنى CPU / الذاكرةالسقف المعتاد للنماذج
L424GB4 أنوية CPU / 16GiB‏7B-13B (FP16)، وحتى 30B مع التكميم
A100 80GB80GBيختلف حسب المنصة‏30B-70B مع التكميم
H100 80GB80GBيختلف حسب المنصة‏30B-70B مع التكميم
RTX PRO 6000 Blackwell96GB20 نواة CPU / 80GiB‏70B بدقة FP8

الحصة الافتراضية في Cloud Run هي 3 بطاقات L4 لكل منطقة لكل مشروع (وتُمنح RTX PRO 6000 بشكل منفصل بواقع 3,000 milliGPU)، عبر ست مناطق لبطاقة L4: asia-southeast1 وasia-south1 وeurope-west1 وeurope-west4 وus-central1 وus-east4. هذا هو نصف الإجابة الخاص بـ Cloud Run في مسألة إقامة البيانات لكل من يسأل عن GPU بدون خادم في أوروبا؛ أما Modal وRunPod فتوثّقان مناطقهما الأوروبية الخاصة، وفي قسم الأسئلة الشائعة بقية الإجابة.

شرح Cloud Run الذي نشره Ismaili Simba على dev.to (أبريل 2025) يذكر أن طلب الحصة «قد يستغرق بعض الوقت (حتى 5 أيام عمل) للموافقة عليه»، وأن «بطاقات L4 المتوفرة على Cloud Run لها حد 16GB من الذاكرة». خطط لهذا التأخير.

لتقدير VRAM نموذجًا بنموذج، راجع دليل متطلبات VRAM.

أين تعيش أوزان نموذجك (وما تكلفة ذلك)؟

نقاش على Reddit من نوفمبر 2024 ظل في المرتبة الخامسة على Google لهذا الاستعلام بعينه عندما تحققنا في 30 يوليو 2026، يسأل بحرفيته:

«لم أتمكن من العثور على سعر لتخزين نموذج بحجم 80GB... ما البديل إن كنت لا أريد تنزيل النموذج عند كل استدعاء API (تُهيَّأ النسخة عند الاستدعاء ثم تُغلق)؟... لماذا لا تعرض هذه المنصات تكلفة تخزين النماذج؟»

ثلاث ردود منخفضة التقييم، ولا واحد منها إجابة. عندما أجرينا هذا البحث في 30 يوليو 2026، كانت النتائج العشر الأولى لا تزال تضم ذلك النقاش ابن العامين الذي يسأل عن تكلفة تخزين النماذج. ولم يجب عنه أحد في النقاش. وكلتا المنصتين تنشر السعر. على Modal هو 0.09$ لكل GiB شهريًا مع إعفاء أول TiB، أي أن نقطة حفظ بحجم 80GB تُفوتر بـ 0.00$. وعلى RunPod هو 0.07$ لكل GB شهريًا للتخزين الشبكي تحت 1TB، أي نحو 5.60$ شهريًا لنقطة الحفظ نفسها.

موضع التخزينأثر البداية الباردةالتكلفةهل يلزم إعادة بناء لتغيير النموذج؟الأنسب لـ
مدمج في صورة الحاويةأسرع إقلاعتضخم حجم الصورة (‏27B بدقة FP8 = عشرات GB)نعم، إعادة بناء كاملةنقاط النهاية أحادية النموذج
وحدة تخزين شبكية دائمةسريع (مخزن مؤقت على المضيف)Modal ‏0.09$/GiB شهريًا مع 1TiB مجانًا؛ RunPod ‏0.07$/GB شهريًا تحت 1TBلا، غيّر المسار فقطالنماذج المتعددة أو التبديل المتكرر
سحب من Hugging Face عند الإقلاعالأبطأ: أكثر من 26 ثانية لـ 130GB بسرعة 5GB/sمجاني (نطاق ترددي من HF)لاالنماذج الأولية فقط

الصف الثالث هو نمط الفشل. مراجعة أجرتها جامعة TU München عام 2024 لمشروع ServerlessLLM ‏(arXiv 2411.15664) تذكر أن LLaMA-2-70B ‏(130GB) يحتاج أكثر من 26 ثانية للسحب بسرعة 5GB/s، إضافة إلى نحو 84 ثانية للتحميل على 8 بطاقات GPU، مقابل نحو 100 مللي ثانية لتوليد التوكن. هذه الأرقام مستشهد بها في تلك المراجعة، لا مقيسة فيها.

صفحة تسعير RunPod تحمل قسم تخزين: قرص الحاوية 0.10$/GB شهريًا، وقرص الوحدة 0.10$/GB شهريًا أثناء التشغيل و0.20$/GB شهريًا أثناء الخمول، والتخزين الشبكي 0.07$/GB شهريًا تحت 1TB و0.05$/GB شهريًا فوقها، والتخزين الشبكي عالي الأداء 0.14$/GB شهريًا. الرقم موجود. لكنه لا يجلس بجانب أسعار GPU بدون خادم التي يقارنها القارئ عندما يخطر له السؤال، ولا في مسار إعداد نقطة النهاية. إنها مشكلة قابلية العثور، لا مشكلة سرية، وكافية لإبقاء السؤال حيًا بعد عامين.

bash
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1
dockerfile
# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change models

إذا لم تختر نموذجًا بعد، فإن مقارنتنا لأفضل النماذج مفتوحة المصدر لعام 2026 تقدّر حجم كل خيار للنشر.

النشر: vLLM على RunPod Serverless من البداية للنهاية

ست خطوات من الصفر إلى نقطة نهاية قابلة للاستدعاء. تحقق من كل خطوة مقابل إجراءات vLLM لدى RunPod (المحدثة في 22 يونيو 2026)، والتي لا تنشر أي أسعار.

  1. اختر نموذجك. اختر نموذجًا مفتوح الأوزان بحجم يناسب بطاقتك (راجع جدول VRAM أعلاه). إذا كان مقيدًا على Hugging Face، فأنشئ رمز وصول أولًا.

  2. أنشئ نقطة النهاية بدون خادم. في وحدة تحكم RunPod، اختر Serverless، ثم قالب عامل vLLM، ثم فئة البطاقة.

  3. اضبط متغيرات البيئة المهمة.

env
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=auto

قيمة خاطئة في MODEL_NAME تعني خطأ 404 عند الإقلاع. وقيمة مرتفعة جدًا في MAX_MODEL_LEN نسبة إلى VRAM تعني نفاد الذاكرة قبل أول توكن. ورفع GPU_MEMORY_UTILIZATION فوق 0.95 لا يترك هامشًا لقفزات ذاكرة KV المؤقتة.

  1. اضبط الحد الأدنى والأقصى للعاملين ومهلة الخمول. الحد الأدنى 0 يمنحك التصفير (والبدايات الباردة). والحد الأدنى 1 يلغي البدايات الباردة لكنه يفوتر باستمرار. قسم البداية الباردة أدناه يفصل هذه المقايضة.

  2. أرفق وحدة التخزين الشبكية التي قررت استخدامها في قسم الأوزان، أو اقبل مسار الدمج في الصورة. إذا تجاوزت هذه الخطوة، فكل بداية باردة ستعيد تنزيل نقطة الحفظ.

  3. أطلق أول طلب. اقرأ معرّف نقطة النهاية من وحدة التحكم وتأكد من عودة التوكنات.

bash
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
  -H "Authorization: Bearer ${RUNPOD_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
      "max_tokens": 60
    }
  }'

إذا كنت تزن محرك الخدمة نفسه، فقد قارنّا بين vLLM وSGLang من حيث الإنتاجية وزمن الاستجابة.

كيف تستدعي نقطة النهاية من تطبيقك؟

كل منصة في القائمة المختصرة تتحدث API متوافقًا مع OpenAI. مقتطف Python واحد يعمل في كل مكان. وتبديل المزود هو تغيير base_url، لا إعادة كتابة. وهذا يعيد صياغة «أي مزود؟» من قرار ارتباط مصيري إلى قرار إعدادات.

python
import os

from openai import OpenAI

ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

client = OpenAI(
    base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    api_key=os.environ["RUNPOD_API_KEY"],
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B-FP8",
    messages=[{"role": "user", "content": "What is scale to zero?"}],
    max_tokens=120,
)
print(response.choices[0].message.content)
python
# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

PROVIDERS = {
    "runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    "modal": "https://your-app--your-func.modal.run/v1",
    "beam": "https://your-beam-endpoint/v1",
}

client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")

إذا كان كل مزود يتحدث لهجة OpenAI، فإن «أي مزود GPU بدون خادم» يتوقف عن كونه قرار بنية تحتية ويصبح سطرًا واحدًا في الإعدادات.

عندما تصبح لديك عدة نقاط نهاية، تغطي مقارنتنا لأدوات LLM gateway التوجيه والتعافي من الأعطال. ولإعداد أخف، يضيف بروكسي LiteLLM إعادة المحاولة والتسجيل.

ما البداية الباردة التي ستراها فعلًا؟

لنموذج 7B على GPU بدون خادم، توقع من 10 إلى 30 ثانية في البداية الباردة الحقيقية (إقلاع الحاوية زائد تحميل الأوزان زائد تهيئة المحرك)، استنادًا إلى تقارير الممارسين. وثائق المزودين تذكر 1 إلى 5 ثوانٍ لإقلاع الحاوية وحده. والفجوة بين الرقمين هي نقطة حفظك تعبر الشبكة.

صفحة منتج RunPod تدّعي بدايات باردة FlashBoot تحت 200 مللي ثانية (ادعاء مزود، لا قياس). وممارس في r/LLMDevs يذكر: «البدايات الباردة في خبرتي ليست رائعة... أقول نحو 10 - 30 ثانية»، مضيفًا «معظم خبرتي تدور حول نماذج الانتشار مع ذلك.» وكلاهما صحيح. إنهما يقيسان شيئين مختلفين.

رقم البداية الباردة هو ثلاثة أرقام مكدسة:

  1. إقلاع الحاوية. وثائق Modal: «تقلع الحاويات في نحو ثانية واحدة.» Cloud Run: النسخ ذات التعريفات المثبتة مسبقًا «تبدأ في نحو 5 ثوانٍ تقريبًا.»

  2. تحميل الأوزان. الجزء الذي لا يروج له أحد. مراجعة TU München لعام 2024 لمشروع ServerlessLLM ‏(arXiv 2411.15664) تضع LLaMA-2-70B عند أكثر من 26 ثانية للسحب زائد نحو 84 ثانية للتحميل على 8 بطاقات.

  3. تهيئة المحرك. التقاط الرسم البياني والإحماء في vLLM. قياس Logesh Umapathi لنموذج Qwen3.6-27B-FP8 على بطاقة A100-80GB أظهر انخفاضًا من خط أساس 460 ثانية إلى 219 ثانية مع الوضع الفوري، إلى نحو 70 ثانية مع وضع السبات في vLLM مع لقطات GPU من Modal. هذا تحسن 6.5 أضعاف، منشور في 17 مايو 2026.

المصدرما قيسالرقمالتاريخالنوع
وثائق Modalإقلاع الحاويةنحو ثانيةحاليوثيقة مزود
وثائق Cloud Runبدء النسخة (تعريفات مثبتة مسبقًا)نحو 5 ثوانٍحاليوثيقة مزود
Umapathi‏Qwen3.6-27B-FP8،‏ A100-80GB، بداية باردة كاملةمن 460 إلى 219 إلى نحو 70 ثانيةمايو 2026قياس مستقل
مراجعة TU München لـ ServerlessLLM ‏(arXiv 2411.15664)سحب + تحميل LLaMA-2-70B، أرقام مستشهد بها لا مقيسة26 ثانية سحب + 84 ثانية تحميل2024مسودة arXiv (مراجعة)
ممارس في r/LLMDevs‏7B على RunPod، طلب كاملنحو 10-30 ثانيةديسمبر 2024حكاية (مع تحفظ نماذج الانتشار)

تفسيرنا للبيانات المنشورة: أرقام المزودين تقيس الحاوية. وأرقام الممارسين تقيس الطلب كاملًا. وبين ساعة الإيقاف تلك وساعة الإيقاف هذه تجلس 80GB من الأوزان تعبر الشبكة. عمود «النوع» هو المقصود.

ما الذي تفعله: وضع السبات في vLLM، ولقطات GPU، وضبط نافذة التوسع هبوطًا. مهلة الخمول الافتراضية في Modal هي 60 ثانية (قابلة للضبط من ثانيتين إلى 20 دقيقة). العامل الدافئ يلغي البدايات الباردة لكنه يفوتر كعامل دائم التشغيل.

python
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
    gpu="A100",
    scaledown_window=60,  # seconds idle before shutdown
    # min_containers=1,   # uncomment to kill cold starts; costs $60/day
)

هل GPU بدون خادم أرخص من GPU دائم التشغيل؟

GPU بدون خادم أرخص عندما تكون بطاقتك خاملة معظم اليوم. عند 3,000 طلب يوميًا بمتوسط ثانيتين لكل طلب على بطاقة A100 80GB، يكلف النموذج بدون خادم نحو 4.17$ يوميًا مقابل 65.28$ يوميًا لبطاقة مستأجرة تعمل على مدار الساعة. نقطة التقاطع مسألة دورة تشغيل، لا مسألة حجم.

الافتراضات (افتراضاتنا، معلنة لتتمكن من إعادة تشغيلها):‏ A100 80GB بسعر Modal البالغ 2.50$ في الساعة، ومتوسط زمن GPU ثانيتان لكل طلب، وبطاقة مستأجرة بسعر RunPod البالغ 2.72$ في الساعة على مدار الساعة، وAPI توكنات مستضاف بسعر 0.40$ لكل مليون توكن (سعر منشور متوسط المدى)، ونحو 1,000 توكن لكل طلب.

الطلبات/يوميًابدون خادم (تقدير)بطاقة مستأجرة 24/7API توكنات مستضافالأرخص
5000.69$65.28$0.20$API التوكنات
3,0004.17$65.28$1.20$API التوكنات
10,00013.89$65.28$4.00$API التوكنات
50,00069.44$65.28$20.00$API التوكنات
200,000277.78$65.28$80.00$البطاقة المستأجرة

نقطة التقاطع تحط عند نحو 47,000 طلب يوميًا. تحت ذلك، يفوز النموذج بدون خادم. وAPI التوكنات المستضاف يهزم كليهما عند الحجم المنخفض بنموذج سلعي. نقطة التعادل ليست مسألة كم طلبًا تستقبل. إنها مسألة كم ساعة تقضيها بطاقتك بلا عمل.

تحليل BentoML من أغسطس 2024 يؤطر هذه المقايضة جيدًا، رغم أن أمثلة التسعير فيه من حقبة GPT-3.5-turbo وقد مر عليها عامان.

لمعرفة تكلفة API التوكنات المستضاف عند حجمك، راجع مقارنة أسعار LLM API. ولخفض تكلفة الطلب في جانب الاستدلال، يوفر تخزين الأوامر مؤقتًا عادة 30-60% عند تكرار السياق.

python
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50   # Modal A100 80GB
RENTED_RATE_HR = 2.72       # RunPod A100 80GB, 24/7

serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24

print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")

متى يكون GPU بدون خادم الخيار الخطأ

  • حركة مرتفعة مستدامة. فوق نحو 47,000 طلب يوميًا بهذه الأسعار، تنقلب دورة التشغيل وتصبح البطاقة المستأجرة أرخص لكل طلب.
  • التزامات صارمة تحت الثانية على مسار بارد. لا توجد حيلة لقطات تجعل أول طلب فوريًا. أبقِ عاملًا دافئًا أو استأجر الجهاز.
  • نماذج 70B+ التي تحتاج عدة بطاقات. بطاقة واحدة لكل نسخة على Cloud Run تنهي هذه المحادثة.
  • إقامة بيانات صارمة. ست مناطق L4 هي القائمة كاملة على Cloud Run.
  • اقتصاديات لكل طلب تخسر أمام خانة عامل تدفع لها أصلًا. إذا كان لديك هامش GPU فائض، فإن إضافة الاستدلال لا تكلف شيئًا إضافيًا.

إذا كانت بطاقتك مشغولة ست عشرة ساعة يوميًا، فالنموذج بدون خادم هو الخيار المكلف، ومن يقول لك غير ذلك يبيع لك حلولًا بدون خادم.

لمسار المحلية أولًا، راجع دليل أدوات تشغيل LLM محليًا.

عن الكاتب

Mert Batur شريك مؤسس في Techsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية وSDR لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج. تواصل معه على LinkedIn.

الأسئلة الشائعة

ما GPU بدون خادم؟

منصة GPU بدون خادم تشغّل حاوية نموذجك على عتاد مشترك، وتتصفّر بين الطلبات، وتفوتر فقط على الحساب النشط. تحصل على نقطة نهاية استدلال دون إدارة نسخة GPU دائمة. والمقايضة هي تأخير بداية باردة عند الإقلاع.

كم يكلف تشغيل نموذج LLM على GPU بدون خادم؟

بطاقة A100 80GB تعمل بسعر 2.25$ في الساعة على Beam، و2.50$ على Modal، و2.72$ على RunPod (موثق في 30 يوليو 2026). فاتورتك تعتمد على دورة التشغيل:‏ 3,000 طلب يوميًا بثانيتين لكل طلب تكلف نحو 4$ يوميًا على Modal. ويضيف التخزين 0.09$/GiB شهريًا مع إعفاء 1TiB.

هل أدفع مقابل تخزين أوزان النموذج؟

نعم، لكنه رخيص. تتقاضى Modal مبلغ 0.09$/GiB شهريًا مع إعفاء 1TiB شهريًا، لذا نقطة حفظ بحجم 80GB لا تكلف شيئًا. وصفحة تسعير RunPod تدرج التخزين الشبكي بسعر 0.07$/GB شهريًا تحت 1TB، أي نحو 5.60$ شهريًا للحجم نفسه البالغ 80GB.

هل يُعاد تنزيل نموذجي عند كل طلب؟

فقط إذا لم يكن أي شيء مخزنًا مؤقتًا. الأوزان على وحدة تخزين دائمة أو المدمجة في الصورة تنجو من البدايات الباردة. وجّه ذاكرة Hugging Face المؤقتة إلى تخزين عابر وسيُعاد تنزيل نموذج بحجم 130GB عند كل إقلاع. هذا هو نمط الفشل الذي يجب تجنبه.

كم تستغرق البداية الباردة لنموذج 7B؟

توقع 10-30 ثانية في البداية الباردة الحقيقية، وفق تقارير الممارسين (‏r/LLMDevs، ديسمبر 2024). الحاوية تقلع في 1-5 ثوانٍ (وثائق Modal وCloud Run). والباقي تحميل أوزان وتهيئة محرك. ومع اللقطات ووضع السبات، قاس Umapathi نحو 70 ثانية لنموذج 27B، نزولًا من 460 ثانية.

هل يمكنني تشغيل نموذج 70B على GPU بدون خادم؟

غالبًا لا. نموذج 70B بدقة FP16 يحتاج نحو 140GB من VRAM. ويسمح Cloud Run ببطاقة واحدة لكل نسخة (96GB كحد أقصى). ستحتاج تكميم FP8 لتتسع على بطاقة واحدة بسعة 80GB، أو منصة متعددة البطاقات. ومعظم أسطح النشر بدون خادم تقف عند بطاقة واحدة.

هل GPU بدون خادم أرخص من استئجار GPU على مدار الساعة؟

تحت نحو 47,000 طلب يوميًا (بثانيتين لكل طلب على A100 80GB)، نعم. النموذج بدون خادم يفوتر على الثواني النشطة فقط؛ والبطاقة المستأجرة تفوتر 24 ساعة بغض النظر. فوق ذلك، تفوز البطاقة المستأجرة. وAPI التوكنات المستضاف يهزم كليهما عند الحجم المنخفض. راجع جدول التعادل أعلاه.

هل يمكنني نشر نموذج LLM على GPU بدون خادم مجانًا؟

تمنح Modal رصيدًا مجانيًا بقيمة 30$ شهريًا (Starter). وتمنح Beam مبلغ 30$ شهريًا. ورصيد الحساب الجديد من GCP البالغ 300$ يغطي استخدام GPU على Cloud Run. ما يكفي للنماذج الأولية، لا لتشغيل حركة إنتاجية. ولا منصة تقدم باقة مجانية دائمة لاستدلال GPU.

ما مزودو GPU بدون خادم المتاحون في أوروبا؟

يخدم Cloud Run بطاقات L4 في europe-west1 (بلجيكا) وeurope-west4 (هولندا). وتوثق Modal اختيار مناطق الاتحاد الأوروبي ‏(eu-west وeu-north وeu-south) بأسعار تعادل 1.5-1.75 ضعف الأسعار الأساسية. وتسمي RunPod مراكز بيانات أوروبية منها EU-NL-1 وEU-FR-1. ثبّت المنطقة صراحةً؛ ولا واحدة منها تجعل الاتحاد الأوروبي افتراضيًا.

هل أحتاج Docker لنشر نموذج LLM على GPU بدون خادم؟

ليس دائمًا. تقدم RunPod قوالب عامل vLLM جاهزة تتجاوز Docker. وModal تبني الحاويات من تعريف صورة Python في الكود. وللتبعيات المخصصة ستكتب Dockerfile. ولخدمة vLLM القياسية، يعمل المسار الجاهز في دقائق.

الخلاصة

خمس منصات، وخمس وحدات فوترة، وجدول واحد موحد. القرار أبسط مما تجعله صفحات المزودين يبدو:

  • اختر بطاقتك بحسب VRAM، لا بحسب العلامة.
  • ضع أوزانك على وحدة تخزين، لا في الصورة، إلا إذا كنت لا تبدل النماذج أبدًا.
  • توقع بدايات باردة من 10-30 ثانية وخطط حولها.
  • تحت نحو 47,000 طلب يوميًا، يفوز التصفير من حيث التكلفة.
  • محرك الخدمة خلف نقطة النهاية قابل للتبديل؛ وbase_url سطر واحد.

لديك نقطة نهاية قابلة للاستدعاء. التالي: ما الذي يجلس أمامها عندما تحتاج توجيهًا وتعافيًا من الأعطال؟ مقارنتنا لأدوات LLM gateway تجيب عن ذلك. أو ناقش إعدادك معنا.

الوسوم

نشر-llm-gpu-بدون-خادمgpu-بدون-خادمvllmاستدلال-llmالبداية-الباردة

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 7, 2026

أنماط سير عمل وكلاء الذكاء الاصطناعي: 7 أنماط ومتى يتفوّق كلٌّ منها فعليًّا (2026)

سبعة أنماط لسير عمل وكلاء الذكاء الاصطناعي تتكرّر في كل تصنيفات المورّدين، لكن لا يوجد نمط واحد يفوز في كل الحالات. هذه المقالة ترتّبها استنادًا إلى بيانات معايير 2026 المنشورة من Google Research وAnthropic، مع عرض الحسابات، وكود Python قابل للتشغيل لكل شكل، وسلّم قرار لاختيار النمط المناسب.

13 دقيقة قراءة قراءة
اقرأ
ai-machine-learning
Aug 7, 2026

استراتيجيات تجزئة RAG: 7 طرق مرتّبة وفق بيانات الاسترجاع (2026)

التجزئة تقسّم مستنداتك قبل التضمين، ونقاط التقسيم تحدد ما تستطيع أداة الاسترجاع إيجاده وما تعجز عنه. رتّبنا 7 استراتيجيات لتجزئة RAG وفق معيار Chroma العام المكوّن من 472 استعلاماً، ثم ربطنا كلاً منها بنموذج التضمين الذي تستخدمه أصلاً.

قراءة 15 دقيقة قراءة
اقرأ
ai-machine-learning
Aug 6, 2026

أفضل إطار عمل RAG في 2026: LangChain مقابل LlamaIndex مقابل Haystack (ومتى لا تحتاج أيًّا منها)

‏LangChain 1.0 هو الخيار الافتراضي لمعظم الفرق، لكن الإجابة الصادقة لتطبيق أسئلة وأجوبة على مستودع وثائق واحد هي أنك قد لا تحتاج إلى إطار عمل إطلاقًا. قارنّا 8 طبقات تنسيق جنبًا إلى جنب، بالكود وبيانات مستودعات مؤرخة وميزانية لزمن الاستجابة.

14 دقيقة قراءة قراءة
اقرأ
عرض جميع المقالات
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.

احجز مكالمة استكشاف لمدة 30 دقيقةشاهد أعمالنا

الأحدث من المكتبة

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الأحدث من المكتبة

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا

قانوني

  • سياسة الخصوصية
  • شروط الخدمة
  • سياسة ملفات تعريف الارتباط

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا
قانونيسياسة الخصوصيةشروط الخدمةسياسة ملفات تعريف الارتباط
TECHSY
© 2026 Techsy. جميع الحقوق محفوظة.