ai-machine-learning

كيفية الضبط الدقيق لنماذج اللغة الكبيرة: الأساليب والأطر والكود خطوة بخطوة [2026]

بقلم Mert Batur
Mar 17, 2026
16 قراءة
كيفية الضبط الدقيق لنماذج اللغة الكبيرة: الأساليب والأطر والكود خطوة بخطوة [2026]

الضبط الدقيق لنموذج LLM يعني أخذ نموذج مدرَّب مسبقًا وتدريبه على بياناتك الخاصة لكي يؤدي مهمتك بشكل أفضل مما يمكن لأي أمر أن يحققه. لقد انهار الحاجز أمام الدخول: QLoRA + Unsloth تتيح الآن الضبط الدقيق لنموذج بـ8 مليارات معامل على وحدة GPU للمستهلكين بسعة 12 جيجابايت بتكلفة أقل من دولار واحد في التكاليف السحابية.

يغطي هذا الدليل الرحلة الكاملة -- متى تجري الضبط الدقيق (مقابل RAG أو هندسة الأوامر)، وأي منهج وإطار عمل تختار، وكيف تحضر مجموعة بياناتك، وعرض توضيحي لـ Llama 3 جاهز للنسخ واللصق، وسيناريوهات التكلفة الحقيقية، والنشر.

الضبط الدقيق في لمحة

قبل الالتزام بأي شيء، إليك الصورة السريعة:

الخاصيةالتفصيل
ما هوتدريب نموذج LLM مدرَّب مسبقًا على بيانات خاصة بمهمة لتحسين الأداء
متى يُستخدمعندما لا تكفي هندسة الأوامر وRAG لحالة الاستخدام الخاصة بك
الأسلوب الأكثر شيوعًاQLoRA (LoRA بتحويل كمي 4 بت) -- يتعامل مع 90% من الضبط الدقيق على GPU المستهلكين
الإطار الأسرع (2026)Unsloth (أسرع 2–5x، استهلاك أقل بنسبة 70% للـVRAM مقارنة بالتدريب القياسي)
الحد الأدنى من الأجهزةوحدة GPU بسعة 12 جيجابايت VRAM (RTX 3060) مع QLoRA
أرخص خيار سحابي~0.34 دولار/ساعة على RunPod (RTX 4090)
حجم مجموعة البيانات100–10,000 مثال (500+ موصى به للإنتاج)
وقت التدريب30 دقيقة – 8 ساعات حسب حجم النموذج ومجموعة البيانات
أفضل النماذج الأساسية (2026)Llama 3.x, Qwen 2.5, Mistral, Gemma 2, Phi-4
المخاطرة الرئيسيةالنسيان الكارثي (يفقد النموذج المعرفة العامة)
البديلRAG لاسترجاع المعرفة، هندسة الأوامر للمهام البسيطة

الآن لنعرف إذا كان الضبط الدقيق هو الخطوة الصحيحة لمشروعك.

متى يجب عليك الضبط الدقيق لنموذج LLM؟ (مقابل RAG مقابل هندسة الأوامر)

هذا هو السؤال الذي يتخطاه معظم المطورين -- وهو ما يكلفهم أسابيع من الجهد الضائع. الضبط الدقيق قوي، لكنه ليس دائمًا الأداة الصحيحة. إليك إطار عمل لاتخاذ القرار.

الأسلوبالأفضل عندماالقيودالتكلفة
هندسة الأوامريعمل التنسيق البسيط وتغييرات النبرة وأمثلة few-shotمحدود بنافذة السياق، غير متسق في المهام المعقدةمجاني (تكاليف API فقط)
RAGتحتاج للاستعلام عن معرفة خارجية أو متغيرة باستمرارتتفاوت جودة الاسترجاع، تضيف كمونمتوسط (تكاليف قاعدة البيانات المتجهة + التضمين)
الضبط الدقيقتحتاج سلوكًا متسقًا أو لغة خاصة بالمجال أو الامتثال للتنسيق الصارميتطلب بيانات تدريب، خطر النسيان الكارثيوقت GPU + تحضير مجموعة البيانات
هجين (RAG + ضبط دقيق)تحتاج سلوكًا متخصصًا ومعرفة خارجية معًاالأكثر تعقيدًا في البناء والصيانةمجمّع

يتمحور القرار حول ما تحاول تغييره. إليك سيناريوهات حقيقية:

السيناريوالأسلوب الموصى بهالسبب
روبوت دعم العملاء بمعرفة المنتجRAGالمعرفة تتغير باستمرار، الأوامر تدير الأسلوب
الترميز الطبي مع امتثال ICD-10ضبط دقيقمتطلبات تنسيق صارمة، مصطلحات خاصة بالمجال
مساعد المؤسسات ببيانات الشركة + أسلوب معينهجينيحتاج كلًا من الاسترجاع والسلوك المتسق
تنسيق موثوق لمخرجات JSONضبط دقيقأرخص وأكثر موثوقية من النضال مع الأوامر
روبوت محادثة يتحدث بأسلوب علامتك التجاريةضبط دقيقتغييرات السلوك والأسلوب تتطلب تحديثات الأوزان

إذا كنت تختار مجموعة أدوات الذكاء الاصطناعي المناسبة لـ SaaS، فإن هذا الإطار القراري هو الخطوة الأولى. كثير من الفرق تبني خطوط أنابيب RAG معقدة بينما يمكن لضبط دقيق بـ500 مثال أن يمنحها نتائج أكثر اتساقًا وكمونًا أقل.

الحكم: قم بالضبط الدقيق عندما تحتاج النموذج أن يتصرف بشكل مختلف باستمرار، لا فقط أن يعرف أشياء مختلفة. إذا كنت تحتاج فقط معرفة جديدة، فـRAG أرخص وأسهل في الصيانة. إذا كنت تحتاج كليهما، اذهب للهجين.

كيف يعمل الضبط الدقيق لنموذج LLM؟ الكامل مقابل LoRA مقابل QLoRA

هناك ثلاثة مناهج رئيسية تختلف اختلافًا جذريًا في متطلبات الأجهزة والتكلفة والجودة. فهم المقايضات يُنقذك من الإفراط في الاستثمار أو الأداء الضعيف.

الضبط الدقيق الكامل (عندما لا يكون الميزانية عائقًا)

الضبط الدقيق الكامل يُحدِّث كل معامل في النموذج. يعطي أفضل النتائج الممكنة لكنه يتطلب موارد هائلة -- ما يقارب 100+ جيجابايت VRAM لنموذج 7B (يجب تخزين النموذج وحالات المُحسِّن والتدرجات في وقت واحد). هذا يقع في نطاق مجموعات H100. ما لم تكن في مختبر ممول جيدًا، تخطَّ هذا الخيار.

LoRA: ثورة PEFT

LoRA (التكيف منخفض الرتبة) يجمّد النموذج الأساسي ويضيف مصفوفات صغيرة قابلة للتدريب تُسمى المحولات. بدلًا من تحديث مصفوفة الأوزان الضخمة W مباشرةً، يُفكك LoRA التحديث إلى مصفوفتين صغيرتين A وB حيث الرتبة r أصغر بكثير من أبعاد النموذج. النتيجة: تدرّب حوالي 1–2% من المعاملات الأصلية مع الاحتفاظ بـ98–99% من جودة الضبط الدقيق الكامل.

مكتبة peft من Hugging Face هي التطبيق القياسي. محولات LoRA عادةً 50–200 ميغابايت -- صغيرة جدًا مقارنة بالنموذج الكامل.

QLoRA: الضبط الدقيق للجميع

QLoRA يتجاوز LoRA خطوةً إضافية. يُحمِّل النموذج الأساسي بدقة 4 بت باستخدام نوع بيانات خاص يُسمى NormalFloat4 (NF4)، ثم يُطبّق محولات LoRA فوقه. يُقلص التحويل الكمي 4 بت استهلاك VRAM بنسبة ~25% إضافية مقارنة بـLoRA القياسي مع الحفاظ على جودة شبه متطابقة.

هذا ما يجعل الضبط الدقيق في متناول الجميع. نموذج 7B يحتاج 100+ جيجابايت للضبط الكامل يتسع في 12 جيجابايت مع QLoRA.

الأسلوبVRAM (نموذج 7B)الجودة مقابل الأساسيسرعة التدريبحجم المحولحالة الاستخدام
ضبط دقيق كامل100+ جيجابايتالأفضلالأبطأالنموذج الكامل (~14 جيجابايت)المؤسسات بمجموعات H100
LoRA~16 جيجابايت98–99% من الكاملأسرع 2x~50–200 ميغابايتالفرق بـA100/RTX 4090
QLoRA~12 جيجابايت97–99% من الكاملالأسرع (مع Unsloth)~50–200 ميغابايتالمطورون المستقلون، GPU المستهلكين

الحكم: لـ90% من المطورين، QLoRA هو الخيار الصحيح. فارق الجودة عن الضبط الكامل ضئيل لمعظم المهام، والوفر في الأجهزة هائل. ابدأ من هناك وتوسع فقط إذا طالبت مقاييس التقييم بذلك.

أي إطار ضبط دقيق يجب استخدامه في 2026؟

اختيار الإطار أكثر أهمية مما يدرك معظم الناس. الإطار الصحيح يوفر ساعات من الإعداد ويُسرِّع التدريب بشكل كبير. إليك مقارنة الخيارات الأربعة الرئيسية.

الإطارنجوم GitHubالسرعةالأفضل لـدعم النماذجمنحنى التعلم
Unsloth54K+أسرع 2–5xسرعة GPU واحدة، QLoRALlama, Mistral, Qwen, Gemma, Phiمنخفض
LLaMA-Factory68K+خط الأساسأوسع دعم للنماذج، واجهة ويب100+ نموذجمنخفض (GUI)
TRL (Hugging Face)18K+خط الأساسRLHF/DPO/GRPO، نظام HFجميع نماذج HFمتوسط
Axolotl11K+خط الأساسقابلية التكرار، GPU متعددةالنماذج الرئيسيةمرتفع (تكوين YAML)

إليك التوصية السريعة:

  • أول ضبط دقيق لك؟ استخدم Unsloth. أسرع تدريب، أسهل إعداد، دفاتر Colab مجانية للبدء فورًا.
  • تحتاج واجهة ويب بدون كود؟ استخدم LLaMA-Factory. واجهة LLaMA-Board تُتيح لك تكوين التدريب وبدءه من متصفح.
  • تقوم بمحاذاة (RLHF, DPO, GRPO)؟ استخدم TRL. هو المعيار في Hugging Face للتدريب القائم على التفضيلات، والإصدار v0.15.0 (مارس 2026) أضاف دعمًا أصليًا لـGRPO.
  • خطوط أنابيب إنتاج على GPU متعددة؟ استخدم Axolotl. التكوينات القائمة على YAML تجعل التجارب قابلة للتكرار والتدقيق.

حيلة مفيدة: يمكن الجمع بين Unsloth وLLaMA-Factory. تدعم LLaMA-Factory استخدام Unsloth كخلفية للتدريب مما يمنحك راحة الواجهة الرسومية مع تحسينات سرعة Unsloth.

كيف تُحضِّر مجموعة بيانات للضبط الدقيق؟

جودة البيانات هي العامل الأهم في نجاح الضبط الدقيق. مجموعة بيانات منسّقة جيدًا بـ500 مثال ستتفوق دائمًا تقريبًا على مجموعة ضوضائية بـ10,000 مثال.

تنسيقات مجموعة البيانات

التنسيقان السائدان هما المحادثة (متوافق مع OpenAI) والتعليمات (بأسلوب Alpaca). إليك شكل كل منهما بتنسيق JSONL:

تنسيق المحادثة (موصى به لمعظم حالات الاستخدام):

json
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "I ordered a laptop 3 days ago (order #4821) and it still says processing."}, {"role": "assistant", "content": "I can see order #4821 is currently in our warehouse being prepared for shipment. Laptops typically ship within 3-5 business days. You should receive a tracking number by tomorrow. Would you like me to flag this for priority processing?"}]}
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "Can I return my keyboard? Order #3019, bought it last week."}, {"role": "assistant", "content": "Absolutely! Order #3019 is within our 30-day return window. I'll email you a prepaid return label right now. Once we receive the keyboard, your refund will process within 2-3 business days."}]}
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "My monitor arrived cracked. Order #5573."}, {"role": "assistant", "content": "I'm sorry about that! For order #5573, I'm initiating an immediate replacement shipment -- no need to return the damaged unit. The new monitor will ship today with express delivery. You'll get a tracking email within the hour."}]}

تنسيق التعليمات (بأسلوب Alpaca):

json
{"instruction": "Summarize the following customer complaint in one sentence.", "input": "I've been waiting 2 weeks for my refund and nobody responds to my emails. This is the worst customer service I've ever experienced.", "output": "Customer is frustrated by a 2-week delay in receiving their refund and lack of email response from support."}
{"instruction": "Classify the sentiment of this review.", "input": "The product works fine but shipping took forever.", "output": "Mixed (positive product, negative shipping)"}

إرشادات حجم مجموعة البيانات

كم من البيانات تحتاج فعلًا؟ يعتمد ذلك على تعقيد المهمة:

  1. 50–100 مثال -- إثبات المفهوم، كافٍ لاختبار مدى فائدة الضبط الدقيق
  2. 500–1,000 مثال -- مفيد لمعظم المهام الفردية (التصنيف، الاستخراج، التنسيق)
  3. 5,000–10,000 مثال -- نتائج بجودة إنتاج للمهام المعقدة
  4. 10,000+ مثال -- عوائد متناقصة ما لم تكن مهمتك ذات تباين عالٍ جدًا

قائمة التحقق من جودة البيانات

قبل التدريب، تحقق من مجموعة بياناتك وفق هذه المعايير:. للمزيد من التفاصيل، راجع وكلاء الذكاء الاصطناعي للأعمال.

  • تنسيق متسق في جميع الأمثلة (نفس أمر النظام، نفس هيكل المخرجات)
  • أمثلة متنوعة تغطي الحالات الحدية وأنماط الفشل
  • لا تناقضات (لا تعلم النموذج قول "نعم" و"لا" لنفس نمط المدخلات)
  • توزيع متوازن لأنواع المخرجات (في التصنيف، لا تجعل 90% من الأمثلة في فئة واحدة)
  • احذف الإدخالات المكررة أو شبه المكررة

نصيحة احترافية: استخدم GPT-4 أو Claude لتوليد بيانات تدريب اصطناعية أولية، ثم صقّلها بمراجعة بشرية. غالبًا ما تتفوق 500 مثال اصطناعي عالي الجودة على 5,000 مثال حقيقي صاخب. يوصي دليل الضبط الدقيق من Meta بهذا النهج لتهيئة مجموعات البيانات.

خطوة بخطوة: الضبط الدقيق لـ Llama 3 8B بـ QLoRA وUnsloth

إليك العرض التوضيحي الكامل. كل كتلة كود جاهزة للنسخ واللصق -- يمكنك تشغيله في دفتر Google Colab مجاني أو على أي جهاز بسعة 12+ جيجابايت VRAM.

الخطوة 1: تثبيت Unsloth

bash
pip install unsloth

هذا كل شيء. يتعامل Unsloth مع جميع التبعيات (transformers, peft, trl, bitsandbytes) تلقائيًا.

الخطوة 2: تحميل النموذج الأساسي بـ4 بت

python
from unsloth import FastLanguageModel

# تحميل Llama 3.1 8B بتحويل كمي 4 بت
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/Meta-Llama-3.1-8B-bnb-4bit",
    max_seq_length=2048,
    load_in_4bit=True,
)

يقوم هذا بتنزيل النموذج المحوّل كميًا بـ4 بت (~4 جيجابايت) وتحميله في ذاكرة GPU. على RTX 3060 (12 جيجابايت) ستجد مساحة وفيرة للتدريب.

الخطوة 3: تكوين محولات LoRA

python
# إضافة محولات LoRA للنموذج
model = FastLanguageModel.get_peft_model(
    model,
    r=16,                # رتبة LoRA -- 16 هي النقطة المثالية لمعظم المهام
    target_modules=["q_proj", "k_proj", "v_proj", "o_proj",
                     "gate_proj", "up_proj", "down_proj"],
    lora_alpha=16,       # عامل التحجيم (عادةً يساوي r)
    lora_dropout=0,      # Unsloth مُحسَّن لـ dropout صفر
    bias="none",
)

مع r=16، تُدرِّب ما يقارب 40 مليون معامل من 8 مليارات -- أقل من 0.5% من النموذج. هذا هو سحر LoRA.

الخطوة 4: تحميل مجموعة بياناتك

python
from datasets import load_dataset

# تحميل مجموعة بيانات JSONL من Hugging Face Hub أو ملف محلي
dataset = load_dataset("json", data_files="train.jsonl", split="train")

# التنسيق وفق قالب المحادثة
def format_chat(example):
    text = tokenizer.apply_chat_template(
        example["messages"],
        tokenize=False,
        add_generation_prompt=False,
    )
    return {"text": text}

dataset = dataset.map(format_chat)

يأخذ هذا تنسيق محادثة JSONL من القسم السابق ويُطبّق قالب محادثة Llama 3. يتعامل المُرمِّز مع جميع الرموز الخاصة (<|begin_of_text|>, <|eot_id|>, إلخ).

الخطوة 5: تكوين التدريب وتشغيله

python
from trl import SFTTrainer
from transformers import TrainingArguments
from unsloth import is_bfloat16_supported

trainer = SFTTrainer(
    model=model,
    train_dataset=dataset,
    dataset_text_field="text",
    max_seq_length=2048,
    args=TrainingArguments(
        per_device_train_batch_size=2,
        gradient_accumulation_steps=4,    # حجم الدفعة الفعلي = 8
        warmup_steps=5,
        max_steps=60,                     # اضبطه حسب حجم مجموعة البيانات
        learning_rate=2e-4,               # قياسي لـ QLoRA
        fp16=not is_bfloat16_supported(),
        bf16=is_bfloat16_supported(),
        logging_steps=1,
        output_dir="outputs",
        seed=42,
    ),
)

# بدء التدريب
trainer.train()

المعاملات الفائقة الرئيسية لفهمها:

  • معدل التعلم (2e-4): المعيار لـQLoRA. اخفضه (2e-5) إذا رأيت النموذج ينسى القدرات العامة.
  • حجم الدفعة (2) × تراكم التدرج (4): حجم دفعة فعلي 8. زد gradient_accumulation إذا نفد ذاكرة GPU.
  • max_steps (60): لـ500 مثال، هذا ما يقارب دورة تدريب واحدة. ابدأ بـ1–3 دورات وراقب خسارة التحقق.
  • الرتبة r (16): أقل (4–8) للمهام البسيطة، أعلى (32–64) للمهام المعقدة. 16 قيمة افتراضية آمنة.

الخطوة 6: الحفظ والاختبار

python
# حفظ محولات LoRA (صغيرة -- ~50-200 ميغابايت)
model.save_pretrained("my-fine-tuned-model")
tokenizer.save_pretrained("my-fine-tuned-model")

# اختبار استنتاج سريع
FastLanguageModel.for_inference(model)
inputs = tokenizer(
    [tokenizer.apply_chat_template(
        [{"role": "user", "content": "I need to return order #7742"}],
        tokenize=False,
        add_generation_prompt=True,
    )],
    return_tensors="pt",
).to("cuda")

outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

هذا هو خط الأنابيب الكامل. على RTX 4090 مع Unsloth، يستغرق تدريب 500 مثال حوالي 15–30 دقيقة. على Colab T4 المجاني، توقع 1–2 ساعة.

ماذا عن الضبط الدقيق عبر API؟ (OpenAI, Google, Mistral)

ليس الجميع يريد إدارة وحدات GPU. مزودو API يتيحون الضبط الدقيق عبر سير عمل بسيط للرفع والتدريب. إليك كيف يقارنون بتشغيله بنفسك.

المزودالنماذجالحد الأدنى للأمثلةالتكلفة (1,000 مثال)تنزيل الأوزان؟خصوصية البيانات
OpenAIGPT-4o, GPT-4o-mini10~3–25 دولارلاقد تُستخدم البيانات للتدريب
Google Vertex AIGemma, Gemini100~5–30 دولارGemma فقطيتحكم فيها GCP
Mistral (La Plateforme)نماذج Mistral100~4–20 دولارلاإقامة بيانات في الاتحاد الأوروبي
Together AIنماذج مفتوحة (Llama, إلخ)50~2–15 دولارنعم (النماذج المفتوحة)البيانات لا تُحفظ
محلي (Unsloth/LLaMA-Factory)أي نموذج مفتوح1تكلفة GPU فقط ($0–27)نعم (تملك كل شيء)خصوصية كاملة

متى يكون الضبط الدقيق عبر API منطقيًا: تحتاج للتكرار السريع، مجموعة بياناتك صغيرة، لا تريد إدارة البنية التحتية، أو تحتاج تحديدًا نموذجًا مغلقًا مثل GPT-4o.

متى يفوز الضبط الدقيق المحلي: خصوصية البيانات مهمة (الرعاية الصحية، المالية، القانونية)، تدرّب بشكل متكرر، تريد امتلاك الأوزان وتصديرها، أو تُحسِّن التكلفة على نطاق واسع.

الحكم: الضبط الدقيق عبر API هو أسرع طريق لإثبات المفهوم. الضبط الدقيق المحلي هو أرخص طريق للإنتاج. معظم الفرق تبني نماذج أولية على API، ثم تنتقل لـUnsloth المحلي بعد التحقق من النهج.

كم تكلفة الضبط الدقيق لنموذج LLM؟

رواية "الضبط الدقيق مكلف" عالقة في عام 2023. إليك ما يكلفه فعلًا اليوم.

السيناريوالنموذجالأسلوبGPUوقت التدريبالتكلفة الإجمالية
هواية / تعلمLlama 3 8BQLoRARTX 3060 خاص (12 جيجابايت)2–4 ساعات$0 (كهرباء)
سحابة مجانيةLlama 3 8BQLoRAGoogle Colab T4 (مجاني)3–5 ساعات$0
ناشئةLlama 3 8BQLoRA + UnslothRunPod RTX 4090 (0.34 $/ساعة)1–2 ساعة$0.35–0.70
إنتاجLlama 3 70BQLoRARunPod A100 80GB (3.39 $/ساعة)5–8 ساعات$17–27
مؤسساتLlama 3 70Bضبط دقيق كامل4x H100 (13.56 $/ساعة)20–40 ساعة$270–540
API (بدون GPU)GPT-4o-miniOpenAI APIلا يوجد~30 دقيقة$3–25

منحنى التكلفة يتسطح بسرعة. شركة ناشئة تضبط نموذج 8B على RunPod تنفق على التدريب أقل مما تنفقه على فنجان قهوة. حتى سيناريو الإنتاج بـ70B لا يتجاوز $30 -- هذا ميزانية غداء مطور مبتدئ لشهر.

مزودو GPU السحابي للمقارنة: RunPod (أفضل أسعار spot)، Lambda (H100 موثوق عند الطلب)، Vast.ai (الأرخص لكن جودة متفاوتة)، وModal (بدون خادم، دفع بالثانية).

"متطلبات VRAM حسب حجم النموذج والأسلوب"

"تُخفض QLoRA احتياج VRAM من 100 جيجابايت إلى 12 جيجابايت لنماذج 7B، ومن 560 جيجابايت إلى 48 جيجابايت لنماذج 70B -- مما يجعل GPU المستهلكين مجديًا للضبط الدقيق."
جدول البيانات
"متطلبات VRAM حسب حجم النموذج والأسلوب"
"حجم النموذج""ضبط دقيق كامل""LoRA""QLoRA"
"7B"1001612
"13B"2003224
"70B"5608048

يوضح الرسم البياني أعلاه لماذا غيّرت QLoRA قواعد اللعبة. نموذج 7B كان يحتاج مجموعة GPU متعددة للضبط الكامل يتسع الآن في GPU الكمبيوتر المحمول. نموذج 70B انتقل من "السحابة فقط" إلى A100 واحدة.

الحكم: يمكنك الضبط الدقيق لنموذج 8B بجودة إنتاج بأقل من دولار واحد. حاجز تكلفة الضبط الدقيق قد اختفى. التكلفة الحقيقية هي وقت تحضير مجموعة البيانات.

كيف تُقيِّم نموذجًا مضبوطًا دقيقًا؟

التدريب نصف العمل فقط. بدون تقييم مناسب، لا يمكنك معرفة ما إذا كان النموذج المضبوط قد تحسن فعلًا -- أم أنه حفظ بيانات التدريب عن ظهر قلب.

المقاييس الآلية

تتبّع هذه المقاييس أثناء التدريب وبعده:

  • خسارة التدريب / الحيرة: يجب أن تنخفض بثبات ثم تستقر. إذا اقتربت من الصفر فأنت تفرط في التخصيص.
  • المقاييس الخاصة بالمهمة: الدقة (التصنيف)، BLEU/ROUGE (التلخيص)، التطابق التام (الاستخراج)، F1 (متعدد التصنيفات). اختر المقياس الذي يتوافق مع مهمتك. قد يهمك أيضاً أفضل أدوات ضبط نماذج اللغة الكبيرة.

التقييم البشري

الأرقام لا تلتقط كل شيء. للمهام التوليدية:

  • اختبار A/B: اعرض مخرجات النموذج الأساسي والمضبوط جنبًا إلى جنب. اطلب من 3–5 مُقيِّمين اختيار الإجابة الأفضل من 50+ مثال. تتبّع معدل الفوز.
  • تقييم مقياس ليكرت: قيِّم المخرجات على الملاءمة (1–5) والدقة (1–5) والأسلوب (1–5). احسب متوسط التحسين عن النموذج الأساسي.

فحص النسيان الكارثي

هذا ما يتخطاه معظم المطورين. بعد الضبط الدقيق، شغِّل نموذجك على معيار عام مثل MMLU أو HellaSwag. إذا انخفضت الدرجات أكثر من 2–3 نقاط، فقد النموذج قدرًا كبيرًا من المعرفة العامة. الحل: اخفض معدل التعلم، قلّل الدورات، أو انتقل لـLoRA (الذي يجمّد أوزان النموذج الأساسي).

قاعدة عملية: احتفظ دائمًا بـ10–20% من مجموعة البيانات كمجموعة اختبار. لا تقيِّم أبدًا على بيانات التدريب -- هذا لا يخبرك شيئًا عن الأداء الحقيقي.

كيف تنشر نموذجًا مضبوطًا دقيقًا؟

انتهى التدريب. الآن تحتاج لتقديمه. معظم الأدلة تتخطى هذا الجزء كليًا.

الخطوة 1: دمج محولات LoRA

إذا استخدمت LoRA أو QLoRA، ادمج المحولات في النموذج الأساسي للاستنتاج:

python
# دمج المحولات في النموذج الأساسي
model.merge_and_unload()
model.save_pretrained("merged-model")
tokenizer.save_pretrained("merged-model")

الخطوة 2: اختر مسار النشر

التطوير المحلي والاختبار -- Ollama:

bash
# التحويل إلى تنسيق GGUF (التنسيق الأصلي لـ Ollama)
python llama.cpp/convert_hf_to_gguf.py merged-model --outfile model.gguf --outtype q4_k_m

# إنشاء نموذج Ollama
ollama create my-fine-tuned-model -f Modelfile
ollama run my-fine-tuned-model

التقديم في الإنتاج -- vLLM:

bash
# بدء خادم API متوافق مع OpenAI
python -m vllm.entrypoints.openai.api_server \
    --model merged-model \
    --host 0.0.0.0 \
    --port 8000

بدون خادم (بنية تحتية صفرية): ارفع نموذجك إلى Together AI أو Fireworks أو Modal. ستحصل على نقطة نهاية API دون إدارة خوادم. التكلفة تتناسب مع الاستخدام.

متقدم: تقديم متعدد المحولات

إليك نمطًا يجب أن تستخدمه المزيد من الفرق: إبقاء نموذج أساسي واحد محملًا في الذاكرة وتبديل محولات LoRA لكل طلب. يمكنك تقديم محول دعم العملاء ومحول مراجعة الكود ومحول التلخيص -- كل ذلك من GPU واحدة. يدعم vLLM هذا بشكل أصلي مع العلامة --enable-lora.

ما هي أكثر أخطاء الضبط الدقيق شيوعًا؟

بعد مساعدة الفرق في تصحيح عشرات من جولات الضبط الدقيق، هذه هي الأخطاء التي تظهر مرارًا وتكرارًا.

1. الإفراط في التخصيص على مجموعات بيانات صغيرة. تدرّب 10 دورات على 200 مثال، تصل خسارة التدريب إلى قرب الصفر، والنموذج يردد بياناتك الحرفية. الحل: 1–3 دورات كحد أقصى، استخدم مجموعة التحقق، وراقب الفجوة بين خسارة التدريب وخسارة التقييم.

2. النسيان الكارثي. النموذج يتقن مهمتك المحددة لكنه لم يعد قادرًا على المحادثة الأساسية. الحل: استخدم LoRA/QLoRA (يجمّد الأوزان الأساسية)، أبقِ معدلات التعلم منخفضة (2e-5 للضبط الكامل، 2e-4 لـQLoRA)، وقيِّم على معايير عامة قبل النشر.

3. رداءة جودة البيانات. تنسيق غير متسق، تناقضات بين الأمثلة، أو مكررات. النموذج يتعلم الضوضاء. الحل: نظّف بياناتك قبل التدريب. دائمًا. أمضِ وقتًا أطول في تنظيم البيانات من ضبط المعاملات الفائقة.

4. البدء بنموذج كبير جدًا. الفرق تقفز إلى 70B لأن "الأكبر أفضل"، ثم لا تستطيع تحمل تكاليف GPU. الحل: ابدأ بـ8B. إذا كان 8B مع بيانات جيدة لا يستطيع حل مهمتك، فـ70B مع نفس البيانات على الأرجح لن يستطيع. طوِّر جودة البيانات أولًا، ثم حجم النموذج.

5. لا توجد خط أنابيب تقييم. تدريب بدون مجموعة اختبار محجوزة، ثم نشر مبني على الحدس. الحل: قسّم بياناتك 80/10/10 (تدريب/تحقق/اختبار) قبل البدء. قارن مع النموذج الأساسي على كل مثال اختبار.

6. معدل تعلم مرتفع جدًا. يدمر المعرفة المدرَّبة مسبقًا في الخطوات الأولى. النموذج يُخرج هراءً. الحل: ابدأ عند 2e-4 لـQLoRA، و2e-5 للضبط الكامل. إذا تدهورت المخرجات، اخفض أكثر.

كيف تتعامل Techsy مع الضبط الدقيق للنماذج اللغوية الكبيرة

في Techsy، نتبع مسار تصعيدًا صارمًا لكل مشروع ذكاء اصطناعي: هندسة الأوامر أولًا، ثم RAG، والضبط الدقيق فقط عندما تُثبت البيانات ضرورته. معظم مشاريع العملاء لا تتطلب الضبط الدقيق فعلًا -- الأوامر المصاغة جيدًا أو خط أنابيب RAG يحلان المشكلة بتكلفة وتعقيد أقل.

عندما يكون الضبط الدقيق هو الخيار الصحيح، إليك عمليتنا:. تعرف أيضاً على دليل تقييم نماذج اللغة الكبيرة.

  1. مراجعة مجموعة البيانات -- نراجع بيانات العميل للجودة والتغطية والتنسيق. إذا لم يكن لدينا أمثلة كافية، نساعد في بناء مجموعة بيانات اصطناعية باستخدام GPT-4 أو Claude مع مراجعة بشرية.
  2. اختيار الإطار -- Unsloth + QLoRA لـ90% من مشاريع الشركات الناشئة. Axolotl للعملاء الذين يحتاجون خطوط أنابيب إنتاج قابلة للتكرار على GPU متعددة.
  3. التدريب والتقييم -- ندرّب دائمًا بمجموعة اختبار محجوزة ونقارن بالنموذج الأساسي. إذا لم يُحسِّن النموذج المضبوط مقياس الهدف بشكل قابل للقياس، لا ننشره.
  4. النشر -- vLLM للتقديم الإنتاجي، أنماط متعددة المحولات عندما يحتاج العملاء نماذج متخصصة متعددة من GPU واحدة.

قدّمنا نماذج مضبوطة لشركات ناشئة لا تستطيع تحمل ميزانيات GPU المؤسسية -- QLoRA على RunPod يبقي التكاليف دون $30 حتى لنماذج 70B.

هل تحتاج مساعدة في الضبط الدقيق لنموذج LLM لحالة استخدامك؟ نساعد الفرق للانتقال من البيانات الخام إلى النموذج المنشور. احصل على استشارة مجانية

الأسئلة الشائعة حول الضبط الدقيق لنماذج اللغة الكبيرة

ما هو الضبط الدقيق لنماذج اللغة الكبيرة؟

الضبط الدقيق لنماذج LLM هو عملية تدريب نموذج لغوي مدرَّب مسبقًا على بياناتك الخاصة الخاصة بمهمة معينة لكي يؤدي تلك المهمة بشكل أفضل. أنت في الأساس تعلّم النموذج سلوكيات وتنسيقات وخبرات مجالية جديدة لا تستطيع هندسة الأوامر العامة تحقيقها بشكل موثوق.

متى يجب الضبط الدقيق بدلًا من استخدام RAG؟

اضبط دقيقًا عندما تحتاج النموذج أن يتصرف بشكل مختلف -- تنسيق مخرجات متسق، لغة خاصة بالمجال، أسلوب معين. استخدم RAG عندما يحتاج النموذج معرفة أشياء مختلفة، خاصةً إذا كانت تلك المعرفة تتغير كثيرًا. لكثير من أنظمة الإنتاج، يعمل النهج الهجين بشكل أفضل.

كم تكلفة الضبط الدقيق لنموذج LLM؟

من $0 إلى $540 حسب الحجم. معظم المطورين الأفراد ينفقون أقل من دولار واحد باستخدام QLoRA على RunPod RTX 4090 (0.34 $/ساعة). نموذج إنتاج 70B على A100 يكلف $17–27. الضبط الكامل على مجموعات H100 يكلف $270–540. الضبط عبر API (OpenAI) يكلف $3–25 لـ1,000 مثال.

هل يمكنني الضبط الدقيق لنموذج LLM على جهازي المحمول؟

نعم، إذا كان جهازك المحمول يحتوي على GPU بسعة 12+ جيجابايت VRAM. يتعامل RTX 3060 للكمبيوتر المحمول مع نماذج 8B مع QLoRA. يمكن لأجهزة Mac بشريحة Apple Silicon بذاكرة موحدة 16+ جيجابايت أيضًا الضبط الدقيق عبر MLX، وإن كان أبطأ من CUDA. للنماذج الأكبر ستحتاج GPU سحابية.

ما الفرق بين LoRA وQLoRA؟

كلاهما يضيف طبقات محولات صغيرة قابلة للتدريب مع تجميد النموذج الأساسي. الفرق: QLoRA تُحوِّل كميًا النموذج الأساسي أيضًا إلى دقة 4 بت (نوع بيانات NF4)، مما يُقلص استهلاك VRAM بـ~25% مقارنة بـLoRA القياسي. الجودة شبه متطابقة -- QLoRA تحقق 97–99% من جودة الضبط الكامل.

كم عدد أمثلة التدريب التي أحتاجها؟

يعتمد على تعقيد المهمة. 50–100 مثال كافية لإثبات المفهوم. 500–1,000 مثال تُنتج نتائج مفيدة لمعظم المهام الفردية. 5,000–10,000 مثال تُقدم جودة إنتاج للمهام المعقدة. فوق 10,000 تصل لعوائد متناقصة ما لم تكن مهمتك ذات تباين عالٍ جدًا.

أي نموذج أساسي يجب الضبط الدقيق له في 2026؟

Llama 3.x للمهام العامة (أفضل نسبة جودة/حجم). Mistral للغات الأوروبية والاستنتاج الكفء. Qwen 2.5 للمهام متعددة اللغات والكود. Phi-4 عندما تحتاج أصغر بصمة ممكنة. Gemma 2 للتكامل مع نظام Google.

ما هو GRPO ولماذا يهم؟

GRPO (Group Relative Policy Optimization)، الذي قدّمه DeepSeek، هو خلف لـRLHF لتدريب المحاذاة. الميزة الرئيسية: لا يتطلب تدريب نموذج مكافأة منفصل، مما يخفض التكلفة الحسابية بالنصف تقريبًا. يدعم TRL v0.15.0 GRPO بشكل أصلي مما يجعله في متناول أي شخص يستخدم نظام Hugging Face.

كيف أمنع النسيان الكارثي؟

استخدم LoRA أو QLoRA بدلًا من الضبط الكامل -- إنها تجمّد أوزان النموذج الأساسي مما يحفظ المعرفة العامة. أبقِ معدل التعلم منخفضًا (2e-4 لـQLoRA، 2e-5 للكامل). دَرِّب لأقل عدد ممكن من الدورات (1–3 كافية عادةً). بعد التدريب، شغِّل نموذجك على معايير عامة (MMLU, HellaSwag) للتحقق من عدم التراجع.

هل يمكنني الجمع بين الضبط الدقيق وRAG؟

بالتأكيد، والعديد من أنظمة الإنتاج تفعل ذلك تمامًا. اضبط دقيقًا لاتساق السلوك والتنسيق، ثم اربط RAG لاسترجاع المعرفة المحدَّثة. النموذج المضبوط أفضل في استخدام السياق المسترجع لأنه يفهم لغة مجالك ومتطلبات المخرجات.

كم يستغرق الضبط الدقيق؟

لمعظم المشاريع، من 30 دقيقة إلى 8 ساعات. نموذج 8B بـ500 مثال على Unsloth + RTX 4090 ينتهي في 15–30 دقيقة. نفس العمل على Colab T4 المجاني يستغرق 1–2 ساعة. نماذج 70B على A100 تستغرق 5–8 ساعات. الضبط الكامل على إعدادات GPU متعددة قد يستغرق 20–40 ساعة.

هل API الضبط الدقيق من OpenAI يستحق العناء؟

للنمذجة الأولية السريعة، نعم. يمكنك رفع ملف JSONL والحصول على GPT-4o-mini مضبوط دقيقًا في 30 دقيقة بدون إعداد GPU. للإنتاج، الضبط المحلي عادةً أفضل: تملك الأوزان، تتحكم في خصوصية بياناتك، والتكاليف أقل على نطاق واسع. معظم الفرق تبدأ بالـAPI للتحقق من النهج ثم تنتقل للمحلي.

الخلاصة

الضبط الدقيق لنموذج LLM لم يعد السحر الأسود الذي كان عليه قبل عامين. إليك أهم الاستنتاجات:

  1. ابدأ بـQLoRA + Unsloth -- يغطي 90% من حالات الاستخدام على أجهزة المستهلكين
  2. البيانات الجيدة تتفوق على نموذج أكبر في كل مرة. استثمر جهدك في جودة مجموعة البيانات، لا في ترقيات GPU.
  3. حاجز التكلفة اختفى -- اضبط دقيقًا نموذج 8B بأقل من دولار على GPU السحابية
  4. قيِّم دائمًا مقابل النموذج الأساسي قبل النشر. إذا لم يكن أفضل بشكل قابل للقياس، لا تنشره.
  5. فكّر في RAG أولًا -- اضبط دقيقًا فقط عندما تحتاج النموذج أن يتصرف بشكل مختلف، لا فقط أن يعرف أشياء مختلفة

جاهز للتطبيق؟ انظر أفضل أدوات ومنصات الضبط الدقيق للنماذج [قريبًا] لمقارنة تفصيلية لأطر التدريب وخيارات النشر.

إذا وجدت هذا الدليل مفيدًا، اطلع على دليلنا حول اختيار المجموعة المناسبة من أدوات الذكاء الاصطناعي لقرارات الهندسة المعمارية الأشمل حول المنتجات المدعومة بالذكاء الاصطناعي.

المصادر

الوسوم

كيفية ضبط نماذج llmLoRAQLoRAUnslothدليل ضبط نماذج اللغةضبط نماذج اللغة الكبيرةPEFT

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 29, 2026

أفضل وكلاء الذكاء الاصطناعي لخدمة العملاء: 8 أدوات مصنفة حسب التسليم لا الضجيج

ثمانية وكلاء ذكاء اصطناعي لخدمة العملاء مصنفون حسب جودة التسليم، وحسب ما إذا كان الروبوت يستشهد بمقال المصدر. أسعار حية سُحبت في 17 أغسطس 2026 من الصفحات الرسمية، وتشمل Intercom Fin وZendesk AI وChatbase وWeav وWatermelon وHeyy وAda وChipp.

8 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Aug 22, 2026

أفضل منشئي المواقع بالذكاء الاصطناعي: قارنا 8 وننشر 2

خطة Framer Basic بسعر 10$/شهر هي الخيار الافتراضي لموقع وكالة من صفحة واحدة بين أفضل منشئي المواقع بالذكاء الاصطناعي التي قيّمناها في 17 أغسطس 2026. وDurable أسرع وصولًا إلى رابط منشور. أما Webflow فهي الوجهة عندما تكون الحاجة تحكمًا بمستوى Designer.

8 دقائق قراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.