
RAG أم الضبط الدقيق: متى تستخدم كلا منهما (بأرقام حقيقية)
معظم نصائح RAG مقابل الضبط الدقيق تتجاوز التجربة الوحيدة التي قاست كلا النهجين على المهمة نفسها. Balaguer et al. في arXiv:2401.08406 (استُشهد بها 162 مرة) مرّروا مجموعة أسئلة وأجوبة زراعية عبر كلا النهجين: الضبط الدقيق حقق أكثر من 6 نقاط دقة إضافية، وRAG أضاف فوقها 5 نقاط أخرى. الجدول 18 لديهم يضع GPT-4 عند 75% خاماً، و81% بعد الضبط الدقيق، و86% بعد الضبط الدقيق مع الاسترجاع. فلماذا ما زلنا ننصح معظم الفرق بالبدء بـ RAG؟ لأن الحداثة والاستشهادات وحسابات التكلفة أدناه تحسم مشاريع أكثر مما يحسمه فارق نقطة دقة واحدة.
أبرز النقاط
- RAG هو الخيار الافتراضي حين تتغير المعرفة كثيراً أو حين يجب أن تستشهد الإجابات بمصادرها؛ والضبط الدقيق يفوز عند الحاجة إلى تنسيق مخرجات ثابت وزمن استجابة منخفض.
- تكاليف الضبط الدقيق تُدفع مقدماً (التدريب)؛ وتكاليف RAG تُدفع لكل استعلام (التضمينات إضافة إلى رموز إدخال إضافية).
- الأدلة المنشورة على المهمة نفسها: الضبط الدقيق أضاف 6 نقاط دقة، وRAG أضاف 5 نقاط أخرى فوقها، والنهج الهجين تفوق على كلا النهجين بمفرده.
- أجرِ الفحوص الخمسة (حداثة البيانات، الأمثلة الموسومة، زمن الاستجابة، الاستشهادات، مهارة الفريق) قبل كتابة أي سطر كود تدريبي.
متى يجب أن تستخدم RAG مقابل الضبط الدقيق؟ (الحكم السريع)
اختر RAG إن كانت معرفتك تتغير كثيراً أو إن كان على إجاباتك أن تحمل استشهادات. واختر الضبط الدقيق إن كنت تحتاج تنسيق مخرجات ثابتاً وزمن استجابة منخفضاً، وتملك أمثلة موسومة بالمئات. استخدم كلا منهما حين ينضج النشر. RAG يحرّر السياق الذي يقرؤه النموذج؛ والضبط الدقيق يحرّر النموذج نفسه. معظم الفرق تحتاج الأول، لا الثاني.
سطر واحد يستحق الحفظ: RAG يغيّر ما يقرؤه النموذج؛ والضبط الدقيق يغيّر ما هو النموذج. اختر بناءً على ما تحتاجه مهمتك فعلياً.
| النهج | استخدمه عندما | تجنّبه عندما | التكلفة المقدمة | التكلفة لكل استعلام | احتكاك التحديث |
|---|---|---|---|---|---|
| هندسة البرومبتات | السلوك قريب مما تريد والمعرفة عامة | الإجابات تحتاج بيانات خاصة أو حديثة | ساعات من التكرار | لا شيء عدا الرموز | عدّل البرومبت وأعد النشر |
| RAG | الحقائق تتغير والاستشهادات مهمة والبيانات تبقى خاصة | مطلوب زمن استجابة أقل من 100 مللي ثانية | منخفضة: بناء الفهرس | التضمينات إضافة إلى رموز إدخال إضافية | إعادة الفهرسة دون إعادة تدريب |
| الضبط الدقيق | تنسيق أو نبرة أو ميزانية زمن استجابة ثابتة؛ مع وجود أمثلة موسومة | المعرفة تنحرف أسبوعياً | متوسطة إلى عالية: تجهيز البيانات إضافة إلى التدريب | غالباً سعر رموز أعلى | إعادة تدريب كاملة مع كل انحراف |
| الهجين (كلاهما) | منتج ناضج: تحكم في التنسيق إضافة إلى حقائق حديثة | مرحلة النموذج الأولي والميزانية غير واضحة بعد | كلاهما معاً | كلاهما معاً | نظامان تجب صيانتهما |
مسرد NVIDIA لمفهوم RAG يعرّف جانب الاسترجاع بوضوح إن كنت تريد النسخة التعليمية. لكن التعريفات لا تختار معماريتك. الأدلة هي التي تختار، فابدأ منها.
ماذا تُظهر الأدلة؟ مهمة واحدة، نهجان، وقياس فعلي
المقارنة المقاسة الوحيدة على المهمة نفسها والموجودة ضمن أول خمس نتائج في Google لهذا الاستعلام هي Balaguer et al. 2024، وهي دراسة من Microsoft Research استُشهد بها 162 مرة. شغّل الفريق مهمة أسئلة وأجوبة زراعية واحدة عبر مسار RAG، ونموذج مضبوط بدقة، ونهج هجين يجمع بينهما، ثم ترك GPT-4 يقيّم الإجابات. في إعدادهم، الضبط الدقيق وحده تفوق بفارق ضئيل على RAG وحده، ودمج النهجين تفوق على أي منهما بمفرده بفارق أوسع.
دراسة الحالة الزراعية (arXiv:2401.08406)
الدراسة، التي قدمتها Angels Balaguer مع 15 مؤلفاً مشاركاً في يناير 2024، تسأل ما الذي يلزم لمنح المزارعين رؤى خاصة بمواقعهم. مسارهم يستخرج المعلومات من ملفات PDF، ويولّد منها أزواج أسئلة وأجوبة، ويقيّم Llama2-13B وGPT-3.5 وGPT-4 مع الاسترجاع وبدونه.
يبلّغ Balaguer et al. عن زيادة في الدقة تتجاوز 6 نقاط مئوية من الضبط الدقيق، وهي تراكمية مع RAG الذي أضاف 5 نقاط أخرى فوقها. المسار الهجين تفوق على أي نهج بمفرده. الجدول 18 لديهم يُظهر الترتيب بالنسبة لـ GPT-4: 75% دون مساعدة، و80% مع RAG، و81% بعد الضبط الدقيق، و86% بعد الضبط الدقيق مع RAG. لاحظ مدى تقارب 80% و81%؛ الفارق بين RAG وحده والضبط الدقيق وحده نقطة واحدة، بينما الهجين يتقدم على كليهما بخمس نقاط كاملة. في إحدى التجارب، استعان النموذج المضبوط بدقة بمعرفة من مناطق جغرافية أخرى للإجابة عن أسئلة خاصة بمنطقة محددة، فرفع تشابه الإجابات من 47% إلى 72%.
الأدلة الاقتصادية
دراسة Snorkel AI المنشورة (نوفمبر 2022) تغطي جانب التكلفة. على معيار تصنيف قانوني من 100 فئة (LEDGAR، 80,000 بند عقود)، عادل نموذج RoBERTa مضبوط بدقة نموذج GPT-3 مضبوط بدقة، مع كونه أصغر 1,400 مرة، واستخدامه أقل من 1% من التسميات المرجعية، وتشغيله بـ 0.1% من تكلفة الاستدلال الإنتاجي لنموذج GPT-3 المضبوط بدقة، أي نحو جزء من ألف. إجمالي البناء: $1,915 بالوسم البرمجي مقابل $7,418 للتعليق اليدوي مع ضبط GPT-3 بدقة. تحفظ واحد: هذا تصنيف، لا أسئلة وأجوبة توليدية، لذا عامل النسب كتقديرات اتجاهية.
قراءتنا
تفسيرنا: إعدادهم هو أفضل حالة يمكن أن يحصل عليها الضبط الدقيق إطلاقاً، ومع ذلك لم يفز إلا بنقطة واحدة. درّب Balaguer et al. على مجموعة نصوص PDF ثابتة وقيّموا على المجموعة المجمدة نفسها، فلم تتح للأوزان فرصة لتقادم ما تعلمته أثناء التجربة. معظم قواعد المعرفة الإنتاجية لا تبقى ساكنة هكذا. روبوت دعم يجيب عن أسئلة حول إصدار الأسبوع الماضي يستعيد النقاط الست في كل دورة إعادة تدريب، بينما الفهرس الذي يغذي RAG يتحدّث في بعد ظهر اليوم نفسه. لهذا نقرأ تفوق نقطة دقة واحدة على أنه أضعف مدخل في هذا القرار، والحداثة على أنها أقواها. أما حيث لا يمكن تعميم الأدلة: نتيجة Snorkel معيار تصنيف، ولا دراسة منهما تختبر التحكم في النبرة أو التنسيق، الذي يبقى أقوى حجة للضبط الدقيق.
| RAG | الضبط الدقيق | الهجين | |
|---|---|---|---|
| دقة المهمة (Balaguer et al.، مع العزو) | +5 نقاط مئوية، تراكمية فوق الضبط الدقيق (لا مستقلة عن خط الأساس) | +6 نقاط مئوية فوق خط الأساس | الأفضل بين الثلاثة: GPT-4 عند 86%، مقابل 81% للضبط الدقيق، و80% لـ RAG، و75% للأساس |
| ملف التكلفة (Snorkel إضافة إلى الأسعار المعلنة) | لكل استعلام: التضمينات إضافة إلى رموز السياق | مقدماً: من $1,915 إلى $7,418 في الحالة المنشورة؛ واستدلال بـ 0.1% من تكلفة GPT-3 المضبوط بدقة مع نموذج صغير | يدفع كليهما |
| احتكاك التحديث | إعادة فهرسة المستندات | إعادة تدريب كاملة | كلاهما |
| دعم الاستشهادات | أصيل | لا شيء | أصيل عبر جانب الاسترجاع |
الضبط الدقيق هو الإجابة الصحيحة في مرات أقل مما تظن الفرق؛ معظم المشاريع التي تقول "اضبط بدقة" تعني فعلياً "استرجع".
كيف يعمل RAG، ومتى يفوز؟
RAG (التوليد المعزز بالاسترجاع) يجيب من مستندات تتحكم بها بدلاً من كل ما حفظه النموذج أثناء التدريب. اقترحه لأول مرة Lewis et al. في 2020، فأصبح الخيار الافتراضي لأعمال المعرفة لأن المعرفة تعيش خارج النموذج: حدّث الفهرس، فتتغير كل إجابة غداً دون إعادة تدريب.
المسار من أربع خطوات:
- الاستيعاب. حلّل مستنداتك (ملفات PDF، الويكي، تذاكر الدعم) في مجموعة نصوص.
- التقطيع والتضمين. قسّمها إلى مقاطع من بضع مئات من الرموز وحوّل كل مقطع إلى متجه عبر نموذج تضمين.
- الاسترجاع. وقت الاستعلام، اعثر على المقاطع الأعلى تشابهاً (top-K)، إضافة إلى تطابقات الكلمات المفتاحية للنصوص الحرفية مثل أكواد SKU ورموز الأخطاء.
- التعزيز والتوليد. احشر تلك المقاطع في البرومبت ودع نموذج LLM يجيب مع إرفاق المصادر.
يفوز RAG على ثلاثة محاور: الحداثة (إعادة فهرسة بدل إعادة تدريب)، والاستشهادات (كل إجابة تشير إلى المقطع الذي جاءت منه)، والتحكم في البيانات (بيانات العملاء لا تدخل أي عملية تدريب أبداً). إن كنت تريد الشرح الكامل للبناء، فإليك كيفية بناء تطبيق RAG خطوة بخطوة.
تحذير واحد بشأن جودة الاسترجاع: المسار لا يكون أفضل من مزيج التضمين والاسترجاع فيه. الاسترجاع السياقي من Anthropic قاس معدل فشل استرجاع 5.7% ضمن أفضل 20 نتيجة في الإعدادات العادية، انخفض إلى 2.9% مع التضمينات السياقية إضافة إلى BM25، وإلى 1.9% بعد إضافة معيد الترتيب. إن كانت استعلامات التطابق الحرفي تفشل باستمرار، فـالبحث الهجين (BM25 مقابل Vector) هو الحل.
متى يفوز الضبط الدقيق؟ (وما هو PEFT؟)
يفوز الضبط الدقيق حين تكون المشكلة في كيفية إجابة النموذج، لا في ما يعرفه: تنسيق مخرجات ثابت، أو نبرة علامة تجارية، أو ميزانية زمن استجابة صارمة بلا رحلة استرجاع ذهاباً وإياباً. وهو أيضاً الرافعة لاقتصاديات النماذج الصغيرة. نتيجة Snorkel أعلاه (جودة GPT-3 بـ 0.1% من التكلفة) موجودة فقط لأن أحدهم ضبط نموذجاً صغيراً بدقة بدل تشغيل نموذج كبير.
الضبط الدقيق الكامل مقابل PEFT (LoRA / QLoRA)
الضبط الدقيق الكامل يحدّث كل وزن في النموذج. وهو مكلف وبطيء ونادر خارج المختبرات الكبيرة. الجميع تقريباً يشحن PEFT (الضبط الدقيق كفء المعاملات) بدلاً منه. LoRA (Hu et al. 2021) يجمّد الأوزان الأساسية ويدرّب محوّلاً صغيراً منخفض الرتبة، عادة من 0.1 إلى 1% من عدد المعاملات. QLoRA يضيف فوق ذلك تكميم 4 بت، فيسكن نموذج 13B على بطاقة رسوميات استهلاكية واحدة. مصطلح ذو صلة يستحق المعرفة: التدريب المسبق المستمر، حيث يواصل النموذج تدريبه المسبق على مجموعة نصوص مجال خام (دون إشراف) قبل الضبط الدقيق المُشرَف على أمثلة موسومة.
الحد الأدنى من إعدادات LoRA، حسب توثيق Hugging Face PEFT:
from peft import LoraConfig, get_peft_model
config = LoraConfig(
r=16, # low-rank dimension; 8-64 typical
lora_alpha=32, # scaling factor, commonly 2x r
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM",
)
model = get_peft_model(base_model, config)
model.print_trainable_parameters()
# trainable params: ~13M || all params: 6.7B || trainable%: 0.19لتجهيز مجموعة البيانات وعدد الحقب والتقييم، راجع دليلنا خطوة بخطوة للضبط الدقيق.
المخاطر حقيقية: الإفراط في التخصيص على مجموعات بيانات صغيرة (بضع مئات من الأمثلة قد تحفظ بدل أن تتعلم)، والتقادم (الأوزان تجمّد معرفتك عند حد التدريب الزمني)، وغياب عزو المصادر (النموذج المضبوط بدقة لا يستطيع إبراز إثباتاته). إن كان أي من هذه الثلاثة سبباً كافياً للتراجع، فقد أقنعت نفسك للتو بالعودة إلى RAG.
RAG مقابل الضبط الدقيق مقابل هندسة البرومبتات: أين تقع الخيارات الأخرى؟
الثلاثة سلّم، لا منافسون. هندسة البرومبتات تغيّر التعليمات، وRAG يغيّر السياق الذي يقرؤه النموذج، والضبط الدقيق يغيّر الأوزان. دليل OpenAI نفسه للضبط الدقيق يضع الضبط الدقيق آخر الحلقة: التقييمات أولاً، والبرومبتات ثانياً، والتدريب فقط حين تتوقف البرومبتات عن كونها كافية. خياران أحدثان يكملان العدة.
| النهج | ما الذي يتغير | استخدمه عندما | تجنّبه عندما | ملف التكلفة | الجهد |
|---|---|---|---|---|---|
| هندسة البرومبتات | التعليمات | السلوك قريب بنسبة 90% | الحاجة إلى حقائق خاصة أو سريعة التغير | رموز فقط | ساعات |
| RAG | السياق المقروء وقت الاستعلام | معرفة حديثة أو قابلة للاستشهاد | زمن استجابة ضيق؛ لا شيء لاسترجاعه | رموز لكل استعلام إضافة إلى الفهرس | أيام |
| الضبط الدقيق (LoRA) | الأوزان | التنسيق، النبرة، زمن الاستجابة، تشغيل النماذج الصغيرة | لا بيانات موسومة؛ معرفة تنحرف | تدريب مقدم؛ يتجدد مع كل إعادة تدريب | أسابيع |
| CAG (المعزز بالذاكرة المؤقتة) | سياق محمّل مسبقاً ومخزّن مؤقتاً | قاعدة معرفة صغيرة مستقرة؛ مع توفر تخزين البرومبتات المؤقت | مجموعة النصوص تتجاوز الحجم القابل للتخزين المؤقت | كتابة الكاش مرة، ثم قراءات رخيصة | أيام |
| الوكلاء مع استخدام الأدوات | ما يستطيع النموذج فعله | الإجابات تحتاج إجراءات حية أو حساباً | تكفي إجابة ثابتة | رموز لكل خطوة؛ تتضاعف بسرعة | أسابيع |
لبس يستحق التوضيح: خوادم MCP وأطر الوكلاء تنسيق (orchestration)، لا تخصيص. فهي تقرر أي أدوات ومصادر يستطيع النموذج الوصول إليها؛ لكنها لا تغيّر كيفية إجابة النموذج. يمكنك تشغيل مسار RAG داخل وكيل وضبط النموذج تحته بدقة، وكثير من الأنظمة الإنتاجية يفعل كلا الأمرين. حروب الإكمال التلقائي ("مقابل mcp"، "مقابل الوكلاء") أخطاء تصنيف.
هل RAG أرخص من الضبط الدقيق؟ نموذج التكلفة الحقيقي
الإجابة المختصرة: عند أحجام استعلامات واقعية، نعم. فاتورة الضبط الدقيق تصل مقدماً (بيانات موسومة إضافة إلى تدريب)، بينما فاتورة RAG تصل لكل استعلام (تضمينات إضافة إلى رموز إدخال إضافية). توثيق OpenAI للضبط الدقيق يحسب التدريب بالرموز، لكن رسوم الرموز مبلغ زهيد بجانب التكلفة البشرية للأمثلة الموسومة. إليك الحساب بالأسعار المعلنة.
| البند | متى تدفع | السعر المعلن |
|---|---|---|
| التدريب عبر API المستضاف (gpt-4o-mini) | مرة لكل إصدار نموذج | $3.00 لكل 1M رمز تدريب (OpenAI، قائمة 2024-25)، أي 1.5M رمز ≈ $4.50 |
| بيانات التدريب الموسومة | مقدماً، تتجدد مع الانحراف | $1,915 وسم برمجي مقابل $7,418 يدوي (حالة Snorkel المنشورة) |
| استدلال النموذج المضبوط بدقة | لكل استعلام | نحو ضعف الأساس: $0.30/$1.20 مقابل $0.15/$0.60 لكل 1M (gpt-4o-mini، OpenAI 2024-25) |
| تضمين مجموعة النصوص (RAG) | مرة لكل تحديث للمجموعة | $0.02 لكل 1M رمز (text-embedding-3-small)، أي مجموعة 10M رمز = $0.20 |
| السياق المسترجع (RAG) | لكل استعلام | نحو 2,000 رمز إدخال إضافية × $0.15/1M = $0.0003 لكل استعلام |
سؤال التعادل: كم عدد الاستعلامات حتى تعادل ضريبة RAG التراكمية لكل استعلام استثمار الضبط الدقيق؟
break_even = training_cost / per_query_retrieval_delta
= $1,915 / $0.0003
≈ 6.4 million queriesعند 50,000 استعلام شهرياً، هذا أكثر من عشر سنوات. لمعظم المنتجات، استثمار الضبط الدقيق لا يُسترد أبداً عبر توفير الرموز وحده؛ أنت تضبط بدقة من أجل التنسيق وزمن الاستجابة، لا للتغلب على RAG في التكلفة. الحساب ينقلب بعد ملايين الاستعلامات شهرياً أو مع سياقات مسترجعة كبيرة جداً. ولاحظ عدم التماثل: فاتورة الضبط الدقيق تتجدد كلما أجبر انحراف البيانات على إعادة تدريب، بينما RAG يتوسع خطياً مع الحجم مضروباً في حجم المقطع. إن كان الإنفاق لكل استعلام هو القلق الحقيقي، فابدأ بـخفض تكاليف LLM لكل استعلام أولاً؛ وإن سلكت مسار التدريب، فقارن أدوات الضبط الدقيق قبل دفع المبلغ.
ملاحظة حداثة واحدة: حتى يوليو 2026، ينص توثيق OpenAI للضبط الدقيق على أن المنصة المستضافة يُوقف تشغيلها تدريجياً للمستخدمين الجدد، مع احتفاظ المستخدمين الحاليين بصلاحية التدريب للأشهر المقبلة. وهو سبب إضافي لميل الفرق نحو PEFT للنماذج المفتوحة أو RAG العادي.
5 فحوص قبل أن تختار
أجرِ هذه الفحوص الخمسة بنعم أو لا قبل كتابة أي سطر كود تدريبي؛ نمط الإجابات يدل على RAG أو الضبط الدقيق أو الهجين بموثوقية أعلى من أي معيار قياس. أجب بصدق، ثم احسب.
- هل تتغير المعرفة أسرع مما تستطيع إعادة التدريب؟ نعم ← RAG. إعادة تدريب مع كل تحديث مستند ليست خطة تشغيلية.
- هل تملك بضع مئات من الأمثلة الموسومة؟ لا ← RAG أو هندسة البرومبتات. الضبط الدقيق على 40 مثالاً يحفظ؛ لا يتعلم.
- هل توجد ميزانية زمن استجابة صارمة؟ ضيقة ← يميل نحو الضبط الدقيق. تخطي رحلة الاسترجاع ذهاباً وإياباً يوفر من 50 إلى 200 مللي ثانية.
- هل يجب أن تحمل الإجابات استشهادات أو مسار تدقيق؟ نعم ← RAG. النماذج المضبوطة بدقة لا تستطيع الإشارة إلى المقطع المصدر.
- هل يملك الفريق مهارة تعلم الآلة إضافة إلى ميزانية GPU أو API للتدريب؟ لا ← RAG. فهرس تستطيع إعادة بنائه أفضل من أوزان لا تستطيع إعادة تدريبها.
أغلب الإجابات بنعم في 1 و4 و5 ← RAG. أغلب الإجابات بنعم في 2 و3 مع مجال مستقر ← الضبط الدقيق. إجابات منقسمة، أو منتج ناضج بحركة مرور حقيقية ← الهجين (القسم التالي). الغاية من قائمة الفحوص أن تقرر بالأدلة، لا بأي تقنية رائجة في خلاصتك هذا الشهر.
هل تستطيع استخدام RAG والضبط الدقيق معاً؟
نعم، وفي حالات النشر الناضجة النمط الهجين هو القاعدة، لا الاستثناء. اضبط بدقة من أجل طلاقة المجال وتنسيق المخرجات (الكيفية)، واسترجع من أجل الحقائق وقت الاستدلال (المضمون). Balaguer et al. يبلّغون بهذا تحديداً في مهمتهم الزراعية: المسار الهجين تفوق على أي نهج بمفرده، مع تراكم مكسب RAG البالغ 5 نقاط فوق نقاط الضبط الدقيق الست.
مسار النضج الذي نوصي به: ابدأ بهندسة البرومبتات، وأضف RAG لحظة احتياج الإجابات إلى بيانات خاصة أو حديثة، وأضف الضبط الدقيق فقط حين يبدأ عدم اتساق التنسيق أو زمن الاستجابة بإيذاء الإنتاج. تخطَّ مباشرة إلى الضبط الدقيق وستدفع ضريبة التدريب قبل أن تعرف ما إذا كان الاسترجاع قد حل المشكلة أصلاً.
النمط الهجين ليس حلاً وسطاً؛ في حالات النشر الناضجة هو الخيار الافتراضي: اضبط بدقة من أجل التنسيق، واسترجع من أجل الحقائق.
كيف تقيّم خيارك الفائز؟
اختر الفائز بالطريقة التي تختار بها قاعدة بيانات: قس على حمل عملك، لا على الانطباعات. الوصفة تتسع في فقرة واحدة وتغطي الأرقام الأربعة التي تحسم فعلياً.
- مجموعة أسئلة محجوبة. من 100 إلى 300 سؤال مستخدم حقيقي. لا أسئلة اصطناعية، ولا أي شيء شوهد أثناء التدريب أو الفهرسة أبداً.
- الأمانة وصحة الإجابة. الأمانة تسأل هل الإجابة مستندة إلى السياق المسترجع؛ وصحة الإجابة تسأل هل هي صحيحة فعلياً. الزوج، الذي روّج له RAGAS، يمسك بالهلوسة وحالات فوات الاسترجاع معاً.
- زمن الاستجابة عند p95، لا المتوسط. الاسترجاع يضيف رحلة ذهاب وإياب؛ قس الذيل.
- التكلفة لكل 1,000 استعلام، رموز إضافة إلى بنية تحتية، مقاسة لا مقدرة.
- إعادة التشغيل عند الانحراف. مستندات جديدة، لقطة نموذج جديدة، ربع سنة جديد: أعد تشغيل المجموعة.
التفصيل الكامل للمقاييس، مع الأدوات، موجود في دليلنا لتقييم LLM.
عن المؤلف
Mert Batur هو المؤسس المشارك لـ Techsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية/SDR لعملاء B2B. يكتب عن مكدس أدوات LLM الذي يستخدمه فريق Techsy فعلياً في الإنتاج. تواصل على LinkedIn.
الأسئلة الشائعة
هل تستطيع استخدام RAG والضبط الدقيق معاً؟
نعم. اضبط بدقة من أجل تنسيق المخرجات وطلاقة المجال، وأبقِ الاسترجاع من أجل الحقائق وقت الاستدلال. Balaguer et al. قاسوا هذا الهجين على مهمة أسئلة وأجوبة زراعية ووجدوه يتفوق على أي نهج بمفرده، مع تراكم مكاسب الدقة. معظم الأنظمة الإنتاجية الناضجة تنتهي هنا: الأوزان للكيفية، والاسترجاع للمضمون.
متى لا تستخدم الضبط الدقيق؟
تجنّب الضبط الدقيق حين تتغير معرفتك أسرع مما تستطيع إعادة التدريب، أو حين تملك أقل من بضع مئات من الأمثلة الموسومة، أو حين يجب أن تحمل الإجابات استشهادات أو مسارات تدقيق، أو حين لا توجد ميزانية لإعادة التدريب مع انحراف البيانات. هذه الشروط الأربعة تصف معظم المنتجات المبكرة، ولهذا RAG عادة هو الخطوة الأولى الصحيحة.
هل دُحض الضبط الدقيق؟
لا، لكن رقعته تقلصت. نوافذ السياق الطويلة وRAG الرخيص امتصا حالات استخدام كانت تتطلب الضبط الدقيق في 2023. ما تبقى حقيقي: تنسيق المخرجات الصارم، ونبرة العلامة التجارية، وميزانيات زمن الاستجابة بلا رحلة استرجاع، واقتصاديات النماذج الصغيرة. إن كانت مشكلتك في كيفية إجابة النموذج لا في ما يعرفه، فالضبط الدقيق ما يزال الأداة.
متى تستخدم RAG مقابل الضبط الدقيق؟
استخدم RAG حين تعتمد الإجابات على معرفة خاصة أو كثيرة التحديث، أو حين تحتاج استشهادات. واستخدم الضبط الدقيق حين تحتاج تنسيقاً أو نبرة أو زمن استجابة ثابتاً وتملك ما يكفي من أمثلة موسومة. استخدم كليهما حين ينضج المنتج. وإن كنت غير متأكد، ابدأ بـ RAG: التراجع عنه أرخص من التراجع عن عملية تدريب.
هل RAG أرخص من الضبط الدقيق؟
مقدماً، نعم. تكلفة RAG لكل استعلام (تضمينات إضافة إلى رموز إدخال إضافية)، بينما الضبط الدقيق يحسب مرة واحدة للتدريب والبيانات الموسومة، ثم يتجدد مع كل إعادة تدريب. بالأسعار المعلنة، تقع نقطة التعادل حول 6.4 مليون استعلام في مثالنا المحسوب، لذا عند الأحجام المعتادة يبقى RAG أرخص طوال عمر المنتج.
هل RAG أفضل من الضبط الدقيق في مواجهة الهلوسة؟
عادة، لكن ليس مجاناً. RAG يؤسس الإجابات على مقاطع مسترجعة، فتستطيع الاستشهاد بالمصادر وتدقيق حالات الفشل. لكن الاسترجاع السيئ يسمم الإجابة: Anthropic قاست معدل فشل استرجاع 5.7% ضمن أفضل 20 نتيجة في الإعدادات العادية، انخفض إلى 1.9% مع الاسترجاع السياقي إضافة إلى إعادة الترتيب. الضبط الدقيق، في المقابل، قد يثبّت الأخطاء داخل الأوزان بلا سبيل لتتبعها.
RAG مقابل الضبط الدقيق مقابل هندسة البرومبتات: ما الفرق؟
هندسة البرومبتات تغيّر التعليمات التي ترسلها. RAG يغيّر السياق الذي يقرؤه النموذج وقت الاستعلام. الضبط الدقيق يغيّر أوزان النموذج. كل منها تدخل أكبر من سابقه: جرّب البرومبتات أولاً، وأضف الاسترجاع حين تكون المعرفة هي عنق الزجاجة، ودرّب فقط حين يبقى التنسيق أو النبرة أو زمن الاستجابة مؤلماً.
كيف تقيّم أداء RAG مقابل الضبط الدقيق؟
ابنِ مجموعة محجوبة من 100 إلى 300 سؤال مستخدم حقيقي وقيّم كلا النهجين عليها: الأمانة (هل هي مستندة؟)، وصحة الإجابة (هل هي صحيحة؟)، وزمن الاستجابة عند p95، والتكلفة لكل 1,000 استعلام. أعد تشغيل المجموعة كلما تغيرت مستنداتك أو لقطة النموذج. الأسئلة الاصطناعية تجامل كلا النظامين؛ الأسئلة الحقيقية تفصل بينهما.
الضبط الدقيق مقابل RAG للأسئلة متعددة القفزات حول معرفة جديدة؟
RAG، مع استرجاع أفضل. الآلية تحسم هذه: النموذج المضبوط بدقة يستطيع الاستدلال فقط على ما امتصته أوزانه، فالمعرفة التي لم يرها إطلاقاً غير قابلة للوصول مهما كان تدريبه جيداً. الاسترجاع يناوله القطع المفقودة وقت الاستعلام. المأخذ أن مرور استرجاع واحداً نادراً ما يجمع كل قفزة، لذا خطط لتفكيك الاستعلام أو الاسترجاع التكراري مع معيد ترتيب، لا بحث top-K واحد.
الخلاصة
الملخص، دون تحوط:
- RAG هو الخيار الافتراضي للمعرفة المتغيرة والإجابات المستشهد بها. والضبط الدقيق هو الأداة المتخصصة للتنسيق والنبرة وزمن الاستجابة.
- أدلة المهمة نفسها (Balaguer et al.) تمنح الضبط الدقيق +6 نقاط مئوية وRAG +5 نقاط مئوية إضافية فوقها، والهجين أفضل الثلاثة. نصيحتنا بالبدء بـ RAG تستند إلى الحداثة والاستشهادات والتكلفة، لا إلى لوحة النتائج تلك.
- حسابات التكلفة تصب في مصلحة RAG عند الأحجام الواقعية: نقطة التعادل وقعت حول 6.4 مليون استعلام في مثالنا المحسوب.
- قرر بالفحوص الخمسة، لا بالعادة.
اخترت RAG؟ اطّلع على قائمتنا المرتبة لأدوات RAG للحزمة المحيطة بالمسار.