Techsy
اتصل بنا
ابدأ
العودة للمدونة
ai-machine-learning

Gemma 4 12B: المعايير ومتطلبات VRAM وكيفية تشغيله محلياً

بقلم Mert Batur Gürbüz
تم التحديث Jul 14, 2026
13 قراءة
جدول المحتويات
Gemma 4 12B: المعايير ومتطلبات VRAM وكيفية تشغيله محلياً

أصدرت Google DeepMind نموذج Gemma 4 12B في 3 يونيو 2026. وبعد ثلاثة أيام، الرقم الذي يتداوله الجميع هو درجة MMLU Pro: 77.2%. هذا يتجاوز Gemma 3 27B الصادر العام الماضي، الذي حقق 67.6% على الاختبار ذاته. نموذج بـ 12 مليار معامل يتفوق على نموذج بـ 27 ملياراً؟ مع استهلاك أقل من نصف الذاكرة؟ نعم. وتغيّر الترخيص أيضاً. يصدر Gemma 4 تحت رخصة Apache 2.0، ما يعني أن الاستخدام التجاري مباح دون أي قيود. يتيح نافذة سياق بـ 256,000 رمز ويعمل في نحو 6.6 جيجابايت من VRAM بعد الضغط. هذه النقطة الأخيرة هي الجوهر لمعظمنا: النموذج يعمل على بطاقة رسومات متوسطة المستوى.

أبرز النقاط

  • Gemma 4 12B (صدر 3 يونيو 2026) يحقق 77.2% على MMLU Pro، متفوقاً على Gemma 3 27B (67.6%).
  • يعمل في ~6.6 جيجابايت VRAM عند Q4KM، مناسباً لبطاقات 8 جيجابايت؛ 16 جيجابايت توفر هامشاً مريحاً.
  • رخصة Apache 2.0 (الاستخدام التجاري مباح)، سياق 256K رمز، إدخال صوت وصورة أصلي، معمارية بلا encoder.
  • أمر واحد للتشغيل: ollama run gemma4:12b (تنزيل 7.6 جيجابايت).

ما هو Gemma 4 12B؟

Gemma 4 12B نموذج ذو أوزان مفتوحة بـ 12 مليار معامل من Google DeepMind، صدر في 3 يونيو 2026 تحت رخصة Apache 2.0. هو نموذج متعدد الوسائط موحّد بلا encoder: يستقبل النصوص والصور والصوت الأصلي، ويُخرج نصاً. يتيح نافذة سياق بـ 256,000 رمز ويدعم 140 لغة.

النسخة الموجّهة بالتعليمات التي ستُشغّلها فعلياً تُسمى gemma-4-12B-it (الـ "it" اختصار لـ instruction-tuned، وهي النسخة الجاهزة للمحادثة). يبلغ إجمالي معاملاتها 11.95 مليار، أي أن "12B" تقريب طفيف للأعلى. تصل بيانات التدريب إلى يناير 2025.

إليك ما يجعله مثيراً للاهتمام: Gemma 4 12B هو أول Gemma متوسط الحجم يدعم إدخال الصوت الأصلي. لا يوجد encoder صوتي منفصل مُضاف. تُسقَط موجات الصوت الخام مباشرة في النموذج. الأمر ذاته ينطبق على الصور. هذا الاختيار المعماري هو سبب بقائه صغيراً بما يكفي للعمل على بطاقة مستهلك واحدة، وسنشرح السبب بعد قليل.

تريد الصورة الكبيرة أولاً؟ دليلنا حول تشغيل النماذج المفتوحة على جهازك الخاص يغطي أساسيات الإعداد إن كنت جديداً على النماذج المحلية. المنشور الرسمي لـ Google عن الإطلاق يحتوي على الإعلان الكامل.

مواصفات Gemma 4 12B دفعة واحدة

كل شيء مُتحقق منه في جدول واحد. بلا تخمين.

المواصفةالقيمة
الاسم الكاملGemma 4 12B (gemma-4-12B-it)
عدد المعاملات11.95 مليار (~12B)
الرخصةApache 2.0 (الاستخدام التجاري مباح)
نافذة السياق256,000 رمز
الوسائطنص + صورة + صوت أصلي كمدخلات، نص كمخرج
المعماريةموحّدة بلا encoder، 48 طبقة، انتباه هجين
اللغات المدعومة140
تاريخ انتهاء بيانات التدريبيناير 2025
وسم Ollamagemma4:12b (تنزيل 7.6 جيجابايت)
وسم Apple Silicongemma4:12b-mlx
أخذ العينات الموصى بهtemperature 1.0، top_p 0.95، top_k 64

ملاحظة حول أخذ العينات: التزم بالإعدادات الموصى بها temperature=1.0, top_p=0.95, top_k=64 إلا إن كان لديك سبب وجيه. تتصرف نماذج Gemma بشكل غريب عند درجات حرارة منخفضة، فلا تخفّضها إلى 0.2 كما تفعل مع نماذج أخرى.

كيف تعمل المعمارية الخالية من Encoder؟

"بلا encoder" يعني أنه لا يوجد نموذج منفصل يحوّل الصور أو الصوت قبل وصولها إلى نموذج اللغة. تُسقَط رقع الرؤية وموجات الصوت الخام مباشرة في فضاء التضمين المشترك عبر طبقات خطية رفيعة. معظم النماذج متعددة الوسائط تُضيف encoder رؤية ثقيل إلى النموذج اللغوي. Gemma 4 12B يتجاوز ذلك، وهذا سبب ملاءمته لـ 16 جيجابايت.

فكّر في الأمر كمقارنة بين مترجم ثنائي اللغة من المولد وآخر يستعين بمترجم خارجي. النهج القديم يستأجر مترجماً منفصلاً (الـ encoder) لتحويل الصور إلى لغة يفهمها النموذج، ثم يُمررها. Gemma 4 12B ثنائي اللغة منذ البداية. بيانات الصوت والصورة تتحدث لغة النموذج مباشرة عبر طبقة إسقاط خفيفة بدلاً من encoder ضخم.

تحت الغطاء يوجد 48 طبقة مع انتباه هجين. معظم الطبقات تستخدم نافذة انزلاقية بـ 1024 رمز (رخيصة ومحلية)، تتخللها طبقات انتباه عالمي متفرقة ترى السياق الكامل. هذا المزيج هو ما يجعله قادراً على التعامل مع سياق 256K دون إذابة بطاقتك الرسومية.

مخطط معماري يوضح كيف تُسقَط موجات الصوت الخام ورقع الصورة مباشرة في فضاء تضمين Gemma 4 12B
كيف يُغذّي Gemma 4 12B بيانات الصوت والصورة مباشرة في النموذج بلا encoder منفصل

العائد العملي: معاملات أقل مُنفقة على الـ encoders تعني أن ميزانية VRAM لديك تذهب إلى التفكير الفعلي. هذه هي المقايضة التي تجعل نموذج 12B يُحقق هذا الأداء المتجاوز لحجمه.

معايير Gemma 4 12B: الأرقام الحقيقية

العنوان الرئيسي صامد: Gemma 4 12B يحقق 77.2% على MMLU Pro، متفوقاً على Gemma 3 27B (67.6%) على الاختبار ذاته، مع استهلاك أقل من نصف VRAM. هذه أرقام رسمية للنموذج الموجّه بالتعليمات (-it) من Google، ليست تقديرات مجتمعية. إليك المجموعة الكاملة.

المعيارGemma 4 12BGemma 3 27B (مرجع)
MMLU Pro77.2%67.6%
GPQA Diamond78.8%—
MMMU Pro69.1%—
AIME 2026 (بدون أدوات)77.5%—
LiveCodeBench v672.0%—
Codeforces ELO1659—

نموذج 12B يتفوق الآن على نموذج 27B الرائد من العام الماضي في MMLU Pro: 77.2% مقابل 67.6%. هذا النوع من القفزة الجيلية يجعلك تُعيد حساب متطلبات الأجهزة.

مخطط شريطي يقارن Gemma 4 12B مع Gemma 3 27B وGemma 3 12B على معيار MMLU Pro
Gemma 4 12B مقابل Gemma 3 27B وGemma 3 12B على MMLU Pro، حيث يحقق النموذج الجديد الأصغر أعلى الدرجات

ملاحظتان صريحتان. أولاً، الشرطات تعني أن Google لم تنشر رقم Gemma 3 27B لتلك الصفوف، لذا تبقى الخانات فارغة بدلاً من ملئها بتخمينات. ثانياً، كل درجة هنا للنموذج الموجّه بالتعليمات. أرقام النموذج الأساسي مختلفة. يمكنك التحقق من كل هذه الأرقام على صفحة النموذج في HuggingFace وصفحة DeepMind للنموذج.

كم من VRAM يحتاج Gemma 4 12B؟

يحتاج Gemma 4 12B نحو 6.6 جيجابايت من VRAM عند ضغط Q4KM، ما يعني أنه يعمل على بطاقة 8 جيجابايت. لهامش مريح، خاصة إذا أردت استخدام جزء من سياق الـ 256K، استهدف 16 جيجابايت من VRAM أو الذاكرة الموحدة. يعمل على لابتوب. أجهزة Mac بشريحة M تُديره بسلاسة عبر الذاكرة الموحدة.

الضغط هو ببساطة ضغط لأوزان النموذج. أرقام بدقة أقل، حجم ملف أصغر، دقة أقل قليلاً. إليك كيف تتوزع المستويات الشائعة.

مستوى الضغطVRAM التقريبيالجودةالأفضل لـ
Q4_K_M~6.6 جيجابايتقريبة من الكاملة، فقدان طفيفالخيار المنطقي الافتراضي؛ يناسب بطاقات 8 جيجابايت
Q5_K_M~8.5 جيجابايتأفضل قليلاً من Q4بعض VRAM إضافي، تريد دقة أعلى
Q8~13 جيجابايتجودة كاملة فعلياًبطاقات 16 جيجابايت+، أقصى دقة
QAT Q4_0~6.6 جيجابايتدقة شبه كاملة بحجم Q4أفضل جودة لكل جيجابايت (صدر 5 يونيو)

مخطط شريطي أفقي لاستهلاك VRAM في Gemma 4 12B حسب مستوى الضغط مع خطوط مرجعية عند 8 و16 جيجابايت
حجم VRAM في Gemma 4 12B لكل مستوى ضغط مع خطوط مرجعية لبطاقات 8 و16 جيجابايت

إن كنت تختار الأجهزة حول هذا النموذج، تغطي مراجعتنا لأدوات تشغيل النماذج المحلية أي الخلفيات تستخرج أقصى أداء من بطاقة بعينها. الملخص المختصر: بطاقة 12 جيجابايت تُشغّل Q4 بمساحة كافية، وبطاقة 8 جيجابايت تُشغّل Q4 إذا أبقيت حجم السياق معقولاً.

سرعة Gemma 4 12B: tokens/sec على أجهزة حقيقية

ما مدى سرعته؟ يعتمد ذلك على بطاقتك ومستوى الضغط والخلفية التي تستخدم، لذا بدلاً من رقم واحد جمعنا الأرقام المنشورة من أطراف ثالثة في مكان واحد. هذه أرقام مُبلَّغ عنها من مختبري المجتمع والبائعين، منسوبة لكل مصدر. ليست أرقام مختبرنا الخاص.

الجهازمستوى الضغطtokens/sec المُبلَّغ عنهالمصدر
RTX 3060 (6 جيجابايت)Q4_K_Mحجم VRAM ~6.6 جيجابايت، يعمل محلياً (tok/s غير مُبلَّغ بدقة)runaiathome
RTX 4090 (24 جيجابايت)Q4_K_Mنطاق الدردشة الفورية (tok/s محدد غير مُبلَّغ بعد)apxml / المجتمع
Apple M-series (موحّد)mlx / Q4يعمل عبر gemma4:12b-mlx (tok/s غير واسع الانتشار بعد)Ollama / المجتمع

لنكن صريحين حول ما تقوله البيانات المتاحة للعموم حالياً. أكد runaiathome تشغيل النموذج على RTX 3060 بـ 6 جيجابايت داخل حجم Q4KM البالغ ~6.6 جيجابايت، وهو أكثر تقرير أجهزة منشور تحديداً حتى الآن. تحدد صفحة المواصفات لـ apxml وصفحة مكتبة Ollama أن النموذج يعمل محلياً على RTX 4090 بـ 24 جيجابايت عند Q4 في نطاق الدردشة الفورية المريح، لكن رقم tok/s مستداماً ودقيقاً لم يُنشر بعد لتلك البطاقة. نسخة Apple Silicon gemma4:12b-mlx موجودة وتعمل، لكن أرقام tok/s موثوقة لم تظهر بعد ثلاثة أيام من الإطلاق.

ما يعنيه هذا بحسب الفئة: على بطاقة 6 جيجابايت كـ RTX 3060، توقع أن يُحمَّل ويعمل للدردشة المحلية، مع إبقاء نافذة السياق معقولة. على RTX 4090 بـ 24 جيجابايت عند Q4KM، تضع التقارير المنشورة الأداء في نطاق الدردشة الفورية المريح. على Apple Silicon، نسخة MLX تعمل لكن أرقام المعايير لا تزال تتراكم.

هذه أرقام أطراف ثالثة منشورة وليست من مختبرنا الخاص، لذا تعامل معها كتقديرات تقريبية. سرعة tok/s لديك تعتمد على طول المطالبة وحجم السياق وإصدار الخلفية. المصادر: صفحة مكتبة Ollama وapxml وrunaiathome. مع تراكم مزيد من معايير المجتمع خلال الأسبوعين القادمين، سنُحدّث هذا الجدول.

كيف تُشغّل Gemma 4 12B محلياً؟

المسار الأقصر: ثبّت Ollama، نفّذ أمراً واحداً، انتهى الأمر. ollama run gemma4:12b يسحب النموذج البالغ 7.6 جيجابايت ويفتح لك موجه دردشة. لا ملفات إعداد، لا بيئة Python. إن أردت مزيداً من التحكم أو كنت على Apple Silicon، إليك أربعة مسارات أخرى أدناه.

1. Ollama (الافتراضي السهل). سحب وتشغيل في سطرين:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp مع GGUF. إن أردت ضغطاً محدداً، وجّه llama.cpp إلى GGUF على HuggingFace. GGUF هو تنسيق الملف الذي يستخدمه llama.cpp للأوزان المضغوطة:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. MLX على Apple Silicon. تحصل أجهزة Mac بشريحة M على نسخة MLX مخصصة تستخدم إطار عمل Apple بدلاً من CUDA:

bash
ollama run gemma4:12b-mlx

4. LM Studio (واجهة رسومية، بلا طرفية). تُفضّل تطبيقاً للسطح المكتبي؟ افتح LM Studio، اضغط على تبويب البحث، واكتب gemma 4 12b. اختر GGUF بمستوى Q4KM ونزّله. LM Studio يتولى الباقي، بما في ذلك تشغيل خادم محلي.

5. الاستعلام عبر API. يكشف Ollama عن نقطة نهاية متوافقة مع OpenAI على المنفذ 11434، لذا يعمل الكود الموجود مع تعديل بسيط على عنوان URL الأساسي:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

بمجرد تشغيله على سطر الأوامر، ستحتاج على الأرجح لواجهة حقيقية. يمكنك تغليفه بواجهة مشابهة لـ ChatGPT باستخدام Open WebUI في نحو خمس دقائق. جديد على كل هذا؟ ابدأ بـ دليل الإعداد الكامل للنماذج المحلية. للتوصيات الرسمية لأخذ العينات ومسارات التشغيل، راجع ai.google.dev ووثائق Ollama.

أي مستوى ضغط تستخدم مع Gemma 4 12B؟

لمعظم الناس، Q4KM هو الخيار المنطقي الافتراضي: نحو 6.6 جيجابايت من VRAM، جودة شبه كاملة، ويناسب بطاقة 8 جيجابايت. إن كان لديك 16 جيجابايت أو أكثر وتريد أقصى دقة، انتقل إلى Q8. وإن أردت أفضل جودة لكل جيجابايت متاحة الآن، انظر إلى نقاط تفتيش QAT Q4_0 الجديدة.

إليك زاوية الجِدّة التي لم يتطرق إليها أحد بعد. في 5 يونيو 2026، بعد يومين فقط من الإطلاق، أصدرت Google نقاط تفتيش QAT Q4_0 (Quantization-Aware Training) جانباً مع تنسيق جوال جديد. QAT يعني أن النموذج دُرّب مع مراعاة الضغط، لذا يحافظ على جودة شبه كاملة (near-FP) بحجم Q4. نفس ~6.6 جيجابايت، مع فقدان دقة أقل ملحوظية من Q4 القياسي بعد التدريب. إن كنت محدود VRAM لكنك حساس للجودة، فهذا خيارك.

دليل سريع للقرار:

  • بطاقة 8 جيجابايت، تريد البساطة: Q4KM.
  • بطاقة 8 جيجابايت، تريد أفضل جودة بهذا الحجم: QAT Q4_0.
  • بطاقة 16 جيجابايت+، تريد أقصى دقة: Q8.
  • بين الخيارين، بعض VRAM إضافي: Q5KM.

يمكنك قراءة منطق Google في إعلان QAT. الخلاصة: Q4KM كافٍ، QAT Q4_0 أفضل بالحجم ذاته، ولا تحتاج Q8 إلا إذا كانت الدقة أهم من الذاكرة.

Gemma 4 12B مقابل Gemma 3 12B مقابل Qwen 3.5: هل الترقية تستحق؟

نعم، الترقية من Gemma 3 12B تستحق إذا كنت تهتم برخصة Apache 2.0، أو إدخال الصوت الأصلي، أو نافذة السياق 256K، أو القفزة في MMLU Pro. أمام Qwen 3.5 الأمر أقل وضوحاً. Gemma 4 12B يفوز في رخصة الاستخدام وإدخال الصوت الأصلي، لكن Qwen 3.5 يتصدر بعض صفوف المعايير لفئة 12B. اختر بناءً على احتياجاتك الفعلية، لا العنوان الرئيسي.

الميزةGemma 4 12BGemma 3 12BQwen 3.5 (فئة 12B)
الرخصةApache 2.0رخصة Gemma مخصصةApache 2.0
السياق256K128Kحتى 256K
الوسائطنص + صورة + صوتنص + صورةنص + صورة
صوت أصلينعملالا
MMLU Pro77.2%أقلتنافسي، يفوز في بعض الصفوف
VRAM عند Q4~6.6 جيجابايت~6.6 جيجابايت~6.6 جيجابايت

تغيير الرخصة وحده يبرر الانتقال من Gemma 3 12B لكثير من الفرق. صدر Gemma 3 تحت رخصة Google المخصصة مع قيود استخدام؛ Gemma 4 على Apache 2.0 مباشرةً. إن كنت تُحجم عن Gemma لأسباب تجارية، فقد زال هذا الحاجز.

أمام Qwen 3.5، كن صريحاً مع نفسك. Qwen 3.5 قوي فعلاً ويتفوق على Gemma 4 12B في صفوف معينة من التفكير والبرمجة. إن لم يكن إدخال الصوت والرخصة المتساهلة ضمن اعتباراتك، ابتكر كلاً منهما على مهمتك الخاصة قبل الالتزام. اطلع على مكانة Gemma 4 12B بين أفضل النماذج المفتوحة للصورة الأشمل. وبما أنه تحت Apache 2.0، يمكنك ضبطه الدقيق مع Unsloth تحت Apache 2.0 دون متاعب ترخيص.

متى لا تستخدم Gemma 4 12B؟

تجاوز Gemma 4 12B إن كنت بحاجة إلى استدلال على مستوى الحدود لا يوفره إلا نموذج أكبر بكثير، أو إن كان Qwen 3.5 يفوز في صف المعيار المحدد الذي يعتمد عليه حِمل عملك، أو إن كان مشروعك يعتمد بشكل كبير على أدوات الصوت التي لا تزال في مراحل نضوجها بعد ثلاثة أيام من الإطلاق. إنه نموذج 12B ممتاز، لا نموذج سحري.

Gemma 4 12B ليس دائماً الخيار الصحيح. إن كنت بحاجة إلى استدلال على مستوى الحدود، نموذج أكبر لا يزال يفوز. دعم الصوت الأصلي حقيقي ومثير للإعجاب، لكن الأدوات المحيطة به، والمكتبات ووحدات المساعدة وتكاملات الأطر، عمرها أيام وخشنة في بعض الجوانب. إن كنت تُطلق منتجاً يعتمد على الصوت هذا الأسبوع، اختبر بعناية قبل الرهان عليه.

بعض موانع الاستخدام الصريحة الأخرى. إن كنت تدمجه في وكيل، تحقق أولاً من موثوقية استدعاء الأدوات على مهامك، إذ يتفاوت السلوك الوكيل بحسب النموذج. إن كانت ميزتك السياق الطويل، تأكد من الاستفادة القصوى من نافذة السياق 256K بدلاً من افتراض أن حجم النافذة وحده يعني إخراجاً أفضل. وإن كنت تتخطى التشغيل المحلي نحو الخدمة الإنتاجية، يغطي مسار الخدمة الإنتاجية كلاً من vLLM وSGLang. إن كنت تنشر نماذج مفتوحة كـ Gemma 4 12B في الإنتاج، يمكننا مساعدتك.

عن الكاتب

مرت باتور غوربوز هو المؤسس المشارك لـ Techsy.io، حيث يبني الفريق وكلاء الذكاء الاصطناعي وأنظمة الأتمتة وخطوط أنابيب الصوت/SDR لعملاء B2B. يدرس في جامعة برمنغهام ويكتب عن مجموعة أدوات LLM التي يستخدمها فريق Techsy فعلياً في الإنتاج. تواصل معه على LinkedIn.

اختيار الأداة هو الجزء السهل. أما تشغيلها بموثوقية داخل منتج حقيقي فهو ما تتعثر عنده معظم الفرق، وهذا بالضبط ما يبنيه فريق تكامل الذكاء الاصطناعي لدينا لعملائنا، من خطوط RAG إلى الوكلاء المخصصين.

الأسئلة الشائعة

كيف أُشغّل Gemma 4 12B محلياً؟

ثبّت Ollama، ثم نفّذ ollama run gemma4:12b. هذا يسحب النموذج البالغ 7.6 جيجابايت ويفتح موجه دردشة. لا حاجة لبيئة Python أو ملفات إعداد. إن فضّلت تطبيقاً رسومياً، يعمل LM Studio أيضاً: ابحث عن gemma 4 12b في متصفح النماذج لديه ونزّل نسخة Q4KM.

ما متطلبات VRAM والأجهزة لـ Gemma 4 12B؟

يحتاج Gemma 4 12B نحو 6.6 جيجابايت من VRAM عند ضغط Q4KM، لذا يناسب بطاقة 8 جيجابايت. لهامش مريح، خاصة عند استخدام السياق الطويل، استهدف 16 جيجابايت من VRAM أو الذاكرة الموحدة. يعمل على اللابتوبات، بما في ذلك أجهزة Mac بشريحة M عبر الذاكرة الموحدة.

هل يعمل Gemma 4 12B على لابتوب بـ 16 جيجابايت؟

نعم، بسهولة. عند Q4KM يستخدم النموذج نحو 6.6 جيجابايت، مما يُبقي مساحة وفيرة على جهاز 16 جيجابايت. على لابتوبات Apple Silicon تتعامل الذاكرة الموحدة معه بشكل جيد عبر نسخة gemma4:12b-mlx. يمكنك حتى الترقية إلى ضغط Q8 على 16 جيجابايت لدقة أعلى.

هل Gemma 4 12B أفضل فعلاً من Llama أو Qwen 3.5؟

يعتمد على ما تقيسه. Gemma 4 12B يفوز في رخصة Apache 2.0 وإدخال الصوت الأصلي ونافذة السياق 256K، ويُسجّل 77.2% قوية على MMLU Pro. لكن Qwen 3.5 يتصدر بعض صفوف التفكير والبرمجة لفئة 12B. ابتكر كليهما على مهمتك الخاصة قبل اتخاذ القرار.

هل Gemma 4 12B أفضل من Gemma 3 12B؟

نعم. ينتقل Gemma 4 12B إلى رخصة Apache 2.0 المتساهلة، ويضيف إدخال الصوت الأصلي، ويضاعف نافذة السياق إلى 256K رمز، ويُسجّل تحسناً ملموساً في MMLU Pro. تغيير الرخصة وحده يبرر الترقية للمشاريع التجارية التي كانت محجوبة بشروط Gemma 3 المخصصة.

أي مستوى ضغط أستخدم مع Gemma 4 12B؟

Q4KM هو الخيار المنطقي الافتراضي بنحو 6.6 جيجابايت وجودة شبه كاملة. إن أردت أفضل جودة بالحجم ذاته، استخدم نقاط تفتيش QAT Q4_0 الجديدة الصادرة في 5 يونيو 2026، التي تحافظ على جودة شبه كاملة (near-FP) بحجم Q4. استخدم Q8 فقط إن كان لديك 16 جيجابايت+ وتحتاج أقصى دقة.

هل Gemma 4 12B مجاني للاستخدام التجاري؟

نعم. يصدر Gemma 4 12B تحت رخصة Apache 2.0 التي تبيح الاستخدام التجاري دون القيود التي كانت في رخصة Gemma 3 المخصصة. يمكنك بناء منتجات تجارية وضبطه الدقيق وإعادة توزيعه. تغيير الرخصة هذا أحد أبرز أسباب ترقية الفرق من Gemma 3.

هل يدعم Gemma 4 12B إدخال الصوت فعلاً؟

نعم. Gemma 4 12B هو أول Gemma متوسط الحجم يدعم إدخال الصوت الأصلي. بفضل تصميمه الخالي من encoder، تُسقَط موجات الصوت الخام مباشرة في النموذج بلا encoder صوتي منفصل. مع ذلك، الأدوات المحيطة به عمرها أيام، لذا اختبر بعناية قبل شحن ميزات تعتمد على الصوت في الإنتاج.

ما سرعة Gemma 4 12B على RTX 4090؟

تضع تقارير الأطراف الثالثة المنشورة Gemma 4 12B عند Q4KM في نطاق الدردشة الفورية المريح على RTX 4090 بـ 24 جيجابايت، وإن كان رقم tokens/sec مستداماً ودقيقاً لم يُنشر بعد ثلاثة أيام من الإطلاق. تتفاوت السرعة مع طول المطالبة وحجم السياق وإصدار الخلفية، لذا تعامل مع الأرقام المبكرة كتقديرات تقريبية.

من أين أُنزّل Gemma 4 12B؟

النموذج الموجّه بالتعليمات موجود على HuggingFace باسم google/gemma-4-12B-it، أو يمكنك سحبه عبر Ollama بالأمر ollama run gemma4:12b (تنزيل 7.6 جيجابايت). مستخدمو LM Studio يمكنهم البحث عن gemma 4 12b في متصفح النماذج بالتطبيق. لضغوط محددة، تتوفر ملفات GGUF من مستودعات المجتمع مثل Unsloth.

الوسوم

gemma 4 12bollamaنماذج محليةضغط النماذجgemma

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Jul 20, 2026

هندسة الأوامر للبرمجة: 7 أنماط نستخدمها يوميًا في Claude Code وCursor (2026)

معظم مقالات \"أوامر البرمجة بالذكاء الاصطناعي\" تمنحك 50 قالبًا جاهزًا للنسخ. هذا المقال يعلّمك الأنماط السبعة التي نستخدمها يوميًا لتشغيل خط أنابيب Claude Code المكوّن من 16 وكيلًا، مع مثال حقيقي قبل/بعد لكل نمط، وأين يعيش كل نمط في Claude Code وCursor وCopilot عام 2026.

11 دقيقة قراءة قراءة
اقرأ
ai-machine-learning
Jul 20, 2026

أفضل 8 واجهات API لاستخلاص بيانات الويب بالذكاء الاصطناعي في 2026 (اختبرناها على بنية وكلائنا الخاصة)

اختبرنا 8 واجهات برمجة تطبيقات لاستخلاص بيانات الويب بالذكاء الاصطناعي، بأسعار حقيقية لعام 2026 حصلنا عليها عبر بنية وكلائنا الخاصة. Firecrawl وBright Data وScrapingBee وخمس أدوات أخرى، مرتّبة بحسب جاهزية المخرجات لنماذج اللغة، ومقاومة أنظمة الحماية، ودعم MCP.

9 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Jul 19, 2026

مطالبة سلسلة التفكير (Chain of Thought) في 2026: متى تنجح ومتى تنقلب ضدك

لا تزال مطالبة سلسلة التفكير (Chain of Thought) تُحسّن دقة بعض النماذج، لكنها تُضعف أداء نماذج أخرى بصمت في 2026. نماذج الاستدلال مثل GPT-5 وClaude تنفّذ هذه الخطوة داخلياً بالفعل، فكتابة 'فكّر خطوة بخطوة' يدوياً غالباً ما تكون زائدة عن الحاجة. هنا نوضح بالضبط متى تستخدم CoT ومتى تتجاهلها وكيف تقرر، استناداً إلى توثيق OpenAI وAnthropic الرسمي.

11 دقيقة قراءة قراءة
اقرأ
عرض جميع المقالات
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.

احجز مكالمة استكشاف لمدة 30 دقيقةشاهد أعمالنا

الأحدث من المكتبة

الموارد

عرض الكل
  • دليل شراء البرمجيات

    إطار عمل قابل للتكرار لشراء البرمجيات دون أن تهدر ستة أشهر ومليون دولار على المنصة الخاطئة.

  • دليل قرارات البنية التقنية

    إطار عملي لاختيار حزمتك التقنية: متى تبني ومتى تشتري، ومتى تختار monolith أو microservices، وكيف تتجنّب التصميم الذي تمليه السيرة الذاتية.

  • دليل اختيار المورّد

    كيف تختار شريك التطوير المناسب، وكالةً كان أو مستقلاً أو فريقاً داخلياً، دون أن تدفع أكثر من اللازم أو تنتهي بمنتج نصف مكتمل.

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الأحدث من المكتبة

الموارد

عرض الكل
  • دليل شراء البرمجيات

    إطار عمل قابل للتكرار لشراء البرمجيات دون أن تهدر ستة أشهر ومليون دولار على المنصة الخاطئة.

  • دليل قرارات البنية التقنية

    إطار عملي لاختيار حزمتك التقنية: متى تبني ومتى تشتري، ومتى تختار monolith أو microservices، وكيف تتجنّب التصميم الذي تمليه السيرة الذاتية.

  • دليل اختيار المورّد

    كيف تختار شريك التطوير المناسب، وكالةً كان أو مستقلاً أو فريقاً داخلياً، دون أن تدفع أكثر من اللازم أو تنتهي بمنتج نصف مكتمل.

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • الموارد
  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا

قانوني

  • سياسة الخصوصية
  • شروط الخدمة
  • سياسة ملفات تعريف الارتباط

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • الموارد
  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا
قانونيسياسة الخصوصيةشروط الخدمةسياسة ملفات تعريف الارتباط
TECHSY
© 2026 Techsy. جميع الحقوق محفوظة.