
أصدرت Google DeepMind نموذج Gemma 4 12B في 3 يونيو 2026. وبعد ثلاثة أيام، الرقم الذي يتداوله الجميع هو درجة MMLU Pro: 77.2%. هذا يتجاوز Gemma 3 27B الصادر العام الماضي، الذي حقق 67.6% على الاختبار ذاته. نموذج بـ 12 مليار معامل يتفوق على نموذج بـ 27 ملياراً؟ مع استهلاك أقل من نصف الذاكرة؟ نعم. وتغيّر الترخيص أيضاً. يصدر Gemma 4 تحت رخصة Apache 2.0، ما يعني أن الاستخدام التجاري مباح دون أي قيود. يتيح نافذة سياق بـ 256,000 رمز ويعمل في نحو 6.6 جيجابايت من VRAM بعد الضغط. هذه النقطة الأخيرة هي الجوهر لمعظمنا: النموذج يعمل على بطاقة رسومات متوسطة المستوى.
أبرز النقاط
- Gemma 4 12B (صدر 3 يونيو 2026) يحقق 77.2% على MMLU Pro، متفوقاً على Gemma 3 27B (67.6%).
- يعمل في ~6.6 جيجابايت VRAM عند Q4KM، مناسباً لبطاقات 8 جيجابايت؛ 16 جيجابايت توفر هامشاً مريحاً.
- رخصة Apache 2.0 (الاستخدام التجاري مباح)، سياق 256K رمز، إدخال صوت وصورة أصلي، معمارية بلا encoder.
- أمر واحد للتشغيل:
ollama run gemma4:12b(تنزيل 7.6 جيجابايت).
ما هو Gemma 4 12B؟
Gemma 4 12B نموذج ذو أوزان مفتوحة بـ 12 مليار معامل من Google DeepMind، صدر في 3 يونيو 2026 تحت رخصة Apache 2.0. هو نموذج متعدد الوسائط موحّد بلا encoder: يستقبل النصوص والصور والصوت الأصلي، ويُخرج نصاً. يتيح نافذة سياق بـ 256,000 رمز ويدعم 140 لغة.
النسخة الموجّهة بالتعليمات التي ستُشغّلها فعلياً تُسمى gemma-4-12B-it (الـ "it" اختصار لـ instruction-tuned، وهي النسخة الجاهزة للمحادثة). يبلغ إجمالي معاملاتها 11.95 مليار، أي أن "12B" تقريب طفيف للأعلى. تصل بيانات التدريب إلى يناير 2025.
إليك ما يجعله مثيراً للاهتمام: Gemma 4 12B هو أول Gemma متوسط الحجم يدعم إدخال الصوت الأصلي. لا يوجد encoder صوتي منفصل مُضاف. تُسقَط موجات الصوت الخام مباشرة في النموذج. الأمر ذاته ينطبق على الصور. هذا الاختيار المعماري هو سبب بقائه صغيراً بما يكفي للعمل على بطاقة مستهلك واحدة، وسنشرح السبب بعد قليل.
تريد الصورة الكبيرة أولاً؟ دليلنا حول تشغيل النماذج المفتوحة على جهازك الخاص يغطي أساسيات الإعداد إن كنت جديداً على النماذج المحلية. المنشور الرسمي لـ Google عن الإطلاق يحتوي على الإعلان الكامل.
مواصفات Gemma 4 12B دفعة واحدة
كل شيء مُتحقق منه في جدول واحد. بلا تخمين.
| المواصفة | القيمة |
|---|---|
| الاسم الكامل | Gemma 4 12B (gemma-4-12B-it) |
| عدد المعاملات | 11.95 مليار (~12B) |
| الرخصة | Apache 2.0 (الاستخدام التجاري مباح) |
| نافذة السياق | 256,000 رمز |
| الوسائط | نص + صورة + صوت أصلي كمدخلات، نص كمخرج |
| المعمارية | موحّدة بلا encoder، 48 طبقة، انتباه هجين |
| اللغات المدعومة | 140 |
| تاريخ انتهاء بيانات التدريب | يناير 2025 |
| وسم Ollama | gemma4:12b (تنزيل 7.6 جيجابايت) |
| وسم Apple Silicon | gemma4:12b-mlx |
| أخذ العينات الموصى به | temperature 1.0، top_p 0.95، top_k 64 |
ملاحظة حول أخذ العينات: التزم بالإعدادات الموصى بها temperature=1.0, top_p=0.95, top_k=64 إلا إن كان لديك سبب وجيه. تتصرف نماذج Gemma بشكل غريب عند درجات حرارة منخفضة، فلا تخفّضها إلى 0.2 كما تفعل مع نماذج أخرى.
كيف تعمل المعمارية الخالية من Encoder؟
"بلا encoder" يعني أنه لا يوجد نموذج منفصل يحوّل الصور أو الصوت قبل وصولها إلى نموذج اللغة. تُسقَط رقع الرؤية وموجات الصوت الخام مباشرة في فضاء التضمين المشترك عبر طبقات خطية رفيعة. معظم النماذج متعددة الوسائط تُضيف encoder رؤية ثقيل إلى النموذج اللغوي. Gemma 4 12B يتجاوز ذلك، وهذا سبب ملاءمته لـ 16 جيجابايت.
فكّر في الأمر كمقارنة بين مترجم ثنائي اللغة من المولد وآخر يستعين بمترجم خارجي. النهج القديم يستأجر مترجماً منفصلاً (الـ encoder) لتحويل الصور إلى لغة يفهمها النموذج، ثم يُمررها. Gemma 4 12B ثنائي اللغة منذ البداية. بيانات الصوت والصورة تتحدث لغة النموذج مباشرة عبر طبقة إسقاط خفيفة بدلاً من encoder ضخم.
تحت الغطاء يوجد 48 طبقة مع انتباه هجين. معظم الطبقات تستخدم نافذة انزلاقية بـ 1024 رمز (رخيصة ومحلية)، تتخللها طبقات انتباه عالمي متفرقة ترى السياق الكامل. هذا المزيج هو ما يجعله قادراً على التعامل مع سياق 256K دون إذابة بطاقتك الرسومية.

العائد العملي: معاملات أقل مُنفقة على الـ encoders تعني أن ميزانية VRAM لديك تذهب إلى التفكير الفعلي. هذه هي المقايضة التي تجعل نموذج 12B يُحقق هذا الأداء المتجاوز لحجمه.
معايير Gemma 4 12B: الأرقام الحقيقية
العنوان الرئيسي صامد: Gemma 4 12B يحقق 77.2% على MMLU Pro، متفوقاً على Gemma 3 27B (67.6%) على الاختبار ذاته، مع استهلاك أقل من نصف VRAM. هذه أرقام رسمية للنموذج الموجّه بالتعليمات (-it) من Google، ليست تقديرات مجتمعية. إليك المجموعة الكاملة.
| المعيار | Gemma 4 12B | Gemma 3 27B (مرجع) |
|---|---|---|
| MMLU Pro | 77.2% | 67.6% |
| GPQA Diamond | 78.8% | — |
| MMMU Pro | 69.1% | — |
| AIME 2026 (بدون أدوات) | 77.5% | — |
| LiveCodeBench v6 | 72.0% | — |
| Codeforces ELO | 1659 | — |
نموذج 12B يتفوق الآن على نموذج 27B الرائد من العام الماضي في MMLU Pro: 77.2% مقابل 67.6%. هذا النوع من القفزة الجيلية يجعلك تُعيد حساب متطلبات الأجهزة.

ملاحظتان صريحتان. أولاً، الشرطات تعني أن Google لم تنشر رقم Gemma 3 27B لتلك الصفوف، لذا تبقى الخانات فارغة بدلاً من ملئها بتخمينات. ثانياً، كل درجة هنا للنموذج الموجّه بالتعليمات. أرقام النموذج الأساسي مختلفة. يمكنك التحقق من كل هذه الأرقام على صفحة النموذج في HuggingFace وصفحة DeepMind للنموذج.
كم من VRAM يحتاج Gemma 4 12B؟
يحتاج Gemma 4 12B نحو 6.6 جيجابايت من VRAM عند ضغط Q4KM، ما يعني أنه يعمل على بطاقة 8 جيجابايت. لهامش مريح، خاصة إذا أردت استخدام جزء من سياق الـ 256K، استهدف 16 جيجابايت من VRAM أو الذاكرة الموحدة. يعمل على لابتوب. أجهزة Mac بشريحة M تُديره بسلاسة عبر الذاكرة الموحدة.
الضغط هو ببساطة ضغط لأوزان النموذج. أرقام بدقة أقل، حجم ملف أصغر، دقة أقل قليلاً. إليك كيف تتوزع المستويات الشائعة.
| مستوى الضغط | VRAM التقريبي | الجودة | الأفضل لـ |
|---|---|---|---|
| Q4_K_M | ~6.6 جيجابايت | قريبة من الكاملة، فقدان طفيف | الخيار المنطقي الافتراضي؛ يناسب بطاقات 8 جيجابايت |
| Q5_K_M | ~8.5 جيجابايت | أفضل قليلاً من Q4 | بعض VRAM إضافي، تريد دقة أعلى |
| Q8 | ~13 جيجابايت | جودة كاملة فعلياً | بطاقات 16 جيجابايت+، أقصى دقة |
| QAT Q4_0 | ~6.6 جيجابايت | دقة شبه كاملة بحجم Q4 | أفضل جودة لكل جيجابايت (صدر 5 يونيو) |

إن كنت تختار الأجهزة حول هذا النموذج، تغطي مراجعتنا لأدوات تشغيل النماذج المحلية أي الخلفيات تستخرج أقصى أداء من بطاقة بعينها. الملخص المختصر: بطاقة 12 جيجابايت تُشغّل Q4 بمساحة كافية، وبطاقة 8 جيجابايت تُشغّل Q4 إذا أبقيت حجم السياق معقولاً.
سرعة Gemma 4 12B: tokens/sec على أجهزة حقيقية
ما مدى سرعته؟ يعتمد ذلك على بطاقتك ومستوى الضغط والخلفية التي تستخدم، لذا بدلاً من رقم واحد جمعنا الأرقام المنشورة من أطراف ثالثة في مكان واحد. هذه أرقام مُبلَّغ عنها من مختبري المجتمع والبائعين، منسوبة لكل مصدر. ليست أرقام مختبرنا الخاص.
| الجهاز | مستوى الضغط | tokens/sec المُبلَّغ عنه | المصدر |
|---|---|---|---|
| RTX 3060 (6 جيجابايت) | Q4_K_M | حجم VRAM ~6.6 جيجابايت، يعمل محلياً (tok/s غير مُبلَّغ بدقة) | runaiathome |
| RTX 4090 (24 جيجابايت) | Q4_K_M | نطاق الدردشة الفورية (tok/s محدد غير مُبلَّغ بعد) | apxml / المجتمع |
| Apple M-series (موحّد) | mlx / Q4 | يعمل عبر gemma4:12b-mlx (tok/s غير واسع الانتشار بعد) | Ollama / المجتمع |
لنكن صريحين حول ما تقوله البيانات المتاحة للعموم حالياً. أكد runaiathome تشغيل النموذج على RTX 3060 بـ 6 جيجابايت داخل حجم Q4KM البالغ ~6.6 جيجابايت، وهو أكثر تقرير أجهزة منشور تحديداً حتى الآن. تحدد صفحة المواصفات لـ apxml وصفحة مكتبة Ollama أن النموذج يعمل محلياً على RTX 4090 بـ 24 جيجابايت عند Q4 في نطاق الدردشة الفورية المريح، لكن رقم tok/s مستداماً ودقيقاً لم يُنشر بعد لتلك البطاقة. نسخة Apple Silicon gemma4:12b-mlx موجودة وتعمل، لكن أرقام tok/s موثوقة لم تظهر بعد ثلاثة أيام من الإطلاق.
ما يعنيه هذا بحسب الفئة: على بطاقة 6 جيجابايت كـ RTX 3060، توقع أن يُحمَّل ويعمل للدردشة المحلية، مع إبقاء نافذة السياق معقولة. على RTX 4090 بـ 24 جيجابايت عند Q4KM، تضع التقارير المنشورة الأداء في نطاق الدردشة الفورية المريح. على Apple Silicon، نسخة MLX تعمل لكن أرقام المعايير لا تزال تتراكم.
هذه أرقام أطراف ثالثة منشورة وليست من مختبرنا الخاص، لذا تعامل معها كتقديرات تقريبية. سرعة tok/s لديك تعتمد على طول المطالبة وحجم السياق وإصدار الخلفية. المصادر: صفحة مكتبة Ollama وapxml وrunaiathome. مع تراكم مزيد من معايير المجتمع خلال الأسبوعين القادمين، سنُحدّث هذا الجدول.
كيف تُشغّل Gemma 4 12B محلياً؟
المسار الأقصر: ثبّت Ollama، نفّذ أمراً واحداً، انتهى الأمر. ollama run gemma4:12b يسحب النموذج البالغ 7.6 جيجابايت ويفتح لك موجه دردشة. لا ملفات إعداد، لا بيئة Python. إن أردت مزيداً من التحكم أو كنت على Apple Silicon، إليك أربعة مسارات أخرى أدناه.
1. Ollama (الافتراضي السهل). سحب وتشغيل في سطرين:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp مع GGUF. إن أردت ضغطاً محدداً، وجّه llama.cpp إلى GGUF على HuggingFace. GGUF هو تنسيق الملف الذي يستخدمه llama.cpp للأوزان المضغوطة:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX على Apple Silicon. تحصل أجهزة Mac بشريحة M على نسخة MLX مخصصة تستخدم إطار عمل Apple بدلاً من CUDA:
ollama run gemma4:12b-mlx4. LM Studio (واجهة رسومية، بلا طرفية). تُفضّل تطبيقاً للسطح المكتبي؟ افتح LM Studio، اضغط على تبويب البحث، واكتب gemma 4 12b. اختر GGUF بمستوى Q4KM ونزّله. LM Studio يتولى الباقي، بما في ذلك تشغيل خادم محلي.
5. الاستعلام عبر API. يكشف Ollama عن نقطة نهاية متوافقة مع OpenAI على المنفذ 11434، لذا يعمل الكود الموجود مع تعديل بسيط على عنوان URL الأساسي:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'بمجرد تشغيله على سطر الأوامر، ستحتاج على الأرجح لواجهة حقيقية. يمكنك تغليفه بواجهة مشابهة لـ ChatGPT باستخدام Open WebUI في نحو خمس دقائق. جديد على كل هذا؟ ابدأ بـ دليل الإعداد الكامل للنماذج المحلية. للتوصيات الرسمية لأخذ العينات ومسارات التشغيل، راجع ai.google.dev ووثائق Ollama.
أي مستوى ضغط تستخدم مع Gemma 4 12B؟
لمعظم الناس، Q4KM هو الخيار المنطقي الافتراضي: نحو 6.6 جيجابايت من VRAM، جودة شبه كاملة، ويناسب بطاقة 8 جيجابايت. إن كان لديك 16 جيجابايت أو أكثر وتريد أقصى دقة، انتقل إلى Q8. وإن أردت أفضل جودة لكل جيجابايت متاحة الآن، انظر إلى نقاط تفتيش QAT Q4_0 الجديدة.
إليك زاوية الجِدّة التي لم يتطرق إليها أحد بعد. في 5 يونيو 2026، بعد يومين فقط من الإطلاق، أصدرت Google نقاط تفتيش QAT Q4_0 (Quantization-Aware Training) جانباً مع تنسيق جوال جديد. QAT يعني أن النموذج دُرّب مع مراعاة الضغط، لذا يحافظ على جودة شبه كاملة (near-FP) بحجم Q4. نفس ~6.6 جيجابايت، مع فقدان دقة أقل ملحوظية من Q4 القياسي بعد التدريب. إن كنت محدود VRAM لكنك حساس للجودة، فهذا خيارك.
دليل سريع للقرار:
- بطاقة 8 جيجابايت، تريد البساطة: Q4KM.
- بطاقة 8 جيجابايت، تريد أفضل جودة بهذا الحجم: QAT Q4_0.
- بطاقة 16 جيجابايت+، تريد أقصى دقة: Q8.
- بين الخيارين، بعض VRAM إضافي: Q5KM.
يمكنك قراءة منطق Google في إعلان QAT. الخلاصة: Q4KM كافٍ، QAT Q4_0 أفضل بالحجم ذاته، ولا تحتاج Q8 إلا إذا كانت الدقة أهم من الذاكرة.
Gemma 4 12B مقابل Gemma 3 12B مقابل Qwen 3.5: هل الترقية تستحق؟
نعم، الترقية من Gemma 3 12B تستحق إذا كنت تهتم برخصة Apache 2.0، أو إدخال الصوت الأصلي، أو نافذة السياق 256K، أو القفزة في MMLU Pro. أمام Qwen 3.5 الأمر أقل وضوحاً. Gemma 4 12B يفوز في رخصة الاستخدام وإدخال الصوت الأصلي، لكن Qwen 3.5 يتصدر بعض صفوف المعايير لفئة 12B. اختر بناءً على احتياجاتك الفعلية، لا العنوان الرئيسي.
| الميزة | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (فئة 12B) |
|---|---|---|---|
| الرخصة | Apache 2.0 | رخصة Gemma مخصصة | Apache 2.0 |
| السياق | 256K | 128K | حتى 256K |
| الوسائط | نص + صورة + صوت | نص + صورة | نص + صورة |
| صوت أصلي | نعم | لا | لا |
| MMLU Pro | 77.2% | أقل | تنافسي، يفوز في بعض الصفوف |
| VRAM عند Q4 | ~6.6 جيجابايت | ~6.6 جيجابايت | ~6.6 جيجابايت |
تغيير الرخصة وحده يبرر الانتقال من Gemma 3 12B لكثير من الفرق. صدر Gemma 3 تحت رخصة Google المخصصة مع قيود استخدام؛ Gemma 4 على Apache 2.0 مباشرةً. إن كنت تُحجم عن Gemma لأسباب تجارية، فقد زال هذا الحاجز.
أمام Qwen 3.5، كن صريحاً مع نفسك. Qwen 3.5 قوي فعلاً ويتفوق على Gemma 4 12B في صفوف معينة من التفكير والبرمجة. إن لم يكن إدخال الصوت والرخصة المتساهلة ضمن اعتباراتك، ابتكر كلاً منهما على مهمتك الخاصة قبل الالتزام. اطلع على مكانة Gemma 4 12B بين أفضل النماذج المفتوحة للصورة الأشمل. وبما أنه تحت Apache 2.0، يمكنك ضبطه الدقيق مع Unsloth تحت Apache 2.0 دون متاعب ترخيص.
متى لا تستخدم Gemma 4 12B؟
تجاوز Gemma 4 12B إن كنت بحاجة إلى استدلال على مستوى الحدود لا يوفره إلا نموذج أكبر بكثير، أو إن كان Qwen 3.5 يفوز في صف المعيار المحدد الذي يعتمد عليه حِمل عملك، أو إن كان مشروعك يعتمد بشكل كبير على أدوات الصوت التي لا تزال في مراحل نضوجها بعد ثلاثة أيام من الإطلاق. إنه نموذج 12B ممتاز، لا نموذج سحري.
Gemma 4 12B ليس دائماً الخيار الصحيح. إن كنت بحاجة إلى استدلال على مستوى الحدود، نموذج أكبر لا يزال يفوز. دعم الصوت الأصلي حقيقي ومثير للإعجاب، لكن الأدوات المحيطة به، والمكتبات ووحدات المساعدة وتكاملات الأطر، عمرها أيام وخشنة في بعض الجوانب. إن كنت تُطلق منتجاً يعتمد على الصوت هذا الأسبوع، اختبر بعناية قبل الرهان عليه.
بعض موانع الاستخدام الصريحة الأخرى. إن كنت تدمجه في وكيل، تحقق أولاً من موثوقية استدعاء الأدوات على مهامك، إذ يتفاوت السلوك الوكيل بحسب النموذج. إن كانت ميزتك السياق الطويل، تأكد من الاستفادة القصوى من نافذة السياق 256K بدلاً من افتراض أن حجم النافذة وحده يعني إخراجاً أفضل. وإن كنت تتخطى التشغيل المحلي نحو الخدمة الإنتاجية، يغطي مسار الخدمة الإنتاجية كلاً من vLLM وSGLang. إن كنت تنشر نماذج مفتوحة كـ Gemma 4 12B في الإنتاج، يمكننا مساعدتك.
عن الكاتب
مرت باتور غوربوز هو المؤسس المشارك لـ Techsy.io، حيث يبني الفريق وكلاء الذكاء الاصطناعي وأنظمة الأتمتة وخطوط أنابيب الصوت/SDR لعملاء B2B. يدرس في جامعة برمنغهام ويكتب عن مجموعة أدوات LLM التي يستخدمها فريق Techsy فعلياً في الإنتاج. تواصل معه على LinkedIn.
اختيار الأداة هو الجزء السهل. أما تشغيلها بموثوقية داخل منتج حقيقي فهو ما تتعثر عنده معظم الفرق، وهذا بالضبط ما يبنيه فريق تكامل الذكاء الاصطناعي لدينا لعملائنا، من خطوط RAG إلى الوكلاء المخصصين.
الأسئلة الشائعة
كيف أُشغّل Gemma 4 12B محلياً؟
ثبّت Ollama، ثم نفّذ ollama run gemma4:12b. هذا يسحب النموذج البالغ 7.6 جيجابايت ويفتح موجه دردشة. لا حاجة لبيئة Python أو ملفات إعداد. إن فضّلت تطبيقاً رسومياً، يعمل LM Studio أيضاً: ابحث عن gemma 4 12b في متصفح النماذج لديه ونزّل نسخة Q4KM.
ما متطلبات VRAM والأجهزة لـ Gemma 4 12B؟
يحتاج Gemma 4 12B نحو 6.6 جيجابايت من VRAM عند ضغط Q4KM، لذا يناسب بطاقة 8 جيجابايت. لهامش مريح، خاصة عند استخدام السياق الطويل، استهدف 16 جيجابايت من VRAM أو الذاكرة الموحدة. يعمل على اللابتوبات، بما في ذلك أجهزة Mac بشريحة M عبر الذاكرة الموحدة.
هل يعمل Gemma 4 12B على لابتوب بـ 16 جيجابايت؟
نعم، بسهولة. عند Q4KM يستخدم النموذج نحو 6.6 جيجابايت، مما يُبقي مساحة وفيرة على جهاز 16 جيجابايت. على لابتوبات Apple Silicon تتعامل الذاكرة الموحدة معه بشكل جيد عبر نسخة gemma4:12b-mlx. يمكنك حتى الترقية إلى ضغط Q8 على 16 جيجابايت لدقة أعلى.
هل Gemma 4 12B أفضل فعلاً من Llama أو Qwen 3.5؟
يعتمد على ما تقيسه. Gemma 4 12B يفوز في رخصة Apache 2.0 وإدخال الصوت الأصلي ونافذة السياق 256K، ويُسجّل 77.2% قوية على MMLU Pro. لكن Qwen 3.5 يتصدر بعض صفوف التفكير والبرمجة لفئة 12B. ابتكر كليهما على مهمتك الخاصة قبل اتخاذ القرار.
هل Gemma 4 12B أفضل من Gemma 3 12B؟
نعم. ينتقل Gemma 4 12B إلى رخصة Apache 2.0 المتساهلة، ويضيف إدخال الصوت الأصلي، ويضاعف نافذة السياق إلى 256K رمز، ويُسجّل تحسناً ملموساً في MMLU Pro. تغيير الرخصة وحده يبرر الترقية للمشاريع التجارية التي كانت محجوبة بشروط Gemma 3 المخصصة.
أي مستوى ضغط أستخدم مع Gemma 4 12B؟
Q4KM هو الخيار المنطقي الافتراضي بنحو 6.6 جيجابايت وجودة شبه كاملة. إن أردت أفضل جودة بالحجم ذاته، استخدم نقاط تفتيش QAT Q4_0 الجديدة الصادرة في 5 يونيو 2026، التي تحافظ على جودة شبه كاملة (near-FP) بحجم Q4. استخدم Q8 فقط إن كان لديك 16 جيجابايت+ وتحتاج أقصى دقة.
هل Gemma 4 12B مجاني للاستخدام التجاري؟
نعم. يصدر Gemma 4 12B تحت رخصة Apache 2.0 التي تبيح الاستخدام التجاري دون القيود التي كانت في رخصة Gemma 3 المخصصة. يمكنك بناء منتجات تجارية وضبطه الدقيق وإعادة توزيعه. تغيير الرخصة هذا أحد أبرز أسباب ترقية الفرق من Gemma 3.
هل يدعم Gemma 4 12B إدخال الصوت فعلاً؟
نعم. Gemma 4 12B هو أول Gemma متوسط الحجم يدعم إدخال الصوت الأصلي. بفضل تصميمه الخالي من encoder، تُسقَط موجات الصوت الخام مباشرة في النموذج بلا encoder صوتي منفصل. مع ذلك، الأدوات المحيطة به عمرها أيام، لذا اختبر بعناية قبل شحن ميزات تعتمد على الصوت في الإنتاج.
ما سرعة Gemma 4 12B على RTX 4090؟
تضع تقارير الأطراف الثالثة المنشورة Gemma 4 12B عند Q4KM في نطاق الدردشة الفورية المريح على RTX 4090 بـ 24 جيجابايت، وإن كان رقم tokens/sec مستداماً ودقيقاً لم يُنشر بعد ثلاثة أيام من الإطلاق. تتفاوت السرعة مع طول المطالبة وحجم السياق وإصدار الخلفية، لذا تعامل مع الأرقام المبكرة كتقديرات تقريبية.
من أين أُنزّل Gemma 4 12B؟
النموذج الموجّه بالتعليمات موجود على HuggingFace باسم google/gemma-4-12B-it، أو يمكنك سحبه عبر Ollama بالأمر ollama run gemma4:12b (تنزيل 7.6 جيجابايت). مستخدمو LM Studio يمكنهم البحث عن gemma 4 12b في متصفح النماذج بالتطبيق. لضغوط محددة، تتوفر ملفات GGUF من مستودعات المجتمع مثل Unsloth.