
Grok 4.6 مقابل Grok 4.5: أجرينا 80 استدعاء API يوم الإطلاق – نتيجة متطابقة 40/40 بفاتورة 1.38×
كلّفنا Grok 4.6 مبلغ $0.2992 لإنهاء 40 مهمة مُقيَّمة. أما Grok 4.5 فكلّف $0.2174 لنفس الأربعين مهمة، وأعاد الإجابات نفسها.
قسنا ذلك في 12 أغسطس 2026، بعد ساعات من إطلاق SpaceXAI (المعروفة سابقًا باسم xAI) للنموذج. نفس بطاقة الأسعار: $2 لكل مليون رمز إدخال، $6 للإخراج. نفس النتيجة: 40/40 مقابل 40/40. الفارق هو 1.90× من متوسط رموز الإخراج في 4.6، ما ينعكس في فاتورة أكبر بنسبة 38%.
ما الذي أطلقته SpaceXAI في 12 أغسطس
أطلقت SpaceXAI نموذج Grok 4.6 في 12 أغسطس 2026 بسعر $2 لكل مليون رمز إدخال و$6 للإخراج، أي نفس بطاقة أسعار Grok 4.5. صدر النموذج الساعة 08:56 بتوقيت المحيط الهادئ (PT) بحسب 9to5Mac، ويركّز الإعلان الرسمي (اطّلعنا عليه بتاريخ 2026-08-12) على البرمجة الوكيلية (agentic coding) دون أن ينشر أي رقم يخص تكلفة التشغيل أو زمن الاستجابة أو استهلاك الرموز.
- توفّر النموذج في اليوم نفسه باسم
grok-4.6على واجهة SpaceXAI API وباسمx-ai/grok-4.6على OpenRouter. - نافذة سياق بحجم 500K رمز، دون تغيير عن Grok 4.5.
- $2/M للإدخال، $6/M للإخراج، بالإضافة إلى نسخة سريعة بضعف السعر.
- درجة 61 على مؤشر Artificial Analysis Intelligence Index، تصفه الشركة المصنّعة بأنه يوازي
GPT-5.6 Sol. - مقارنة نوعية واحدة مع 4.5: نتائج أولى أقوى في المشاريع البصرية والتفاعلية.
مقال Cursor الذي نُشر يوم الإطلاق يبدو وكأنه تحقّق مستقل من طرف ثالث، لكنه ليس كذلك: وافقت SpaceX على شراء الشركة المطوّرة لـCursor، وهي Anysphere، بصفقة أسهم بقيمة $60B في 16 يونيو 2026.
هل يجب أن تنتقل إلى Grok 4.6؟
ابقَ على 4.5 للأعمال المُهيكلة الروتينية: أعادت استدعاءاتنا الـ80 إجابات مطابقة تمامًا مقابل 1.38× من التكلفة. بطاقة الأسعار متطابقة حرفيًا (byte-identical) على صفحتَي النموذج في OpenRouter، لذا لا يمكن لأي صفحة أسعار أن تنبّهك. لكن عدد الرموز يستطيع ذلك.
| المقياس | Grok 4.6 | Grok 4.5 |
|---|---|---|
| مؤشر AA Intelligence Index | 61 | 56 |
| السعر لكل مليون (إدخال / إخراج) | $2 / $6 | $2 / $6 |
| إدخال مخزَّن مؤقتًا لكل مليون | $0.50 | $0.30 |
| المهام المُجتازة (من عندنا، 80 استدعاء) | 40/40 | 40/40 |
| متوسط رموز الإخراج (من عندنا) | 409 | 215 |
| التكلفة للإجابة نفسها (مقاسة) | $0.2992 | $0.2174 |
| زمن الاستجابة الوسيط (من عندنا) | 5.25 s | 4.17 s |
| اختر هذا إذا | أعمال وكيلية طويلة الأفق | استدعاءات مُهيكلة قصيرة بحجم كبير |
الصفوف المُعلَّمة بـ«من عندنا» هي بياناتنا نحن، قِيست يوم الإطلاق؛ أما صفوف المؤشر والتخزين المؤقت فهي بيانات Artificial Analysis، اطّلعنا عليها بتاريخ 2026-08-12.
بطاقة أسعار متطابقة، و1.90× من الرموز، وبالتالي فاتورة أكبر بنحو 1.38× مقابل الإجابات نفسها. هذا هو جوهر سؤال grok 4.6 مقابل grok 4.5 بالنسبة لمعظم حركة الإنتاج الفعلية: نفس السعر لكل رمز، لكن فاتورة مختلفة.
ماذا أظهرت فعليًا استدعاءات API الثمانون يوم الإطلاق
عبر 80 استدعاء يوم الإطلاق بدرجة حرارة صفر (temperature: 0)، سجّل كلا النموذجين 40/40، بينما استهلك 4.6 من متوسط رموز الإخراج 1.90× أكثر.
أرسلنا كل موجِّه (Prompt) مرتين، مرة إلى x-ai/grok-4.6 ومرة إلى x-ai/grok-4.5، مقيسة عبر OpenRouter بدرجة temperature: 0. الجولة الأولى (24 استدعاء) كانت سهلة: مهام مخطط JSON التي قيّمناها، وعملية حساب سعر، وإصلاح خلل في Python، ومهمة كتابة مقيّدة. الجولة الثانية (24 استدعاء) أصبحت أصعب بعد أن تشبّعت الجولة الأولى: لغز جدولة، وفخّ تحويل وحدات، ومهمة استرجاع إبرة من نص بطول 402 سطر مع عنصر تمويه REVOKED، ومهمة مواصفات يجب أن يحتوي فيها retry_on على 429 و503 دون 500. الجولة الثالثة (32 استدعاء) هي الضابطة أدناه. كل أداة تقييم حتمية؛ لا شيء يُقيَّم بواسطة نموذج لغوي. السكربتات هي grok_bench.py وgrok_bench_hard.py وgrok_bench_effort.py؛ والمخرجات الخام في benchmark-raw.json وbenchmark-hard-raw.json وbenchmark-effort-raw.json. إجمالي الإنفاق: $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| جولة الجهد الافتراضي | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1، سهلة (24 استدعاء) | 12/12، 468 رمز إخراج وسيط | 12/12، 241 رمز |
| 2، صعبة (24 استدعاء) | 12/12، 493 رمز إخراج وسيط | 12/12، 332 رمز |
الرأي السائد قبل الإطلاق، وهو منشور على X بقلم @haider1 بتاريخ 11 أغسطس ونُسخ عبر مدونات التجميع، قال إن 4.6 سيحافظ على سرعة وكفاءة رموز 4.5. لكن SpaceXAI لم تدّعِ ذلك قط؛ إعلانها لا يتضمن أي ادّعاء بشأن الرموز على الإطلاق. أشارت Unite.AI يوم الإطلاق إلى أنه «لم يؤكّد أي تقييم مستقل بعد» ادّعاءات النموذج، وها هو التقييم. استخدم Grok 4.6 وسيطًا قدره 409 رموز إخراج مقابل 215 لدى Grok 4.5 على نفس الموجِّهات بدرجة حرارة صفر، و365 رمز استدلال وسيط مقابل 200، وإجمالي 27,565 مقابل 13,929. مهما كسبه 4.6، فإنه يدفع ثمنه بـ1.90× من متوسط رموز الإخراج.
الذيل الإحصائي هو الأكثر إيلامًا
الموجِّه نفسه، بدرجة temperature: 0، وثلاث محاولات لمهمة unit_trap في جولات الجهد الافتراضي:
| المحاولة | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
تباين قدره 6.6× في 4.6 مقابل 1.8× في 4.5، على مدخلات متطابقة حرفيًا (byte-identical). عند ضبط مهلة زمنية أو ميزانية رموز لكل طلب، يهم هذا الذيل الإحصائي أكثر من الوسيط، وهو حجة إضافية على متى يكون النموذج الأحدث هو الخيار الافتراضي الخاطئ.
المهمة الوحيدة التي سارت في الاتجاه المعاكس
في مهمة constraint_schedule، كان 4.6 أسرع عند الوسيط في جولات الجهد الافتراضي: 26.38 s مقابل 34.21 s، وبرموز إخراج أقل أيضًا (1,644 مقابل 1,710). الاكتفاء بذكر الأرقام التي تخدم فرضية معيّنة هو ما يخصمه القراء ومحرك بحث Google من مصداقية أي تقرير.
هل الفرق في النموذج، أم في الإعداد الافتراضي؟
تثبيت reasoning_effort على القيمة نفسها في كلا النموذجين لا يُغلق الفجوة؛ بل يوسّعها، من 1.51× إلى 2.91×. تُدرج docs.x.ai (اطّلعنا عليها بتاريخ 2026-08-12) أربعة مستويات (low، medium، high، xhigh)، ولم تُحدَّد الجولتان 1 و2 أيًّا منها، ما يعني أن الفجوة قد تكون ناتجة عن إعداد افتراضي مضبوط مسبقًا عند الإطلاق. أما الجولة الثالثة فثبّتته صراحةً عبر 32 استدعاء.
| مستوى الجهد المطابَق | متوسط إخراج 4.6 | متوسط إخراج 4.5 | النسبة | الدقة |
|---|---|---|---|---|
low | 222 رمز | 147 رمز | 1.51× | 8/8 مقابل 8/8 |
high | 606 رمز | 208 رمز | 2.91× | 8/8 مقابل 8/8 |
لو انهارت الفجوة عند تطابق مستوى الجهد، لكان العنوان الصادق هو «إنه مجرد إعداد افتراضي». لكن هذا لم يحدث.
كيف تخفّض فاتورة رموز Grok 4.6؟
اضبط reasoning_effort على low وسينخفض متوسط إخراج 4.6 من 438 إلى 222 رمزًا، مع بقاء الدقة ثابتة عند 8/8. المهام الأربع نفسها في الحالتين: الرقم الافتراضي يجمع اثني عشر استدعاءً من الجولتين الأوليين، بينما رقم low يجمع ثمانية من الجولة الضابطة.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}هذا انخفاض بنسبة 49%، أي ما يعادل نحو $1.30 لكل ألف استدعاء بهذا الشكل عند سعر $6 لكل مليون رمز إخراج. معامل طلب واحد يخفّض تقريبًا إلى النصف فاتورة إخراج Grok 4.6 في الأعمال المُهيكلة الروتينية، دون أن يفقد أي شيء استطعنا قياسه. أربع مهام هي مجرد إشارة لا سياسة ثابتة: اختبرها على مزيج بياناتك الخاص أولًا.
ماذا تُظهر أدوات القياس لدى جهات أخرى
فوترت Artificial Analysis، على مجموعة تقييمها الخاصة، مبلغ $1,068.47 لتقييم Grok 4.6 مقابل $579.21 لـGrok 4.5. هذه أرقامهم، لا أرقامنا، مأخوذة من صفحتَي نموذج Grok 4.6 وGrok 4.5 على artificialanalysis.ai، اطّلعنا عليها بتاريخ 2026-08-12.
| المقياس (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | النسبة |
|---|---|---|---|
| مؤشر الذكاء | 61 | 56 | +5 نقاط |
| رموز الإخراج لتشغيل المؤشر | 72M | 60M | 1.20× |
| تكلفة تشغيل المؤشر | $1,068.47 | $579.21 | 1.84× |
| الزمن حتى أول رمز | 32.30 s | 8.68 s | 3.72× |
| سعر إصابة التخزين المؤقت لكل مليون | $0.50 | $0.30 | 1.67× |
رقمهم 1.84× يختلف عن رقمنا 1.38×، والسبب دالّ بحد ذاته: مزيج مهامهم أثقل، وإجماليهم يدمج رموز الإدخال بينما نعزل نحن رموز الإخراج فقط. أداتا قياس مختلفتان، لكن في الاتجاه نفسه.
أول من رصد صفّ التخزين المؤقت هو مستخدم Hacker News المعروف بـpzo في خيط الإطلاق (التعليق 49275740)، ويؤكّده كلا الصفحتين: ارتفاع بنسبة 67%، وهو ما يكلّف الأكثر في أعباء عمل الوكلاء طويلة التشغيل التي يستهدفها 4.6، حيث إعادة استخدام التخزين المؤقت هي بيت القصيد.
هل Grok 4.6 أفضل من Claude في البرمجة؟
من حيث الصحة، تعادلت النتائج: اجتاز كل من Grok 4.6 وClaude Sonnet 5 وClaude Opus 4.8 عشرًا من عشر مهام برمجية منفَّذة. هذا هو العنوان الرئيسي، وهو مكسب حقيقي بالنسبة لـGrok.
توقّفنا هنا عن تقييم النص. خمس مهام باختبارات وحدة مخفية، محاولتان لكل مهمة، أي 30 استدعاء: مطابقة semver بما فيها حالة ^0.x، وذاكرة تخزين مؤقت LRU بمدة صلاحية (TTL) بساعة صريحة، ودمج فترات زمنية متلامسة الحدود، ومحلِّل مدة زمنية يجب أن يرفض 1m30h و1.5h، واقتطاع آمن على مستوى الحرف الرسومي (grapheme) يجب ألّا يفصل علامة تشكيل مركّبة أو يقسّم رمز إيموجي. كل إجابة تُشغَّل داخل عملية فرعية (subprocess)، ولا تنجح إلا إذا تحقّقت كل التأكيدات (assertions). السكربت هو grok_vs_claude_coding.py، والمخرجات الخام في benchmark-coding-raw.json.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # the model never sees the tests| النموذج | مُجتاز | زمن الاستجابة الوسيط | متوسط رموز الإخراج | $/M للإخراج | التكلفة الإجمالية |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
تعادل الدقة هو الخبر. أما الفاتورة فهي المفاجأة: كان Grok 4.6 أبطأ بـ4.0× من Sonnet 5 وأبطأ بـ5.4× من Opus 4.8، مقابل 4.0× و4.9× من متوسط رموز الإخراج على التوالي. شهية الرموز هذه تلتهم ميزة السعر بالكامل. كلّف Grok 4.6 أكثر من Claude Opus 4.8 في هذه المهام الخمس رغم أن سعر رموز إخراجه أرخص بـ4.2×، لأنه أصدر 18,345 رمز إخراج مقابل 3,630 لدى Opus 4.8. أما مقابل Sonnet 5 فقد كلّف 1.96× أكثر، مع أن سعر Sonnet لكل رمز إخراج هو الأعلى بين الاثنين. بطاقة أسعار أرخص لا تعني نموذجًا أرخص، وهو الدرس نفسه الذي تُظهره أرقام مقارنة 4.6 مقابل 4.5 في قسم أعلاه.
رأي واحد، ونوسمه صراحةً بأنه رأي لا قياس: في مسارات عمل الإعلام والأتمتة المتعلقة بالمحتوى، اعتدنا تاريخيًا اختيار Grok على Claude، أساسًا بفضل استيعابه الأصلي لبيانات X ومرونته الأكبر في التعامل مع نصوص تسويقية. لا نملك أي اختبار معياري لذلك ولا نقدّم أحدًا. أما في العمل البرمجي الذي نستطيع تقييمه بشكل حتمي، فالثلاثة متعادلون في الدقة، ويدفع Grok أربعة إلى خمسة أضعاف عدد الرموز.
ما الذي لم نختبره
تشبّعت مهامنا عند 40/40، لذا فإن هذا القياس يعكس التكلفة على الأعمال الروتينية، لا القدرة على المهام الوكيلية التي ضبطت SpaceXAI النموذج من أجلها. خمسة قيود:
- تعادل الدقة أثرٌ ناتج عن السقف الإحصائي (ceiling effect)، وليس دليلًا على أن 4.6 ليس أذكى. نفدت صعوبة مهامنا قبل أن تنفد قدرات النموذجين، ولا تختبر هذه المهام حدود البرمجة الوكيلية طويلة الأفق.
- محاولتان إلى ثلاث لكل مهمة. يكفي هذا لتحديد الاتجاه وسرد قصة التباين، لا لحساب فاصل ثقة إحصائي.
- قِسنا عبر OpenRouter، لا عبر نقطة النهاية الخاصة بـSpaceXAI مباشرة. التوجيه (Routing) يضيف زمن استجابة ليس من مسؤولية النموذج نفسه، ولهذا فإن عدد الرموز المستقل عن مزوّد الخدمة هو ما يحمل وزن الحجة.
- مهمة واحدة سارت عكس الفرضية، وهي
constraint_schedule، حيث كان 4.6 أسرع عند الوسيط. - تشبّعت مقارنة Claude أيضًا. خمس مهام برمجية، وسجّلت النماذج الثلاثة
10/10، لذا فإن هذه المقارنة تفصل التكلفة عن زمن الاستجابة لكنها لا تقول شيئًا عن أي النماذج أقوى عند السقف.
كذلك لم نختبر ما تدّعيه SpaceXAI فعليًا: نتائج أولى أقوى في المشاريع البصرية والتفاعلية. لا توجد أداة تقييم حتمية لذلك، لذا لسنا في موقع يسمح لنا بالطعن فيه. لا تربطنا أي علاقة تجارية بـSpaceXAI، ودفعنا ثمن كل استدعاء من جيبنا الخاص.
من يجب أن يُحدِّث النموذج، ومن يجب أن يبقى على 4.5؟
حدِّث النموذج إذا كانت حركة استخدامك تتمثل في أعمال وكيلية طويلة الأفق؛ وابقَ على 4.5 إذا كانت استدعاءات مُهيكلة قصيرة بحجم كبير. على محور المؤشر الذي تعتمده كل المقالات الأخرى المنشورة يوم الإطلاق، يفوز 4.6 ببطاقة أسعار متطابقة. أما على أساس التكلفة المقاسة لكل إجابة صحيحة، فإن معادلة grok 4.6 مقابل grok 4.5 تنقلب في الاتجاه المعاكس.
| حِمل العمل لديك | الاختيار | ما الذي يقلب الموازين |
|---|---|---|
| استدعاءات مُهيكلة أو JSON بحجم كبير | Grok 4.5 | مهمة يفشل فيها 4.5 فعليًا |
| برمجة وكيلية طويلة الأفق | Grok 4.6 | لا شيء قسناه؛ هذه هي حالته الخاصة |
| مسارات مستخدمين حسّاسة لزمن الاستجابة | Grok 4.5 | استدعاء الذيل عند 81.61 s، إلى أن تحدّ من مستوى الجهد |
| جلسات إعادة استخدام تخزين مؤقت مكثّفة | احسب الأرقام بنفسك | $0.50 مقابل $0.30 لكل مليون قد تطغى على فجوة الرموز |
| مستخدم بالفعل لـ4.6 | ابقَ عليه، لكن اضبط مستوى الجهد | تركه دون ضبط يكلّف 49% إخراجًا إضافيًا |
لا يزال Grok 4.5 الطريقة الأرخص للحصول على الإجابة نفسها في الأعمال المُهيكلة الروتينية. هذا لا يعني أن 4.6 أسوأ: فهو يحقّق مكاسبه عبر التفكير لوقت أطول، وفي استدعاءات الإنتاج اليومية تكون هذه المقايضة زيادة في التكلفة دون أي عائد في الدقة استطعنا رصده. حجة إضافية لصالح تثبيت إصدار محدد من النموذج داخل بنية الوكيل بدل متابعة latest.
ثلاثة سكربتات، ومفتاح OpenRouter واحد، وأقل من دولار من الرصيد – هذه هي التكلفة الكاملة للتحقق مما إذا كانت حركة استخدامك تشبه حركتنا.
الأسئلة الشائعة
هل يوجد Grok 5 أو Grok 5.6؟
لا وجود لأي منهما. اعتبارًا من 12 أغسطس 2026، يظل Grok 4.6 هو أحدث نموذج صدر فعليًا. أُشير إلى Grok 4.7 كموعد متوقع لأواخر أغسطس أو أوائل سبتمبر، ولم يكن قد صدر بعد وقت كتابة هذا المقال؛ وأي إصدار بعده مستهدَف لنهاية 2026. أما «5.6» فهو على الأرجح GPT-5.6 Sol، وهو نموذج من OpenAI يُقارَن به Grok 4.6 في الاختبارات المعيارية.
هل تكلفة Grok 4.6 أعلى من Grok 4.5؟
نفس بطاقة الأسعار، $2/M للإدخال و$6/M للإخراج على كليهما. أعادت استدعاءاتنا المقاسة الثمانون إجابات مطابقة تمامًا مقابل 1.38× من التكلفة الإجمالية، لأن 4.6 يصدر 1.90× من متوسط رموز الإخراج. كذلك ارتفع سعر الإدخال المخزَّن مؤقتًا من $0.30 إلى $0.50 لكل مليون.
هل Grok 4.6 أبطأ من Grok 4.5؟
عند الوسيط لدينا، أبطأ بـ1.26×: 5.25 s مقابل 4.17 s عبر 40 استدعاء لكل نموذج. وعند أسوأ استدعاء، الفارق 2.27×: 81.61 s مقابل 35.98 s. تُبلغ Artificial Analysis، في قياس منفصل، عن زمن حتى أول رمز قدره 32.30 s مقابل 8.68 s. لاحظ أننا قسنا عبر OpenRouter، لذا يضيف التوجيه زمن استجابة ليس النموذج نفسه مسؤولًا عنه.
ما حجم نافذة سياق Grok 4.6 وكيف تستدعيه؟
500K رمز، دون تغيير عن Grok 4.5. المعرّف هو x-ai/grok-4.6 على OpenRouter وgrok-4.6 على واجهة SpaceXAI API، مع نسخة سريعة بضعف السعر القياسي. اضبط reasoning_effort صراحةً بدل ترك القيمة الافتراضية تُطبَّق تلقائيًا؛ فالقيمة الافتراضية هي high، وفي مهامنا الضابطة الأربع أدى خفضها إلى low إلى تقليص رموز الإخراج إلى النصف دون أن يكلّف ذلك إجابة صحيحة واحدة.
هل يجب أن أبقى على Grok 4.5؟
بالنسبة للأعمال المُهيكلة بحجم كبير، نعم: فقد أعاد الإجابات نفسها بتكلفة أقل عبر جميع الاستدعاءات الثمانين. أما بالنسبة للبرمجة الوكيلية طويلة الأفق، وهي حِمل العمل الذي ضبطت SpaceXAI نموذج 4.6 من أجله، فلا تحسم مهامنا هذا السؤال ولم نختبره. قِس مزيج بياناتك الخاص بنفسك.