قفزة برمجية: Grok 4.6 يتفوق في اختبارات الأكواد الحديثة!
أطلقت شركة SpaceXAI نموذجها الجديد Grok 4.6 لتفتح بذلك بابًا جديدًا أمام الوكلاء المستقلين ومهام البرمجة الطويلة. ويأتي هذا الإصدار خليفة مُباشرة لـ Grok 4.5 الذي صدر قبل أسابيع قليلة فقط مع تركيز واضح على الثبات في المهام المُعقدّة والمُتعددة الخطوات.
وسجّل جروك 4.6 نقلة ملحوظة على مؤشر الذكاء الخاص بمنصة Artificial Analysis حيث قفز إلى 61 نقطة مُتساويًا مع GPT-5.6 Sol Max ومُتفوقًا على نموذج Kimi K3 الصيني، بينما يحتفظ كل من Claude Opus 5 وClaude Fable 5 بالصدارة العالمية.
- حقق جروك 4.6 قفزة كبيرة في اختبارات البرمجة والمهام المعقدة متعددة الخطوات.
- سجل 61 نقطة على مؤشر Artificial Analysis متساويًا مع GPT-5.6 Sol Max.
- رفع أداءه في DeepSWE وTerminal-Bench مع استمرار تفوق منافسين في بعض الاختبارات.
- يقدم 4 مستويات للتفكير وسعرًا يبدأ من 2 دولار لكل مليون رمز مدخل.
اقرأ أيضًا: Moonshot تطلق Kimi K3 أكبر نموذج ذكاء اصطناعي مفتوح الأوزان في العالم
أرقام اختبارات Grok 4.6 تكشف الفارق مع المُنافسين
توضح نتائج الاختبارات حجم التحسُّن الذي حققه الجيل الجديد مُقارنةً بسابقه، ويحقق النموذج قفزة تصل إلى 1753 نقطة في اختبار GDPval-AA v2 الخاص بالمهام المعرفية المُعقدّة، مُتقدمًا على Grok 4.5 الذي توقف عند 1526 نقطة فقط، كما ترصد النتائج ما يلي:
- يحقق 69.9% في اختبار CursorBench v3.2 الخاص بكفاءة البرمجة داخل بيئات التطوير الحقيقية.
- يقفز إلى 65.9% في اختبار DeepSWE v1.1 بزيادة قدرها 11.9 نقطة عن الإصدار السابق.
- يصل إلى 26% في اختبار Terminal-Bench v3.0، بعدما كان عند 15.7% فقط مع Grok 4.5.

وتظل بعض الفجوات قائمة أمام المُنافسين المُباشرين؛ حيث يتقدّم GPT-5.6 Sol Max بفارق واضح في اختبار DeepSWE بنسبة 73%، بينما يحافظ Claude Fable 5 على الصدارة في اختبار CursorBench بنسبة 70.5%.
قدرات Grok 4.6 في الوكلاء البرمجيين
يُركّز هذا التحديث على إبقاء وكلاء الذكاء الاصطناعي مُتماسكين عبر خطوات مُتتالية طويلة دون فقدان السياق أو التكرار غير المُجدي، ويستطيع المطورون الوصول إليه مُباشرةً عبر أداة Grok Build ومحرر الأكواد Cursor، إلى جانب واجهة برمجة التطبيقات ومنصات أخرى مثل OpenRouter وVercel وCloudflare.
ويمتلك النموذج 4 مُستويات من جهد التفكير تبدأ من المنخفض وتصل إلى مُستوى xhigh الجديد، وهذا يمنح المُطورين مُرونة أكبر في ضبط التوازن بين السرعة والدقة.
أرى أنّ تركيز الشركة على تثبيت النموذج في المهام الطويلة، بدلًا من مُلاحقة أرقام قياسية في كل اختبار مُنفرد، هو خطوة واقعية تخدم فرق التطوير أكثر من عناوين الصدارة المؤقتة.
سعر Grok 4.6 وحدود نافذة السياق

تبدأ تكلفة الاستخدام من سعر تنافسي يبلغ 2 دولار لكل مليون رمز مدخل و6 دولار لكل مليون رمز مخرج، مع خصم يصل إلى 0.50 دولار للرموز المُخزنة مؤقتًا، وهو رقم أعلى من 0.30 دولار المُعتمد سابقًا مع Grok 4.5.
وتحتفظ نافذة السياق بحجمها السابق عند 500 ألف رمز دون أي توسعة جديدة، وتكمن النقطة الحاسمة في حد الـ 200 ألف رمز؛ فبمجرد تجاوز الطلب لهذا الحد، تتضاعف الأسعار بالكامل لتصل إلى 4 دولار للمدخلات و12 دولار للمخرجات، وتُطبَّق الفئة الأعلى على كامل الطلب وليس على الجزء الزائد فقط.
وتضع مُقارنة Grok 4.6 وGPT-5.6 المطورين أمام مُعادلة دقيقة بين السعر والأداء، خاصةً مع تقارب النتائج في عدد من الاختبارات الأساسية.
ويمثل إطلاق جروك 4.6 مؤشرًا واضحًا على تسارع المُنافسة بين مُختبرات الذكاء الاصطناعي الكبرى خلال عام 2026، وتبقى الأسابيع القادمة كفيلة بكشف مدى تفوق النموذج الجديد في بيئات العمل الحقيقية بعيدًا عن أرقام الاختبارات المعملية فقط.
?xml>