الذكاء الاصطناعي
Grok 4.6 يتعادل مع GPT-5.6 Sol عند 61، ثم تنقسم نتائج المكونات
يتعادل نموذج Grok 4.6 من xAI مع GPT-5.6 Sol عند 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. توزيع النتائج غير متوازن: انتصارات في أعمال المعرفة ومعظم اختبارات البرمجة، وخسائر في DeepSWE وTerminal-Bench. متاح الآن في Cursor وGrok Build، بدءًا من 2 دولار لكل مليون رمز إدخال.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-13 · قراءة 4 دقائق

يطرح إصدار xAI الجديد حجة مفادها أن النماذج المتطورة يجب أن تُقيَّم على أساس المدة التي يمكنها فيها مواصلة مهمة، وليس على مدى سرعة إجابتها عن استفسار واحد. نموذج Grok 4.6، الصادر اليوم، مبني للعمل الذي يمتد عبر خطوات كثيرة: البحث في موضوع، وتحليل المعلومات، والعمل عبر قاعدة بيانات برمجية، وحمل فكرة حتى الوصول إلى تطبيق عملي. تقول xAI إن النموذج يثابر على المهام المعقدة عبر تلك المسارات، وعند التشغيل لفترات أطول، يبدأ في مراجعة عمله قبل المضي قدمًا.
الرقم الأبرز هو 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. وهذا يضع Grok 4.6 في مستوى GPT-5.6 Sol ومتخلفًا بنقطة واحدة عن Fable 5 عند 62. وبالمقارنة مع إصدار xAI السابق، فإن التقدم لا لبس فيه: حصل Grok 4.5 على 56 على المؤشر نفسه.
في المؤشر المركب تكمن المساواة. لكن نتائج المكونات التي نشرتها xAI تروي قصة أكثر انقسامًا. يتفوق Grok 4.6 على GPT-5.6 Sol في ستة من المعايير المدرجة: GDPVal-AA v2 (1753 مقابل 1728)، وCursorBench v3.2 (69.9% مقابل 67.2%)، وFrontierCode v1.1 بصيغته الموسعة (61.3% مقابل 60.6%)، وAPEX-Agents (57.5% مقابل 56.7%)، وAA-Briefcase (1577 مقابل 1502)، وتقييم Harvey LAB (Vals) حيث يسجل 15.8% مقابل 2.5% لمنافسه. وفي APEX-SWE، تبلغ xAI عن 56.4% بينما لا يملك GPT-5.6 Sol نتيجة منشورة. وتتركز الخسائر في صفين: DeepSWE v1.1 عند 65.9% مقابل 73%، وTerminal-Bench v3.0 عند 26% مقابل 34.6%.
هذان العجزان هما ما يهم في إصدار موجه إلى الوكلاء طويلي التشغيل. يكافئ كلا المعيارين التنفيذ المستمر عبر جلسة طويلة، وهو بالتحديد المجال الذي يُفترض أن يهيمن عليه النموذج. المسار مشجع: يرتفع DeepSWE من 54% على Grok 4.5 إلى 65.9%، وTerminal-Bench من 15.7% إلى 26%، وAPEX-Agents من 47.1% إلى 57.5%، وهي أكبر ثلاث زيادات في النقاط المئوية على بطاقة نتائج xAI. لكن GPT-5.6 Sol ما زال يحتفظ بتفوق يتراوح بين سبع وتسع نقاط في اختباري التنفيذ، ويتقدم Fable 5 بأربع إلى ثماني نقاط.
بطاقة النتائج التي نشرتها xAI
| المعيار | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | n/a | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
أفضل نتيجة في كل صف تظهر بالخط العريض. أرقام المنافسين مأخوذة من بطاقات النظام المنشورة لكل مطور أو لوحات نتائج المعايير، وفقًا لبيان xAI.
كيف دُرِّب Grok 4.6: حلقة البناء الذاتي مستمرة
قصة التدريب تمتد إلى النمط الذي وضعته xAI مع Grok 4.5، الذي بُنيت بيئات تدريبه بواسطة وكلاء مستقلين بدلًا من مهندسين بشريين، وهو تفصيل كشفته Cursor، التي دربت 4.5 إلى جانب xAI، في ذلك الوقت. وبالنسبة إلى 4.6، تصف xAI تشغيل تدريب تكميلي أطول من تشغيل 4.5، مغذى ببيانات منتقاة من توليد النماذج للاستدلال والمفاهيم التقنية المتقدمة، وبيانات هندسية عالية الجودة، ومحسِّن ووصفة تدريب محسّنين. ثم ولّد Grok 4.5 مسارات SFT عبر جهود الاستدلال، وأدوات الوكلاء، وSTEM، وهندسة البرمجيات، وأعمال المعرفة، مع فحوصات قائمة على النماذج لتصفية المسارات الرديئة. وغطت مرحلة التعلم المعزز (RL) التي تلت ذلك مهام الوكلاء بما في ذلك البرمجة العامة وبيئات متخصصة لتحسين النواة وتطوير الويب والتصميم بمساعدة الحاسوب.
نتائج مستوى النموذج تطابق الطرح. تقول xAI إن Grok 4.6 قوي بشكل خاص في تحويل فكرة منتج واسعة إلى نسخة أولى عاملة، والبحث في مجالات غير مألوفة، وهيكلة تطبيق، وتنفيذ التفاعلات الأساسية، والتحسين عبر عدة جولات من التغذية الراجعة. كما تبلغ عن مسودات أولى أقوى في الأعمال البصرية والتفاعلية مما أنتجه Grok 4.5 عادةً، مع تأسيس بنية المشروع ولغته البصرية في مسودة واحدة.
أين يعمل وكم تبلغ تكلفته
نموذج Grok 4.6 متاح اليوم في Grok Build وCursor، وعبر واجهة xAI API، ومن خلال شركاء بما في ذلك OpenRouter وVercel وCloudflare. يبدأ التسعير من 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، مع نسخة سريعة بسعر مضاعف. ولإيصال النموذج إلى أيدي المستخدمين بسرعة، تضاعف xAI الاستخدام المشمول في Grok Build وCursor خلال الأسبوع الأول.
في ما يخص السلامة، تقول xAI إن الضمانات تمت معايرتها إلى جانب قدرات النموذج الموسعة، مدعومة بأوسع مجموعة اختبارات قبل النشر على الإطلاق، بالإضافة إلى اختبارات ما بعد النشر واختبارات من طرف ثالث. ويُبقي الإصدار صراحةً العمل المشروع مثل تصحيح الثغرات وتسريع دورات التصميم الهندسي ضمن النطاق.
التعادل المركب مع GPT-5.6 Sol حقيقي، وبطاقة النتائج التي تحته أضيق مما يوحي به الإطار. يفوز Grok 4.6 في الأعمال التي وجهته إليها xAI، وهي الأبحاث المثقلة بالمعرفة وبناء التطبيقات التفاعلية، ويتخلف في أطول مهام التنفيذ. الفجوات في DeepSWE وTerminal-Bench تتراوح بين سبع وتسع نقاط خلف GPT-5.6 Sol. صغيرة بما يكفي لتُغلق في إصدار نقطي. وكبيرة بما يكفي لتكون مهمة تحديدًا لأعباء العمل التي يُباع هذا النموذج من أجلها.
- المصدر : xAI: Grok 4.6 release announcement
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.