SevenTnewS

سباق النماذج

لوحة متصدر LiveBench هي دراسة في تناقص العوائد

يحتل نموذج GPT-5.6 Sol صدارة LiveBench الإجمالية بمتوسط 82.4، لكن Claude Fable 5 يتخلف بنحو 1.6 نقطة فقط بتكلفة تبلغ ثلاثة أضعافه تقريبًا. القصة الحقيقية هي كيف تراجع المستوى الأدنى.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-22 · قراءة 4 دقائق

لوحة متصدر LiveBench هي دراسة في تناقص العوائد
المصادر : LiveBench

أصدرت LiveBench أحدث تحديث لها، وشكل لوحة المتصدر يدل على الكثير. تهيمن مختبران على القمة، وهما GPT-5.6 Sol من OpenAI وClaude Fable 5 من Anthropic، يفصل بينهما خطأ في التقريب في النتيجة المركبة، لكنهما عالمين مختلفين في التسعير.

يسجل نموذج GPT-5.6 Sol Max Effort متوسطًا إجماليًا قدره 82.4. بينما يسجل Claude Fable 5 Max Effort 80.8. تكلفة هذه الفجوة البالغة 1.6 نقطة حوالي 2.7 مرة أكثر لكل توكن إذا قمت بتشغيل التكوين الأعلى من Anthropic. نموذج GPT-5.6 Terra، البديل الأرخص في نفس العائلة، يسجل 79.8، وهو أقرب إلى نموذج Claude الأعلى من الفجوة بين Sol وFable. العوائد الحدية على الإنفاق الأعلى صغيرة جدًا، وتتقلص بسرعة.

ما يجيده كل نموذج

يخفي المتوسط الرئيسي اختلافات حقيقية على مستوى الفئات. يهيمن Claude Fable 5 على الكتابة بمعدل 90.7، متعادلاً مع GPT-5.5 Thinking وClaude 4.8 Opus Thinking، ومتقدمًا بمقدار 3 نقاط كاملة على GPT-5.6 Sol الذي يسجل 87.7. إذا كان عبء عملك الأساسي هو النثر، فإن Claude Fable هو الخيار الواضح، وأقرب إصدار من GPT (5.5 Thinking) يكلف 0.53 دولار لكل توكن مقابل 1.57 دولارًا لـ Fable.

رسم بياني: النتائج المركبة لأفضل النماذج · نتائج الفئات: GPT مقابل Claude · منحنى السعر مقابل الأداء
أفضل ثلاثة نماذج في النتيجة المركبة لـ LiveBench تتجمع ضمن 2.6 نقطة، وفقًا للمقال. الاختلافات على مستوى الفئات بين أفضل نموذجين، كما ورد في بيانات LiveBench في المقال. النتائج المركبة عبر مستويات الأسعار، مما يظهر تناقص العوائد بالقرب من القمة وفقًا لبيانات المقال.

الاستدلال قصة أكثر قسوة. يسجل GPT-5.6 Sol 96.2 في معايير الاستدلال، متقدمًا قليلاً على Claude Fable's 96.0 وGPT-5.5 Thinking's 95.9. كل هذه الأرقام ضمن هامش الخطأ. يحدث الانخفاض الحقيقي بعد النماذج الأربعة الأولى، حيث يسجل Gemini 3.1 Pro Preview 91.0 وClaude 4.7 Opus Thinking 92.9. بعد ذلك، تنخفض الأرقام بسرعة إلى الثمانينات.

تظل الرياضيات معقلاً لخط GPT. يتصدر GPT-5.6 Sol بـ 91.7، يليه GPT-5.6 Terra بـ 90.6 وGPT-5.5 Thinking بـ 89.7. يتطابق Claude Fable 5 مع درجة GPT-5.5 عند 89.7، لكن Claude 4.8 Opus Thinking يتخلف عند 89.7 أيضًا، متطابقًا على الورق. التباين صغير بما يكفي لدرجة أن بذرة عشوائية واحدة قد تقلب الترتيب.

تظهر نتائج البرمجة تباينًا أكبر. يسجل GPT-5.6 Sol 83.9 في البرمجة. يسجل Claude Fable 5 86.0. تتفوق عدة إصدارات من خط Claude على GPT في البرمجة، حيث يسجل Claude Sonnet 5 80.7 وClaude 4.6 Opus Thinking 78.2، لكن لا شيء يضاهي النموذجين الأولين. لوحة متصدر البرمجة هي الفئة الوحيدة التي يتمكن فيها نموذج من خارج الاحتكار الثنائي، وهو Gemini 3.1 Pro Preview بـ 76.5، من الاقتراب من المستوى التالي.

منطقة الميزانية: النماذج المفتوحة والوافدة الجديدة

تحت 75 بشكل عام، يصبح المجال مزدحمًا بخيارات مثيرة للاهتمام. DeepSeek V4 Pro، ذو الأوزان المفتوحة، يسجل متوسط 71.6 بتكلفة 0.05 دولار لكل توكن، أي أرخص بحوالي 30 مرة من Claude Fable 5 مقابل حوالي 89٪ من الأداء المركب. Kimi K3، مفتوح أيضًا، يسجل 78.5 بتكلفة 0.379 دولار، مما يجعله أفضل قيمة في نطاق السبعينيات العليا. Qwen 3.7 Max بـ 73.1 و 0.182 دولار هو منافس لـ GPT-5.4 Nano الذي يسجل 69.6 و 0.091 دولار في نفس الحي السعري.

Grok 4.5 بـ 76.3 و 0.128 دولار هو وافد جديد يستحق المتابعة، فهو يتفوق على عدة إصدارات أعلى سعرًا من Claude وGPT في النتيجة المركبة بينما يتقاضى جزءًا بسيطًا من التكلفة. نقطة ضعفه هي الكتابة (68.6) والبرمجة (70.8)، لكن الاستدلال عند 90.8 هو حقًا من الدرجة الأولى. إذا طورت xAI نقاط الضعف هذه، فقد يصعد هذا الخط بسرعة في لوحة المتصدر.

الانكماش في القمة

أبرز ما يميز هذا التحديث هو كيفية تجمع النماذج الأربعة الأولى ضمن 2.2 نقطة من بعضها البعض بينما ينخفض كل شيء آخر بسلاسة. هذا ليس منحنى التقدم الأسي الذي تحب مختبرات الذكاء الاصطناعي إسقاطه. إنه ذيل طويل من المكاسب الإضافية بتكلفة أسية. الفرق بين GPT-5.6 Sol وGPT-5.4 Nano هو 12.8 نقطة في النتيجة المركبة، لكن الفرق في السعر يبلغ حوالي 6.5 أضعاف. الدفع أكثر يمنحك المزيد، لكن المنحنى يتسطح.

بالنسبة لأي شخص ينشر على نطاق واسع، فإن النقطة المثالية ربما تكون في نطاق 0.10 إلى 0.20 دولار حيث تعيش نماذج مثل Grok 4.5 وDeepSeek V4 Pro وQwen 3.7 Max. إنها جيدة بما يكفي لمعظم أعباء العمل الإنتاجية، وفارق التكلفة مقارنة بالطبقة العليا يمول الكثير من عمليات التقييم قبل أن تتجاوز نقطة التعادل في مكاسب الدقة.

لا تقول بيانات LiveBench أي نموذج هو الأفضل، فهذا يعتمد على مهمتك وميزانيتك. لكنها تقول إن الفجوة بين الأفضل والجيد جدًا تتقلص، وأن الأفضل يصبح باهظ الثمن بشكل أسرع مما يتحسن.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.