التكلفة مقابل القدرة
النموذج الذي يكلف 1.40 دولار يفوز على شقيقه البالغ 2.82 دولار في اختبار الفيزياء
طُلب من أربعة نماذج ذكاء اصطناعي بناء مشاهد HTML مع فيزياء حقيقية. اجتاز أوبوس 5 جميع الثلاثة بأقل تكلفة بين الأداء المتميز، بينما فشل فابل 5 في كل واحدة بسعر مضاعف.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-25 · قراءة 3 دقائق

Atomic.chat، وهي منصة معروفة بمعايير الذكاء الاصطناعي العملية، أجرت اختبارًا مركزًا يوم الخميس. المهمة: برمجة ثلاثة ملفات HTML تحاكي فيزياء التدمير، إعصار يرفع الأشياء، كرة هدم تضرب مبنى، وشاحنة تكسر جسرًا جمالونيًا. بسيط بما يكفي لأي نموذج يدعي فهم كيفية تحرك الأشياء في الفضاء.
المتنافسون الأربعة: Opus 5 (Anthropic)، Fable 5 (Anthropic)، Kimi K3 (Moonshot AI)، وGPT 5.6 (OpenAI). استخدم Opus 5 55.9 ألف توكن بتكلفة 1.40 دولار. استخدم Fable 5 55.1 ألف توكن ولكن بتكلفة 2.82 دولار، أي ما يقرب من الضعف. استخدم Kimi K3 35.7 ألف توكن مقابل 0.55 دولار. استخدم GPT 5.6 20.1 ألف توكن مقابل 0.31 دولار. الأرخص ليس دائمًا أفضل، لكن أداء Opus 5 عند نقطة السعر هذه يصعب تجاهله، خاصة بالنظر إلى ميزة التكلفة المعروفة له عبر معايير أخرى.
ما الذي فعله Opus 5 بشكل صحيح
قدم Opus 5 ثلاثة مشاهد عاملة. كان إعصاره يحتوي على منازل تتصاعد في القمع وتنطلق من الأعلى، وهو النوع من السلوك الذي يجب أن تظهره محاكاة فيزيائية حقيقية. أظهر مشهد كرة الهدم تشقق الجدار عند الاصطدام وتجمع الأنقاض على الأرض. انهار الجسر على مراحل، وأسقط الشاحنة في النهر أدناه. أعطته Atomic.chat علامة نجاح في الثلاثة. إنه نوع الأداء الذي تتوقعه من نموذج، كما أظهرت نماذج أصغر بكثير، لا يحتاج إلى أن يكون الأكبر ليكون الأفضل.
أين تعثر Fable 5
افتقرت مشاهد Fable 5 إلى التماسك الفيزيائي الأساسي. لم يكن لدى إعصاره أي شيء تقريبًا على الأرض ليلتقطه، مما يفسد الغرض. انهار المبنى من تلقاء نفسه قبل أن تصل إليه كرة الهدم. تفكك الجسر مرة واحدة، لا فشل تدريجي، ولا حالة وسطية. بالنسبة لنموذج يتم تسويقه نحو الهندسة والبرمجة، هذه إخفاقات محرجة.
GPT 5.6 وKimi K3 يتخلفان عن الركب
كان GPT 5.6 الأرخص بسعر 31 سنتًا، لكن كرة الهدم الخاصة به لم تصل أبدًا إلى المبنى، وانكسر جسره بطريقة لا ينكسر بها شيء في الحياة الواقعية. Kimi K3، الوافد الجديد من الصين، انتهى بنتائج مماثلة. على الرغم من شعبية Kimi K3 المتزايدة، إلا أنه لم يستطع مجاراة Opus 5 في التفكير الفيزيائي.
لماذا هذا مهم
الاختبار محدود ولكنه دال. العديد من تطبيقات الذكاء الاصطناعي في الألعاب والروبوتات والتعليم تحتاج إلى نماذج تستنتج كيف تتصرف الأشياء في الفضاء. هذه نقطة ضعف معروفة لمعظم نماذج اللغة الكبيرة، التي تم تدريبها بشكل أساسي على النص. يمكن لنماذج اللغة الكبيرة وصف البيانات ولكنها تكافح لاستنتاجها، وهذا المعيار يبرز الفجوة. أن Opus 5 تعامل معها جيدًا بينما لم يفعل Fable 5 يشير إلى أن الخيارات المعمارية أو بيانات التدريب يمكن أن تحدث فرقًا كبيرًا.
كما تظهر التكلفة كتطور غير متوقع. تفوق Opus 5 على شقيقه الأكثر تكلفة بهامش واسع. سيكون من الجيد للمطورين الذين يبحثون عن نموذج محاكاة أن يختبروا عبر العائلة بدلاً من افتراض أن الأغلى أفضل، وهو درس ينطبق خارج هذا المعيار، كما يكشف النشر في العالم الحقيقي غالبًا.
يؤكد الاختبار شيئًا لاحظه الباحثون من قبل: تتفوق نماذج اللغة في بناء الجمل ولكنها غالبًا ما تكافح مع دلالات العالم الفيزيائي. حجم الفجوة بين Opus 5 وFable 5، وكلاهما من نفس المختبر، هو تذكير بأن التخصص يأتي بمقايضات. إذا كنت تبني روبوتًا يحتاج إلى فهم التصادمات، فقد ترغب في معرفة كيف تتطور مجموعة أدوات المحاكاة قبل اختيار نموذجك.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.