معايير أداء
16 published articles
كوربوس ميسييه
957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات
كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.
2026-08-02
مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
2026-08-01
وكلاء الواجهات الرسومية
وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة
يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.
2026-07-31
هندسة الوكلاء المتعددين
تجربة Qoder مع الوكلاء المتعددين: أخطاء أقل بنسبة 60%، ولكن بأي ثمن؟
تحليل لوضع خبراء Qoder من Alibaba Cloud، الذي ينشر وكلاء ذكاء اصطناعي متخصصين كفريق منسق. يتم فحص ادعاءات تقليل الأخطاء الكبيرة مقابل حالات الاستخدام الواقعية والمقايضات المرتبطة بتعقيد الوكلاء المتعددين.
2026-07-31
نماذج الذكاء الاصطناعي
تصميم Macaron-V1-Venti بأربع متخصصات و748 مليار معلمة يتفوق على GPT-5.5 وOpus 4.8
نموذج Macaron-V1-Venti من MindLab Research يتصدر المعايير في الذكاء الشخصي، البرمجة، استخدام الطرفية، وواجهة المستخدم التوليدية، باستخدام بنية جديدة من Mixture of LoRA تحافظ على صغر حجم النموذج مع التخصص.
2026-07-27
أبحاث الذكاء الاصطناعي
Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع
يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.
2026-07-26
الدفاع الإلكتروني
نموذج Fugu-Cyber من Sakana AI يحقق 86.9% في معايير الأمن لكنه يرى أن النماذج الخام ليست الحل
أصدرت Sakana AI نموذج Fugu-Cyber، وهو نموذج تنسيق متعدّد الوكلاء يطابق النماذج الإلكترونية الحدودية على المعايير. وتجادل الشركة بأن الوصول إلى النموذج الخام وحده لا يمكنه إصلاح أمن المؤسسات دون خبرة بشرية وسير عمل تحقق.
2026-07-21
أسس الذكاء الاصطناعي
لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية
تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.
2026-07-20
الذكاء الاصطناعي المحلي
مفارقة النموذج غير الخاضع للرقابة: رفض أقل، سلامة أقل، ولماذا لا تزال الذكاء الاصطناعي المحلي مهمًا
اختبار خمسة نماذج لغوية كبيرة غير خاضعة للرقابة تُدار محليًا يُظهر أن عملية 'الإبادة' تقلل الرفض المفرط من 44% إلى الصفر تقريبًا دون التأثير على الاستدلال، لكن نفس التعديل ينهار رفض السلامة من 41.5% إلى 9.5%، لأن كلاهما يعتمد على نفس الاتجاه الداخلي. السبب الحقيقي لتشغيل نموذج غير خاضع للرقابة قد لا يكون ما تعتقده.
2026-07-19
تحليل
أين تتفوق Kimi K3 على النماذج الرائدة: نظرة معيارية على النموذج المفتوح ذي 2.8 تريليون معامل
نموذج Kimi K3 المفتوح ذو 2.8 تريليون معامل من Moonshot AI يتخلف عن النماذج الملكية الرائدة في معظم المعايير الواسعة، لكنه يتصدر في SWE Marathon وTerminal-Bench 2.1 وBrowseComp وغيرها. يكشف الجدول التفصيلي أين تؤتي ثمار رهاناته المعمارية على KDA وStable LatentMoE.
2026-07-17
الذكاء الاصطناعي
ما يكشفه إنكلينج عن خط التقسيم الجديد في سوق النماذج مفتوحة المصدر
إنكلينج هو أول نموذج مفتوح متاح يقترب من تريليون معامل مع دعم أصلي للصوت والصورة والنص إلى جانب نافذة سياق بطاقة مليون رمز ومتغير كمي NVFP4. نتائج المعايير الأولية قوية، لكن القصة الأكثر دلالة هي كيف تحول النظام البيئي مفتوح المصدر من وكيل ملاحق إلى منافسة نشطة على الحدود، وأين يتناسب إنكلينج مع هذه الخريطة الجديدة.
2026-07-15
الذكاء الاصطناعي
سونيت 4.6 جعلت أوبس تبدو باهظة الثمن. هذا يغير كل شيء.
نموذج كلود سونيت 4.6 من أنثروبيك يضاهي أو يتفوق على أداء فئة أوبس في المعايير الرئيسية مع الحفاظ على نفس تسعير سونيت 4.5. تشير بيانات تفضيل المطورين المبكرة وشهادات العملاء إلى أن النموذج يحل بالفعل محل البدائل الأكثر تكلفة لمهام الوكيل والبرمجة في العالم الحقيقي.
2026-07-14