معايير أداء
20 published articles
نموذج جوجل المعتمد، أكبر في تحديث 3.7
جيميناي 3.7 فلاش يخفض سعره إلى النصف، ثم يقدّم الحجج المؤيدة لذلك
يُطرح نموذج Gemini 3.7 Flash من Google بنصف السعر التمهيدي لنموذج 3.6 Flash، مع ادعاءات بتحقيق مكاسب في معايير البرمجة وتطوير الويب وأعمال المعرفة. ويصدر الإصدار بعد ثلاثة أسابيع من إصدار Flash السابق، ويقدّم لمطوّري الوكلاء حجة جديدة قائمة على السعر مقابل الأداء.
2026-08-16
الذكاء الاصطناعي
Grok 4.6 يتعادل مع GPT-5.6 Sol عند 61، ثم تنقسم نتائج المكونات
يتعادل نموذج Grok 4.6 من xAI مع GPT-5.6 Sol عند 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. توزيع النتائج غير متوازن: انتصارات في أعمال المعرفة ومعظم اختبارات البرمجة، وخسائر في DeepSWE وTerminal-Bench. متاح الآن في Cursor وGrok Build، بدءًا من 2 دولار لكل مليون رمز إدخال.
2026-08-13
وكلاء الذكاء الاصطناعي على الأجهزة
LFM2.5-2.6B: الوكيل الصغير الذي يتفوق على نماذج أكبر منه بأربعة أضعاف
يضع LFM2.5-2.6B من Liquid AI نموذجًا وكيلًا في 2.6 مليار معامل وأقل من 2.5 غيغابايت من الذاكرة، متصدرًا كل معايير اتباع التعليمات التي اختُبر عليها. يعمل بسرعة 220 رمزًا في الثانية على حاسوب محمول؛ والبرمجة هي الفجوة الواضحة الوحيدة.
2026-08-12
الذكاء الاصطناعي الحدودي
أذكى نماذج Claude من Anthropic هو النموذج الذي لا يمكنك استخدامه
أطلقت Anthropic نموذج Claude Fable 5 للجميع وأبقت Claude Mythos 5 للشركاء الموثوقين. فئة النماذج نفسها، وبابا وصول مختلفان. المعايير أقل أهمية من آلية التوجيه، والتوجيه هو الطريقة التي ستُطرح بها نماذج الذكاء الاصطناعي الحدودية من الآن فصاعدًا.
2026-08-03
كوربوس ميسييه
957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات
كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.
2026-08-02
مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
2026-08-01
وكلاء الواجهات الرسومية
وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة
يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.
2026-07-31
هندسة الوكلاء المتعددين
تجربة Qoder مع الوكلاء المتعددين: أخطاء أقل بنسبة 60%، ولكن بأي ثمن؟
تحليل لوضع خبراء Qoder من Alibaba Cloud، الذي ينشر وكلاء ذكاء اصطناعي متخصصين كفريق منسق. يتم فحص ادعاءات تقليل الأخطاء الكبيرة مقابل حالات الاستخدام الواقعية والمقايضات المرتبطة بتعقيد الوكلاء المتعددين.
2026-07-31
نماذج الذكاء الاصطناعي
تصميم Macaron-V1-Venti بأربع متخصصات و748 مليار معلمة يتفوق على GPT-5.5 وOpus 4.8
نموذج Macaron-V1-Venti من MindLab Research يتصدر المعايير في الذكاء الشخصي، البرمجة، استخدام الطرفية، وواجهة المستخدم التوليدية، باستخدام بنية جديدة من Mixture of LoRA تحافظ على صغر حجم النموذج مع التخصص.
2026-07-27
أبحاث الذكاء الاصطناعي
Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع
يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.
2026-07-26
الدفاع الإلكتروني
نموذج Fugu-Cyber من Sakana AI يحقق 86.9% في معايير الأمن لكنه يرى أن النماذج الخام ليست الحل
أصدرت Sakana AI نموذج Fugu-Cyber، وهو نموذج تنسيق متعدّد الوكلاء يطابق النماذج الإلكترونية الحدودية على المعايير. وتجادل الشركة بأن الوصول إلى النموذج الخام وحده لا يمكنه إصلاح أمن المؤسسات دون خبرة بشرية وسير عمل تحقق.
2026-07-21
أسس الذكاء الاصطناعي
لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية
تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.
2026-07-20