معايير أداء

16 published articles

الذكاء الاصطناعي5 min read

كوربوس ميسييه

957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات

كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.

2026-08-02

مفتوح المصدر2 min read

مصدر مفتوح

OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم

OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.

2026-08-01

وكلاء الذكاء الاصطناعي3 min read

وكلاء الواجهات الرسومية

وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة

يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.

2026-07-31

وكلاء الذكاء الاصطناعيFeatured2 min read

هندسة الوكلاء المتعددين

تجربة Qoder مع الوكلاء المتعددين: أخطاء أقل بنسبة 60%، ولكن بأي ثمن؟

تحليل لوضع خبراء Qoder من Alibaba Cloud، الذي ينشر وكلاء ذكاء اصطناعي متخصصين كفريق منسق. يتم فحص ادعاءات تقليل الأخطاء الكبيرة مقابل حالات الاستخدام الواقعية والمقايضات المرتبطة بتعقيد الوكلاء المتعددين.

2026-07-31

نماذج اللغات الكبيرةFeatured3 min read

نماذج الذكاء الاصطناعي

تصميم Macaron-V1-Venti بأربع متخصصات و748 مليار معلمة يتفوق على GPT-5.5 وOpus 4.8

نموذج Macaron-V1-Venti من MindLab Research يتصدر المعايير في الذكاء الشخصي، البرمجة، استخدام الطرفية، وواجهة المستخدم التوليدية، باستخدام بنية جديدة من Mixture of LoRA تحافظ على صغر حجم النموذج مع التخصص.

2026-07-27

مختبرFeatured3 min read

أبحاث الذكاء الاصطناعي

Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع

يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.

2026-07-26

الذكاء الاصطناعيFeatured5 min read

الدفاع الإلكتروني

نموذج Fugu-Cyber من Sakana AI يحقق 86.9% في معايير الأمن لكنه يرى أن النماذج الخام ليست الحل

أصدرت Sakana AI نموذج Fugu-Cyber، وهو نموذج تنسيق متعدّد الوكلاء يطابق النماذج الإلكترونية الحدودية على المعايير. وتجادل الشركة بأن الوصول إلى النموذج الخام وحده لا يمكنه إصلاح أمن المؤسسات دون خبرة بشرية وسير عمل تحقق.

2026-07-21

الذكاء الاصطناعيFeatured5 min read

أسس الذكاء الاصطناعي

لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية

تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.

2026-07-20

الذكاء الاصطناعيFeatured5 min read

الذكاء الاصطناعي المحلي

مفارقة النموذج غير الخاضع للرقابة: رفض أقل، سلامة أقل، ولماذا لا تزال الذكاء الاصطناعي المحلي مهمًا

اختبار خمسة نماذج لغوية كبيرة غير خاضعة للرقابة تُدار محليًا يُظهر أن عملية 'الإبادة' تقلل الرفض المفرط من 44% إلى الصفر تقريبًا دون التأثير على الاستدلال، لكن نفس التعديل ينهار رفض السلامة من 41.5% إلى 9.5%، لأن كلاهما يعتمد على نفس الاتجاه الداخلي. السبب الحقيقي لتشغيل نموذج غير خاضع للرقابة قد لا يكون ما تعتقده.

2026-07-19

نماذج اللغات الكبيرةFeatured6 min read

تحليل

أين تتفوق Kimi K3 على النماذج الرائدة: نظرة معيارية على النموذج المفتوح ذي 2.8 تريليون معامل

نموذج Kimi K3 المفتوح ذو 2.8 تريليون معامل من Moonshot AI يتخلف عن النماذج الملكية الرائدة في معظم المعايير الواسعة، لكنه يتصدر في SWE Marathon وTerminal-Bench 2.1 وBrowseComp وغيرها. يكشف الجدول التفصيلي أين تؤتي ثمار رهاناته المعمارية على KDA وStable LatentMoE.

2026-07-17

نماذج اللغات الكبيرة7 min read

الذكاء الاصطناعي

ما يكشفه إنكلينج عن خط التقسيم الجديد في سوق النماذج مفتوحة المصدر

إنكلينج هو أول نموذج مفتوح متاح يقترب من تريليون معامل مع دعم أصلي للصوت والصورة والنص إلى جانب نافذة سياق بطاقة مليون رمز ومتغير كمي NVFP4. نتائج المعايير الأولية قوية، لكن القصة الأكثر دلالة هي كيف تحول النظام البيئي مفتوح المصدر من وكيل ملاحق إلى منافسة نشطة على الحدود، وأين يتناسب إنكلينج مع هذه الخريطة الجديدة.

2026-07-15

الذكاء الاصطناعي5 min read

الذكاء الاصطناعي

سونيت 4.6 جعلت أوبس تبدو باهظة الثمن. هذا يغير كل شيء.

نموذج كلود سونيت 4.6 من أنثروبيك يضاهي أو يتفوق على أداء فئة أوبس في المعايير الرئيسية مع الحفاظ على نفس تسعير سونيت 4.5. تشير بيانات تفضيل المطورين المبكرة وشهادات العملاء إلى أن النموذج يحل بالفعل محل البدائل الأكثر تكلفة لمهام الوكيل والبرمجة في العالم الحقيقي.

2026-07-14

← PreviousPage 1 / 2 · 16 articlesNext →