معايير أداء

20 published articles

جوجل ديب مايندFeatured3 min read

نموذج جوجل المعتمد، أكبر في تحديث 3.7

جيميناي 3.7 فلاش يخفض سعره إلى النصف، ثم يقدّم الحجج المؤيدة لذلك

يُطرح نموذج Gemini 3.7 Flash من Google بنصف السعر التمهيدي لنموذج 3.6 Flash، مع ادعاءات بتحقيق مكاسب في معايير البرمجة وتطوير الويب وأعمال المعرفة. ويصدر الإصدار بعد ثلاثة أسابيع من إصدار Flash السابق، ويقدّم لمطوّري الوكلاء حجة جديدة قائمة على السعر مقابل الأداء.

2026-08-16

xAI / GrokFeatured4 min read

الذكاء الاصطناعي

Grok 4.6 يتعادل مع GPT-5.6 Sol عند 61، ثم تنقسم نتائج المكونات

يتعادل نموذج Grok 4.6 من xAI مع GPT-5.6 Sol عند 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. توزيع النتائج غير متوازن: انتصارات في أعمال المعرفة ومعظم اختبارات البرمجة، وخسائر في DeepSWE وTerminal-Bench. متاح الآن في Cursor وGrok Build، بدءًا من 2 دولار لكل مليون رمز إدخال.

2026-08-13

نماذج اللغات الكبيرة4 min read

وكلاء الذكاء الاصطناعي على الأجهزة

LFM2.5-2.6B: الوكيل الصغير الذي يتفوق على نماذج أكبر منه بأربعة أضعاف

يضع LFM2.5-2.6B من Liquid AI نموذجًا وكيلًا في 2.6 مليار معامل وأقل من 2.5 غيغابايت من الذاكرة، متصدرًا كل معايير اتباع التعليمات التي اختُبر عليها. يعمل بسرعة 220 رمزًا في الثانية على حاسوب محمول؛ والبرمجة هي الفجوة الواضحة الوحيدة.

2026-08-12

Anthropic / Claude5 min read

الذكاء الاصطناعي الحدودي

أذكى نماذج Claude من Anthropic هو النموذج الذي لا يمكنك استخدامه

أطلقت Anthropic نموذج Claude Fable 5 للجميع وأبقت Claude Mythos 5 للشركاء الموثوقين. فئة النماذج نفسها، وبابا وصول مختلفان. المعايير أقل أهمية من آلية التوجيه، والتوجيه هو الطريقة التي ستُطرح بها نماذج الذكاء الاصطناعي الحدودية من الآن فصاعدًا.

2026-08-03

الذكاء الاصطناعي5 min read

كوربوس ميسييه

957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات

كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.

2026-08-02

مفتوح المصدر2 min read

مصدر مفتوح

OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم

OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.

2026-08-01

وكلاء الذكاء الاصطناعي3 min read

وكلاء الواجهات الرسومية

وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة

يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.

2026-07-31

وكلاء الذكاء الاصطناعيFeatured2 min read

هندسة الوكلاء المتعددين

تجربة Qoder مع الوكلاء المتعددين: أخطاء أقل بنسبة 60%، ولكن بأي ثمن؟

تحليل لوضع خبراء Qoder من Alibaba Cloud، الذي ينشر وكلاء ذكاء اصطناعي متخصصين كفريق منسق. يتم فحص ادعاءات تقليل الأخطاء الكبيرة مقابل حالات الاستخدام الواقعية والمقايضات المرتبطة بتعقيد الوكلاء المتعددين.

2026-07-31

نماذج اللغات الكبيرةFeatured3 min read

نماذج الذكاء الاصطناعي

تصميم Macaron-V1-Venti بأربع متخصصات و748 مليار معلمة يتفوق على GPT-5.5 وOpus 4.8

نموذج Macaron-V1-Venti من MindLab Research يتصدر المعايير في الذكاء الشخصي، البرمجة، استخدام الطرفية، وواجهة المستخدم التوليدية، باستخدام بنية جديدة من Mixture of LoRA تحافظ على صغر حجم النموذج مع التخصص.

2026-07-27

مختبرFeatured3 min read

أبحاث الذكاء الاصطناعي

Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع

يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.

2026-07-26

الذكاء الاصطناعيFeatured5 min read

الدفاع الإلكتروني

نموذج Fugu-Cyber من Sakana AI يحقق 86.9% في معايير الأمن لكنه يرى أن النماذج الخام ليست الحل

أصدرت Sakana AI نموذج Fugu-Cyber، وهو نموذج تنسيق متعدّد الوكلاء يطابق النماذج الإلكترونية الحدودية على المعايير. وتجادل الشركة بأن الوصول إلى النموذج الخام وحده لا يمكنه إصلاح أمن المؤسسات دون خبرة بشرية وسير عمل تحقق.

2026-07-21

الذكاء الاصطناعيFeatured5 min read

أسس الذكاء الاصطناعي

لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية

تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.

2026-07-20

← PreviousPage 1 / 2 · 20 articlesNext →