معايير أداء

22 published articles

وكلاء الذكاء الاصطناعي4 min read

التدريب اللاحق للوكلاء، نسخة أولية على arXiv، 3 سبتمبر 2026

Terminal-Universe تستخرج 37,300 غرفة تدريب من تشغيلات وكلاء قديمة

يعيد Terminal-Universe تشغيل عمليات الملفات المسجلة لإعادة بناء مساحات العمل التي عمل فيها وكلاء البرمجة سابقًا، ثم يولّد منها مهامًا جديدة. تدّعي النسخة الأولية 37,300 بيئة ومكاسب مزدوجة الرقم في المعايير، وكلها مُبلَّغ عنها ذاتيًا.

2026-09-16

Hugging Face5 min read

ذكاء المتصفح: نوى WebGPU ومعايير الأداء

تسريع WebGPU بنسبة 2.57x من Hugging Face يأتي مرفقًا بـ176 خسارة

نشرت Hugging Face ‏207 نواة WebGPU بترخيص Apache-2.0، ومحمّلًا لتشغيلها من JavaScript، وأداة لقياس الأداء في المتصفح. أبقت نسبة التسريع الرئيسية 2.57x مقابل ONNX Runtime Web ‏809 من أصل 1,756 حالة اختبار وسجلت 176 خسارة.

2026-09-16

جوجل ديب مايندFeatured3 min read

نموذج جوجل المعتمد، أكبر في تحديث 3.7

جيميناي 3.7 فلاش يخفض سعره إلى النصف، ثم يقدّم الحجج المؤيدة لذلك

يُطرح نموذج Gemini 3.7 Flash من Google بنصف السعر التمهيدي لنموذج 3.6 Flash، مع ادعاءات بتحقيق مكاسب في معايير البرمجة وتطوير الويب وأعمال المعرفة. ويصدر الإصدار بعد ثلاثة أسابيع من إصدار Flash السابق، ويقدّم لمطوّري الوكلاء حجة جديدة قائمة على السعر مقابل الأداء.

2026-08-16

xAI / GrokFeatured4 min read

الذكاء الاصطناعي

Grok 4.6 يتعادل مع GPT-5.6 Sol عند 61، ثم تنقسم نتائج المكونات

يتعادل نموذج Grok 4.6 من xAI مع GPT-5.6 Sol عند 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. توزيع النتائج غير متوازن: انتصارات في أعمال المعرفة ومعظم اختبارات البرمجة، وخسائر في DeepSWE وTerminal-Bench. متاح الآن في Cursor وGrok Build، بدءًا من 2 دولار لكل مليون رمز إدخال.

2026-08-13

نماذج اللغات الكبيرة4 min read

وكلاء الذكاء الاصطناعي على الأجهزة

LFM2.5-2.6B: الوكيل الصغير الذي يتفوق على نماذج أكبر منه بأربعة أضعاف

يضع LFM2.5-2.6B من Liquid AI نموذجًا وكيلًا في 2.6 مليار معامل وأقل من 2.5 غيغابايت من الذاكرة، متصدرًا كل معايير اتباع التعليمات التي اختُبر عليها. يعمل بسرعة 220 رمزًا في الثانية على حاسوب محمول؛ والبرمجة هي الفجوة الواضحة الوحيدة.

2026-08-12

Anthropic / Claude5 min read

الذكاء الاصطناعي الحدودي

أذكى نماذج Claude من Anthropic هو النموذج الذي لا يمكنك استخدامه

أطلقت Anthropic نموذج Claude Fable 5 للجميع وأبقت Claude Mythos 5 للشركاء الموثوقين. فئة النماذج نفسها، وبابا وصول مختلفان. المعايير أقل أهمية من آلية التوجيه، والتوجيه هو الطريقة التي ستُطرح بها نماذج الذكاء الاصطناعي الحدودية من الآن فصاعدًا.

2026-08-03

الذكاء الاصطناعي5 min read

كوربوس ميسييه

957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات

كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.

2026-08-02

مفتوح المصدر2 min read

مصدر مفتوح

OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم

OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.

2026-08-01

وكلاء الذكاء الاصطناعي3 min read

وكلاء الواجهات الرسومية

وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة

يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.

2026-07-31

وكلاء الذكاء الاصطناعيFeatured2 min read

هندسة الوكلاء المتعددين

تجربة Qoder مع الوكلاء المتعددين: أخطاء أقل بنسبة 60%، ولكن بأي ثمن؟

تحليل لوضع خبراء Qoder من Alibaba Cloud، الذي ينشر وكلاء ذكاء اصطناعي متخصصين كفريق منسق. يتم فحص ادعاءات تقليل الأخطاء الكبيرة مقابل حالات الاستخدام الواقعية والمقايضات المرتبطة بتعقيد الوكلاء المتعددين.

2026-07-31

نماذج اللغات الكبيرةFeatured3 min read

نماذج الذكاء الاصطناعي

تصميم Macaron-V1-Venti بأربع متخصصات و748 مليار معلمة يتفوق على GPT-5.5 وOpus 4.8

نموذج Macaron-V1-Venti من MindLab Research يتصدر المعايير في الذكاء الشخصي، البرمجة، استخدام الطرفية، وواجهة المستخدم التوليدية، باستخدام بنية جديدة من Mixture of LoRA تحافظ على صغر حجم النموذج مع التخصص.

2026-07-27

مختبرFeatured3 min read

أبحاث الذكاء الاصطناعي

Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع

يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.

2026-07-26

← PreviousPage 1 / 2 · 22 articlesNext →