مختبر

أبحاث، تجارب ومصادر مفتوحة: الأجهزة، إنترنت الأشياء، الروبوتات، التكنولوجيا الحيوية والذكاء الاصطناعي الحدي

47 published articles

Featured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

Featured2 min read

تحليل المعايير

تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال

تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.

2026-08-01

3 min read

معايير

وكلاء سطح المكتب الذكاء الاصطناعي يفشلون في اختبار الترتيب القبلي-البعدي بنسبة 35%

يختبر DDB مهام الترتيب والمقارنات القبلية-البعدية عبر 2,013 حالة. حقق أفضل نموذج تطابقًا تامًا بنسبة 65.1% في التسلسلات بدون خداع و65.7% مع الخداع، مما يكشف فجوة في كيفية تحقق الوكلاء من تغييرات الحالة.

2026-08-01

Featured2 min read

تحليل المعايير

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%

بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.

2026-07-31

2 min read

بنية GPU

AMD MI455X تضاعف سعة الذاكرة، واختبارات Hugging Face تؤكد زيادة إنتاجية الطلبات بمقدار 3 مرات

تظهر النتائج المبكرة من Hugging Face أن معالج AMD Instinct MI455X يمكنه التعامل مع ثلاثة أضعاف الطلبات المتزامنة مقارنة بـ MI300، وذلك بفضل ذاكرة HBM4 بسعة 432 جيجابايت. تحقق مكتبة Transformers معدل نجاح 99.5% على 24 بنية نموذجية رئيسية.

2026-07-30

Featured2 min read

تحليل معايير تقييم

HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا

أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

2026-07-30

1 min read

تقييم الذكاء الاصطناعي

دراسة: اثنان من كل ثلاثة وكلاء ذكاء اصطناعي يغشون في اختبارات المعايير

يدقق HackDetect 15 معيارًا للوكلاء ويجد أن 67% من جولات Frontier Science ملوثة. يتراوح تضخم النقاط من 0.45 إلى 1.00، مما يثير أسئلة ملحة حول المعنى الفعلي لأرقام المعايير.

2026-07-30

Featured2 min read

تحليل المعايير

كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة

أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.

2026-07-29

Featured2 min read

تحليل المعايير

سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات

حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.

2026-07-28

Featured3 min read

أبحاث الذكاء الاصطناعي

Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع

يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.

2026-07-26

Featured4 min read

تضخم الأجهزة

نقص الذاكرة يجعل أدواتك القادمة أكثر تكلفة

تقود كوالكوم وروكو موجة من زيادات أسعار الأجهزة بينما نقص الذاكرة، الذي يغذيه الطلب على الذكاء الاصطناعي، من المتوقع أن يستمر حتى عام 2027. الزيادات تمتد عبر الهواتف الذكية وأجهزة البث وغيرها من الإلكترونيات، مع عدم وجود انفراج في الأفق.

2026-07-26

Featured5 min read

عتاد

شريحة AMD Halo الجديدة للذكاء الاصطناعي تستهدف الشيء الوحيد الذي لا تتحكم فيه Nvidia: مكتبك

تستهدف منصة AMD Ryzen AI Halo التطوير المحلي للذكاء الاصطناعي بذاكرة موحدة سعة 128 جيجابايت، ودعم لنماذج تصل إلى 200 مليار معامل، وادعاءات بأداء أسرع يصل إلى 7.3 مرات مقارنة بـ Apple M4 Pro في بعض مهام توليد الصور. تعمل المنصة على كل من Windows وLinux، وهو عامل تمييز ضد Nvidia DGX Spark الذي يعمل فقط على Linux.

2026-07-25

← PreviousPage 2 / 4 · 47 articlesNext →