معيار مرجعي

15 published articles

نماذج اللغات الكبيرة1 min read

إصدار نموذج ذكاء اصطناعي

مينيماكس تطلق نموذج M2.7 بمهارات قوية في هندسة البرمجيات والإنتاجية المكتبية

يقدم نموذج M2.7 من مينيماكس نتائج قوية في معايير هندسة البرمجيات والمهام المكتبية المهنية، مع معدل التزام بالمهارات بنسبة 97% على التعليمات المعقدة ودرجة ELO تبلغ 1495 على GDPval-AA.

2026-07-08

الذكاء الاصطناعي6 min read

تكنولوجيا المناخ

المرحلة الأولى من AIMIP: معيار جديد لاختبار نماذج الذكاء الاصطناعي المناخية

يوفر مشروع المرحلة الأولى من AIMIP، الذي يضم مجموعات من NVIDIA وGoogle Research وغيرها، مجموعة بيانات مفتوحة وإطار تقييم لنماذج المناخ القائمة على الذكاء الاصطناعي. بينما تعيد هذه النماذج إنتاج أنماط المناخ التاريخية بدقة، تظل قدرتها على التعميم في ظروف غير مألوفة تحدياً رئيسياً.

2026-07-03

الذكاء الاصطناعي4 min read

المعيار

أداة GauntletBench من أكسفورد تختبر وكلاء الذكاء الاصطناعي في 100 مهمة حقيقية. لقد فشلوا في 81% منها.

تضع أداة GauntletBench من أكسفورد وكلاء الذكاء الاصطناعي أمام 100 مهمة صعبة من العالم الحقيقي. لا تتجاوز قدرة الأنظمة الحدودية 19.1% من النجاح، وهو أقل بكثير من الأداء البشري. يستهدف المعيار القدرات المهملة في الإدراك الزمني والفهم الرسومي والتفكير ثلاثي الأبعاد عبر خمسة تطبيقات مهنية.

2026-07-01

← PreviousPage 2 / 2 · 15 articlesNext →