arXiv

18 published articles

الرؤية والانتشار4 min read

الرؤية الحاسوبية، النماذج العالمية وأبحاث الذكاء الاصطناعي

PhiZero: تعليم الذكاء الاصطناعي للفيديو التفكير في الفيزياء قبل العرض

PhiZero، نموذج عالمي من CASIA، يتعلم «لغة فيزيائية» منفصلة ومضغوطة من الفيديو الخام ويستخدمها للتفكير في كيفية تطور المشهد قبل عرض الإطارات. يجادل المؤلفون بأن تصميم التفكير-ثم-العرض هذا ينتج فيديو أكثر تماسكاً فيزيائياً من التنبؤ المباشر بالبكسل.

2026-07-31

الرؤية والانتشار4 min read

أبحاث الذكاء الاصطناعي

VideoCoCo يصلح فيزياء فيديو الذكاء الاصطناعي المعطوبة بالتفكير في كود Blender

يتعامل VideoCoCo مع كود Blender القابل للتنفيذ كسلسلة تفكير: وكيل برمجة يكتب سيناريو المشهد، ومحاكٍ يشغّله، ومحرك فيديو يجعل النتيجة واقعية فوتوغرافيًا. يستهدف هذا التقسيم مشكلة الفيزياء في تحويل النص إلى فيديو ويحقق أفضل متوسط نتائج على PhyGenBench وVBench-2.0.

2026-07-30

الذكاء الاصطناعي3 min read

الذكاء الاصطناعي

كاشفات النماذج اللغوية الضخمة الأفضل قد تدفع المستخدمين لاستخدام الذكاء الاصطناعي أكثر، وليس أقل

كاشفات النماذج اللغوية الضخمة غير المثالية يمكن أن تشوه حوافز المستخدمين، مما يؤدي إلى زيادة استخدام الذكاء الاصطناعي ومخرجات أقل جودة. تتحدى نتائج الورقة الافتراض الساذج بأن أدوات الكشف تقلل بشكل نظيف من المحتوى المُنشَأ آليًا.

2026-07-26

معايير واختبارات4 min read

معيار

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها

SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.

2026-07-25

نماذج اللغات الكبيرة4 min read

أبحاث الذكاء الاصطناعي

أربع شخصيات، إجابة واحدة: لماذا هزم التفكير غير المتجانس أفضل ذكاء اصطناعي في أصعب اختبار للبشرية

PoTRE يقسّم الاستدلال إلى أربع وكلاء يعملون بالتوازي، ثم يوفق بين إجاباتهم ديناميكيًا. حقق 49.92% في اختبار البشرية الأخير، متغلبًا على أفضل نتيجة رسمية سابقة. يعمل النهج بعدد رموز أقل مقارنة بالخطوط الأساسية الموسعة.

2026-07-24

NLP والتعلم الآليFeatured4 min read

أبحاث الذكاء الاصطناعي

لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم

يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.

2026-07-11

← PreviousPage 2 / 2 · 18 articlesNext →