arXiv
18 published articles
الرؤية الحاسوبية، النماذج العالمية وأبحاث الذكاء الاصطناعي
PhiZero: تعليم الذكاء الاصطناعي للفيديو التفكير في الفيزياء قبل العرض
PhiZero، نموذج عالمي من CASIA، يتعلم «لغة فيزيائية» منفصلة ومضغوطة من الفيديو الخام ويستخدمها للتفكير في كيفية تطور المشهد قبل عرض الإطارات. يجادل المؤلفون بأن تصميم التفكير-ثم-العرض هذا ينتج فيديو أكثر تماسكاً فيزيائياً من التنبؤ المباشر بالبكسل.
2026-07-31
أبحاث الذكاء الاصطناعي
VideoCoCo يصلح فيزياء فيديو الذكاء الاصطناعي المعطوبة بالتفكير في كود Blender
يتعامل VideoCoCo مع كود Blender القابل للتنفيذ كسلسلة تفكير: وكيل برمجة يكتب سيناريو المشهد، ومحاكٍ يشغّله، ومحرك فيديو يجعل النتيجة واقعية فوتوغرافيًا. يستهدف هذا التقسيم مشكلة الفيزياء في تحويل النص إلى فيديو ويحقق أفضل متوسط نتائج على PhyGenBench وVBench-2.0.
2026-07-30
الذكاء الاصطناعي
كاشفات النماذج اللغوية الضخمة الأفضل قد تدفع المستخدمين لاستخدام الذكاء الاصطناعي أكثر، وليس أقل
كاشفات النماذج اللغوية الضخمة غير المثالية يمكن أن تشوه حوافز المستخدمين، مما يؤدي إلى زيادة استخدام الذكاء الاصطناعي ومخرجات أقل جودة. تتحدى نتائج الورقة الافتراض الساذج بأن أدوات الكشف تقلل بشكل نظيف من المحتوى المُنشَأ آليًا.
2026-07-26
معيار
الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها
SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.
2026-07-25
أبحاث الذكاء الاصطناعي
أربع شخصيات، إجابة واحدة: لماذا هزم التفكير غير المتجانس أفضل ذكاء اصطناعي في أصعب اختبار للبشرية
PoTRE يقسّم الاستدلال إلى أربع وكلاء يعملون بالتوازي، ثم يوفق بين إجاباتهم ديناميكيًا. حقق 49.92% في اختبار البشرية الأخير، متغلبًا على أفضل نتيجة رسمية سابقة. يعمل النهج بعدد رموز أقل مقارنة بالخطوط الأساسية الموسعة.
2026-07-24
أبحاث الذكاء الاصطناعي
لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم
يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.
2026-07-11