التفكير الزمني
3 published articles
فهم الفيديو
Gemini 3.6 Flash يحصي تغيّرات الحالة لكنه يفوت الرمش
تُظهر دراسة جديدة على arXiv أن نماذج لغة الفيديو تفشل في التتبّع البسيط للأحداث. يحصي Gemini 3.6 Flash تغيّرات الحالة المستمرة حتى 12 حدثًا، لكنه لا يملك نطاقًا موثوقًا للرمش العابر؛ فالإطارات الإضافية تضخّم الدقة دون استرجاع أمين، ولا تصح سوى 0.2% من الأعداد النهائية ضمن النظام عالي العد.
2026-08-12
معيار TRACTA
الاستدلال العصبي-الرمزي يتفوق على النماذج العصبية الخام في المهام الزمنية، معيار TRACTA يكشف
يكشف معيار TRACTA أن الذكاء الاصطناعي العصبي-الرمزي يتفوق على النماذج العصبية الخام في ثلاث مهام استدلال زمني، مع أكبر الهوامش في الإنذار المبكر واكتشاف الأنماط.
2026-08-02
المعيار
أداة GauntletBench من أكسفورد تختبر وكلاء الذكاء الاصطناعي في 100 مهمة حقيقية. لقد فشلوا في 81% منها.
تضع أداة GauntletBench من أكسفورد وكلاء الذكاء الاصطناعي أمام 100 مهمة صعبة من العالم الحقيقي. لا تتجاوز قدرة الأنظمة الحدودية 19.1% من النجاح، وهو أقل بكثير من الأداء البشري. يستهدف المعيار القدرات المهملة في الإدراك الزمني والفهم الرسومي والتفكير ثلاثي الأبعاد عبر خمسة تطبيقات مهنية.
2026-07-01