نماذج الاستدلال
6 published articles
التوسع في وقت الاختبار
توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%
سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.
2026-08-19
أبحاث الذكاء الاصطناعي
سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال
يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.
2026-08-18
بحث في الذكاء الاصطناعي
لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي
تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
الذكاء الاصطناعي
لماذا يضيع نموذج الذكاء الاصطناعي الرموز في سلسلة أفكاره، وكيف يصلح التوقف الأمثل ذلك
يقترح باحثو MIT أداة OS-Pruner، وهي إضافة إضافية توقف تفكير سلسلة الأفكار ديناميكيًا عندما لا تستحق التكلفة الحسابية الرموز الإضافية. تظهر الاختبارات تقليل الطول بنسبة 20-60% مع تضحية ضئيلة بالدقة.
2026-07-29
غوص عميق في المعايير
ARC-AGI-2: المعيار الذي يقيس الذكاء السائل في أنظمة الذكاء الاصطناعي
يختبر ARC-AGI-2 أنظمة الذكاء الاصطناعي في الذكاء السائل من خلال ألغاز شبكات بصرية لا يمكن حلها عن طريق الحفظ. تسجل النماذج المتطورة الآن 75-85%، لكن الجائزة الكبرى البالغة 700,000 دولار لا تزال غير محققة. إليكم غوص عميق في تصميم المعيار، وتقييمه، ولوحة المتصدرين الحالية.
2026-07-01
أبحاث سلامة الذكاء الاصطناعي
نماذج الذكاء الاصطناعي لا تستطيع التوقف عن التفكير بصوت عالٍ. هذه أخبار جيدة وكابوس للسلامة في آن واحد.
كلود سونيت 4.5 يمكنه التحكم في سلسلة تفكيره بنسبة 2.7% فقط من الوقت، مقابل 61.9% للمخرجات النهائية. تثير الفجوة أسئلة مفتوحة حول متانة مراقبة سلسلة التفكير كآلية سلامة، ولا أحد يعرف لماذا توجد.
2026-03-09