نماذج الاستدلال

6 published articles

الذكاء الاصطناعي5 min read

التوسع في وقت الاختبار

توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%

سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.

2026-08-19

المختبرات والأبحاث4 min read

أبحاث الذكاء الاصطناعي

سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال

يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.

2026-08-18

نماذج اللغات الكبيرة3 min read

بحث في الذكاء الاصطناعي

لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي

تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

الذكاء الاصطناعي4 min read

الذكاء الاصطناعي

لماذا يضيع نموذج الذكاء الاصطناعي الرموز في سلسلة أفكاره، وكيف يصلح التوقف الأمثل ذلك

يقترح باحثو MIT أداة OS-Pruner، وهي إضافة إضافية توقف تفكير سلسلة الأفكار ديناميكيًا عندما لا تستحق التكلفة الحسابية الرموز الإضافية. تظهر الاختبارات تقليل الطول بنسبة 20-60% مع تضحية ضئيلة بالدقة.

2026-07-29

الذكاء الاصطناعي3 min read

غوص عميق في المعايير

ARC-AGI-2: المعيار الذي يقيس الذكاء السائل في أنظمة الذكاء الاصطناعي

يختبر ARC-AGI-2 أنظمة الذكاء الاصطناعي في الذكاء السائل من خلال ألغاز شبكات بصرية لا يمكن حلها عن طريق الحفظ. تسجل النماذج المتطورة الآن 75-85%، لكن الجائزة الكبرى البالغة 700,000 دولار لا تزال غير محققة. إليكم غوص عميق في تصميم المعيار، وتقييمه، ولوحة المتصدرين الحالية.

2026-07-01

نماذج اللغات الكبيرة4 min read

أبحاث سلامة الذكاء الاصطناعي

نماذج الذكاء الاصطناعي لا تستطيع التوقف عن التفكير بصوت عالٍ. هذه أخبار جيدة وكابوس للسلامة في آن واحد.

كلود سونيت 4.5 يمكنه التحكم في سلسلة تفكيره بنسبة 2.7% فقط من الوقت، مقابل 61.9% للمخرجات النهائية. تثير الفجوة أسئلة مفتوحة حول متانة مراقبة سلسلة التفكير كآلية سلامة، ولا أحد يعرف لماذا توجد.

2026-03-09