سلسلة التفكير

6 published articles

المختبرات والأبحاث4 min read

أبحاث الذكاء الاصطناعي

سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال

يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.

2026-08-18

المختبرات والأبحاث4 min read

أبحاث القيادة الذاتية

XCoT-VLA: ذكاء اصطناعي للقيادة يستدل في ست رموز، لا فقرة

يستبدل XCoT-VLA سلسلة التفكير الوصفية في نماذج القيادة القائمة على الرؤية-اللغة-الفعل بـ 2 إلى 6 رموز قابلة للتنفيذ، مما يقلل خطأ المسار مع البقاء ضمن ميزانيات التخطيط في الوقت الفعلي. المفاضلة: الاستدلال الذي ينضغط جيدًا لم يعد يبدو كتفسير بشري.

2026-08-18

نماذج اللغات الكبيرة4 min read

بحوث الذكاء الاصطناعي

رغوة في سلسلة الأفكار: معيار جديد يكشف كيف تهدر LLMs الرموز في استدلال صحيح لكنه عديم الفائدة

غالبًا ما تولد LLMs سلاسل استدلال صحيحة ولكنها محشوة بخطوات غير ضرورية. يظهر معيار تشخيصي جديد وطريقة ضغط أن المقيمين الحاليين يغفلون تمامًا عن هذا عدم الكفاءة وأن نصف خطوات الاستدلال التي كتبها البشر قد تكون قابلة للضغط.

2026-07-31

الرؤية والانتشار4 min read

أبحاث الذكاء الاصطناعي

VideoCoCo يصلح فيزياء فيديو الذكاء الاصطناعي المعطوبة بالتفكير في كود Blender

يتعامل VideoCoCo مع كود Blender القابل للتنفيذ كسلسلة تفكير: وكيل برمجة يكتب سيناريو المشهد، ومحاكٍ يشغّله، ومحرك فيديو يجعل النتيجة واقعية فوتوغرافيًا. يستهدف هذا التقسيم مشكلة الفيزياء في تحويل النص إلى فيديو ويحقق أفضل متوسط نتائج على PhyGenBench وVBench-2.0.

2026-07-30

الذكاء الاصطناعي4 min read

الذكاء الاصطناعي

لماذا يضيع نموذج الذكاء الاصطناعي الرموز في سلسلة أفكاره، وكيف يصلح التوقف الأمثل ذلك

يقترح باحثو MIT أداة OS-Pruner، وهي إضافة إضافية توقف تفكير سلسلة الأفكار ديناميكيًا عندما لا تستحق التكلفة الحسابية الرموز الإضافية. تظهر الاختبارات تقليل الطول بنسبة 20-60% مع تضحية ضئيلة بالدقة.

2026-07-29

نماذج اللغات الكبيرة4 min read

أبحاث سلامة الذكاء الاصطناعي

نماذج الذكاء الاصطناعي لا تستطيع التوقف عن التفكير بصوت عالٍ. هذه أخبار جيدة وكابوس للسلامة في آن واحد.

كلود سونيت 4.5 يمكنه التحكم في سلسلة تفكيره بنسبة 2.7% فقط من الوقت، مقابل 61.9% للمخرجات النهائية. تثير الفجوة أسئلة مفتوحة حول متانة مراقبة سلسلة التفكير كآلية سلامة، ولا أحد يعرف لماذا توجد.

2026-03-09