تحجيم وقت الاختبار
4 published articles
التوسع في وقت الاختبار
توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%
سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.
2026-08-19
أبحاث الذكاء الاصطناعي
سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال
يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.
2026-08-18
أبحاث الذكاء الاصطناعي
يبدو تطور الحزام مثيرًا للإعجاب حتى تختبره على مهام غير مطروقة
من المفترض أن يجعل التطور التلقائي للحزام وكلاء LLM أفضل، لكن ورقة بحثية جديدة تجادل بأن العديد من المكاسب المبلغ عنها قد تكون من الإفراط في التجهيز على مجموعة الاختبار العامة. في التجارب، طابقت طرق توسيع نطاق وقت الاختبار البسيطة التطور أو تفوقت عليه، وأظهرت الأحزمة المتطورة تعميمًا محدودًا للمهام غير المطروقة.
2026-07-27
الذكاء الاصطناعي
مينيماكس M3 وفن جعل نموذج الإثبات مقاومًا للاختراق
تشرح مينيماكس التفاصيل الهندسية وراء قدرات الإثبات لنموذج M3: مُحقق متعدد الطبقات اجتاز نمط فشل اختراق المكافآت الذي عانى منه دورة M2، وإطار MaxProof القائم على الاختبار عند وقت التشغيل على مستوى المجموعة، والذي يحول أخذ العينات إلى بحث موجه. في مسابقتَي IMO 2025 و USAMO 2026، يتجاوز نموذج M3 مع MaxProof عتبة الميدالية الذهبية البشرية.
2026-07-16