الانتباه المتفرق
2 published articles
الذكاء الاصطناعي5 min read
التقنيات العميقة
التوجيه المشترك عبر الطبقات يعطي الانتباه المتناثر تسريعًا بمقدار 7 أضعاف دون التأثير على الجودة
تستخدم CLSA تمريرة توجيه واحدة لكل تسلسل بدلاً من تمريرة واحدة لكل طبقة، مما يقلل حمل KV-cache مع الحفاظ على انتقائية مستوى الرمز. تُظهر المقاييس تحسنًا في الإنتاجية بمقدار 17.1 ضعفًا في سياق 128 ألف رمز.
2026-07-26
المختبرات والأبحاثFeatured3 min read
مختبرات وأبحاث الذكاء الاصطناعي
نموذج M3 من MiniMax يكتب نواة CUDA بنفسه وينشر الكود مفتوح المصدر
يسجل M3 من MiniMax 83.5 على معيار BrowseComp، متجاوزًا Opus 4.7 الذي سجل 79.3، ويعالج حتى مليون رمز بشكل أصلي. في اختبار استقلالية ملحوظ، قام بتحسين نواة GPU ذاتيًا من استغلال ذروة بنسبة 7.6% إلى 71.3% دون تدخل بشري.
2026-07-09