Qwen3
3 published articles
أبحاث الذكاء الاصطناعي
Memory Decoder: ذاكرة إضافية بحجم 6.9 مليار معلمة تجعل نموذجًا بحجم 410 ملايين يتفوق على Pythia-12B
يفصل Memory Decoder at Scale الذاكرة طويلة المدى عن الاستدلال في نماذج اللغة الكبيرة. ذاكرة مُدرَّبة مسبقًا بحجم 6.9 مليار معلمة رفعت Pythia-410M فوق Pythia-12B على 17 معيارًا مع معلمات أقل بنسبة 39%؛ وأضافت ذاكرات مجالية بحجم 1.7 مليار معلمة أكثر من 9 نقاط إلى Qwen3 Base على كل مقياس تم اختباره.
2026-07-31
البرمجة التنافسية
نوسكودر-14B يتحدى برمجة الأولمبياد بخط أنابيب تعزيز مفتوح
تطلق Nous Research نموذج NousCoder-14B، وهو نموذج برمجة تنافسية مبني على Qwen3-14B عبر التعلم المعزز. مجموعة كاملة مفتوحة المصدر: الأوزان والبيئة ومجموعة التقييم. يستهدف معايير البرمجة على مستوى الأولمبياد.
2026-07-16
نماذج لغات كبيرة ذات سياق طويل
الانتباه ثنائي البؤرة من Jet-Long يلغي المقايضة الثابتة لتوسيع نطاق السياق لنماذج اللغات الكبيرة
Jet-Long تكيف إعادة قياس RoPE ديناميكيًا لكل طول تسلسل، باستخدام نافذة محلية ونافذة بعيدة المدى مدمجة عبر الاستبعاد والتضمين. على نماذج Qwen3 حتى سياق 128 ألف رمز، تتفوق على خطوط الأساس الصفرية الحالية بأكثر من 2 نقطة مئوية على RULER وتحقق أقل درجة حيرة على PG-19، مع إضافة أقل من 4% عبء توليد.
2026-07-12