تدريب نماذج اللغة الكبيرة

5 published articles

نماذج اللغات الكبيرة3 min read

ذكاء اصطناعي مفتوح المصدر

Boris-2 يغذّي نموذجه 125M بـ90 مليار توكن، بينما يحصل نموذجه 250M على 60 مليارًا فقط

يعلن Boris-2 مسبقًا عن ثلاثة نماذج صغيرة بميزانيات توكن غير متوازنة: يحصل نموذج 125M على 90 مليار توكن، بينما يحصل 250M على 60 مليارًا فقط. يمتد التدريب من 12 أغسطس إلى 10 سبتمبر، دون مشاركة أي معايير قياس، فقط الطموح المعلن للوصول إلى قوة SmolLM2-135M.

2026-08-16

مفتوح المصدر6 min read

مفتوح المصدر

سباق تتابع بوحدات GPU مستأجرة درّب نموذج NanoColibri من نوع 2.7B MoE مقابل 200 دولار

انتقل نموذج NanoColibri-Instruct من أوزان أولية إلى نموذج 2.7B MoE يعمل بتكلفة نحو 200 دولار. تناوب متطوعون على عصا التدريب عبر Hugging Face Hub، بوحدة GPU مستأجرة واحدة في كل مرة، مع عقد مقارنة-وتبديل يضمن ألا يدرب شخصان المرحلة نفسها أبدًا.

2026-08-04

نماذج اللغات الكبيرة4 min read

تقطير نماذج اللغات الكبيرة

تقطير نماذج اللغات الكبيرة يتعثر عندما يبقى السياق ثابتًا. هذه الورقة تجعله يتطور

يمكن للسياقات حمل تفضيلات المهمة إلى تدريب نماذج اللغات الكبيرة، لكنها بعد تقطيرها في الطالب لا تضيف إشرافًا يذكر. تُبقي Flux-OPD من جامعة بكين السياق متحركًا مع الطالب وتستخدم حد تعارض لترجيح تصحيحات المعلّم. يذكر الملخص تحقيق مكاسب على نماذج التقطير ضمن السياسة الحالية دون ذكر أرقام.

2026-07-31

الذكاء الاصطناعيFeatured3 min read

تحسين التدريب

Unsloth تدّعي تسريع تدريب نماذج اللغات الكبيرة 5 مرات باستخدام نوى تريتون الجديدة والتجميع التلقائي

يقدم أحدث تحديث من Unsloth نوى تريتون المدمجة لـ QK RoPE لتسريع التضمينات الدوارة (rotary embeddings) بمقدار 2.3 مرة، وفهرسة int64 للسياقات الطويلة، وتجميعًا تلقائيًا خالٍ من الحشو. تظهر المقاييس تسريعًا في الإنتاجية بمقدار 1.7-3 مرات على Qwen3-32B دون فقدان الدقة.

2026-07-16

نماذج اللغات الكبيرة4 min read

استراتيجية البيانات الاصطناعية

أطلس بيانات إنفيديا يُظهر لماذا البيانات الاصطناعية أهم من أوزان النماذج

يوفر أطلس المطالبات Nemotron ما بعد التدريب v3 من إنفيديا خريطة تفاعلية لمليارات العينات الاصطناعية، مسلطاً الضوء على كيف أن البيانات الاصطناعية المفتوحة هي الطبقة المفقودة لبناء وكلاء ذكاء اصطناعي موثوقين. وتجادل الشركة بأن السلوك العاملي يجب أن يكون قابلاً للفحص، وأن البيانات الاصطناعية المنشورة علناً هي الطريقة الوحيدة للحفاظ على الإشارات الخاصة دون كشف الأسرار التجارية.

2026-07-12