خبراء مختلطون
13 published articles
ذكاء اصطناعي مفتوح الأوزان
dots3-note من شياوهونغشو: نموذج MoE مفتوح الأوزان بـ 280 مليار معامل يُفعّل 16 مليارًا فقط
أصدر استوديو dots التابع لشياوهونغشو نموذج dots3-note preview، أول نموذج بأوزان مفتوحة لديها: نموذج MoE متعدد الوسائط بـ 280 مليار معامل، 16 مليارًا نشطًا، ونافذة سياق تبلغ 512 ألف رمز. يستهدف التصميم المتناثر خفض تكلفة التشغيل على عقدة واحدة مزوّدة بـ 8 وحدات معالجة رسومية، لكن البطاقة التعريفية لم تنشر أرقام المقاييس بعد.
2026-08-20
ذكاء اصطناعي مفتوح المصدر: علي بابا تفتح فئة Max
Qwen 3.8-Max: نموذج علي بابا الأقوى أصبح الآن متاحًا للتحميل مجانًا
تفتح علي بابا المصدر لنموذجها الأقوى على الإطلاق Qwen 3.8-Max: نموذج MoE بمعاملات 2.4T يتفوق على GPT-5.6 Sol في SWE-bench Pro وPaperBench وIFBench. نحلل تحفظات هذه المعايير وما يعنيه نموذج رائد مفتوح بنشاط 95B للمطورين.
2026-08-16
نماذج الذكاء الاصطناعي | NVIDIA Nemotron 3.5 Lightning
لماذا تراهن Nemotron 3.5 Lightning على أن معظم خطوات الوكلاء لا تحتاج إلى نموذج كبير
نموذج Nvidia المفتوح الجديد يعمل محليًا بثلاثة مليارات معامل نشط وسياق يصل إلى مليون توكن، وهو مصمم للوكلاء الذين يظلون قيد التشغيل. تدّعي Nvidia إنتاجية أعلى حتى 4 أضعاف وإكمال المهام أسرع بنسبة 30% مقارنة بالنماذج المفتوحة المماثلة.
2026-08-14
الذكاء الاصطناعي مفتوح المصدر
أكبر نموذج من علي بابا برمج بمفرده لمدة 16 يومًا. الأسبوع المقبل، تصبح أوزانه علنية.
ينشّط Qwen3.8-Max 95 مليار معامل فقط من أصل 2.4 تريليون، ويحتل المرتبة الثانية في Vision Arena، وبنى إطارًا للوكلاء في تشغيل مستقل استمر 16 يومًا. تنشر علي بابا الأوزان الأسبوع المقبل في أول إصدار رائد مفتوح الأوزان.
2026-08-10
مفتوح المصدر
سباق تتابع بوحدات GPU مستأجرة درّب نموذج NanoColibri من نوع 2.7B MoE مقابل 200 دولار
انتقل نموذج NanoColibri-Instruct من أوزان أولية إلى نموذج 2.7B MoE يعمل بتكلفة نحو 200 دولار. تناوب متطوعون على عصا التدريب عبر Hugging Face Hub، بوحدة GPU مستأجرة واحدة في كل مرة، مع عقد مقارنة-وتبديل يضمن ألا يدرب شخصان المرحلة نفسها أبدًا.
2026-08-04
Grok 4.5
تم بناء Grok 4.5 من Cursor بواسطة وكلاء ذكاء اصطناعي، وليس بشرًا. هذه هي القصة الحقيقية.
Grok 4.5 من Cursor هو نموذج خليط من الخبراء (Mixture-of-Experts) تم بناؤه باستخدام التعلم المعزز في بيئات أنشأها وكلاء ذكاء اصطناعي سابقون، وليس بشرًا. يتعامل مع المهام المعقدة طويلة المدة عبر هندسة البرمجيات، وعلوم البيانات، والمالية، والقانون، وهو متاح الآن.
2026-07-10
استراتيجية المحفظة
Qwen من علي بابا تبني نموذجًا لكل وظيفة ذكاء اصطناعي، وليس نموذجًا واحدًا لحكمها جميعًا
فريق Qwen من سحابة علي بابا أصدر بهدوء نموذجًا وكيلًا عالميًا بحجم 35B MoE، وثلاثة نماذج ASR جديدة، وتقرير RL لتوليد الصور، مما يكشف عن رهان استراتيجي على الاتساع بدلاً من الأضواء في سباق نماذج الذكاء الاصطناعي.
2026-07-09
جوجل ديب مايند
جوجل ديب مايند تطلق Gemma 4: نموذج بـ 26 مليار معامل يتحول إلى آلة استدلال على بطاقة رسومية واحدة
التقرير الفني لـ Gemma 4 من جوجل ديب مايند يوضح بالتفصيل مجموعة من النماذج ذات الأوزان المفتوحة مع خبراء مختلطين ونوافذ سياق بطول مليون رمز ورؤية متعددة الوسائط. يشير الإصدار إلى خطوة استراتيجية لجلب الاستدلال على مستوى الحدود المتطورة للمطورين دون تكلفة واجهات برمجة التطبيقات الخاصة.
2026-07-09
الذكاء الاصطناعي
مكتبة الميغاكيرنل الجديدة من ألفا ألفا تقلل زمن استدلال نموذج الخبراء المختلط بنسبة 200%
تقوم Alpha-MoE بدمج عدة عمليات في نواة واحدة مستمرة لتحقيق مكاسب في سرعة الاستدلال تصل إلى 200% مقارنة بالنوى القائمة على تريتون في vLLM وSGLang، مستهدفة نماذج MoE بدقة FP8.
2026-07-09
الذكاء الاصطناعي
إي إم أو من Ai2: ذكاء اصطناعي معياري ينبثق من البيانات وليس القواعد البشرية
يستخدم نموذج إي إم أو الجديد من Ai2 طريقة تدريب مبتكرة تتيح ظهور وحدات الخبراء بشكل طبيعي من البيانات، مما يمكن من الاستخدام الانتقائي للخبراء مع فقدان ضئيل في الأداء. يتطابق النموذج مع أداء نماذج مختلط الخبراء القياسية في المعايير مع تقديم تحسن كبير في القابلية للمعيارية.
2026-07-07
غوص عميق
ألفا ألفا تبني نموذج استدلال نظري لـ DeepSeek: استخلاص الأداء من أساسيات الأجهزة
أنشأت ألفا ألفا نموذج استدلال نظري لـ DeepSeek v3 لتقدير الإنتاجية من معلمات الأجهزة، مع تحليل المفاضلات عبر إعدادات وحدات معالجة الرسوميات لمساعدة الممارسين على تحسين الأداء والتكلفة لنماذج الخبراء المختلطة الكبيرة.
2026-07-05
تحسين الاستدلال في نماذج اللغة الكبيرة
أليف ألفا تبني نموذج استدلال نظري لفك تشفير أداء DeepSeek V3 من البدائيات الأساسية للأجهزة
يتنبأ النموذج النظري لشركة أليف ألفا بأداء استدلال DeepSeek V3 من معايير الأجهزة وحدها، كاشفًا كيف يُغير عدد وحدات معالجة الرسومات وعرض النطاق الترددي للاتصال البيني عنق الزجاجة بين الحوسبة والذاكرة والاتصال.
2026-07-04