الذكاء الاصطناعي متعدد الوسائط
13 published articles
ذكاء اصطناعي مفتوح الأوزان
dots3-note من شياوهونغشو: نموذج MoE مفتوح الأوزان بـ 280 مليار معامل يُفعّل 16 مليارًا فقط
أصدر استوديو dots التابع لشياوهونغشو نموذج dots3-note preview، أول نموذج بأوزان مفتوحة لديها: نموذج MoE متعدد الوسائط بـ 280 مليار معامل، 16 مليارًا نشطًا، ونافذة سياق تبلغ 512 ألف رمز. يستهدف التصميم المتناثر خفض تكلفة التشغيل على عقدة واحدة مزوّدة بـ 8 وحدات معالجة رسومية، لكن البطاقة التعريفية لم تنشر أرقام المقاييس بعد.
2026-08-20
توليد الفيديو
MiniMax تخلّت عن معماريتها المُثبتة لكي يقوم H3 بكل شيء
تقول MiniMax إن H3 يوحّد توليد النصوص والصور والفيديو والصوت في نموذج واحد، ويسعّر مخرجات 2K بأقل من ثلث أسعار النماذج السائدة، ويخطط لفتح الأوزان خلال أيام. لكن التفاصيل الصغيرة هي القصة الحقيقية: تخلت الشركة عن المعمارية التي منحتها ميزة للوصول إلى ذلك.
2026-08-07
Qwen / Alibaba Cloud
Qwen2.5-Omni يتفوق على Gemini-1.5-Pro في OmniBench ويعمل بأقل من 12GB
تفوّق نموذج Qwen2.5-Omni مفتوح المصدر من Alibaba على Gemini-1.5-Pro في OmniBench وتصدّر لوحة صدارة MMAU للاستدلال الصوتي. وتخفض النسخ المكمّمة ذاكرة VRAM إلى أقل من 12GB، بينما يوفّر دعم MNN دردشة صوتية فورية على الهواتف.
2026-08-07
مراجعة نموذج
Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط
غوص عميق في النموذج مفتوح المصدر الذي يعالج النصوص والصور والصوت والفيديو في وقت واحد مع توليد كلام متدفق، متفوقًا على GPT-4o-mini وGemini في اختبارات معيارية متعددة، مع إمكانية تشغيله على بطاقة رسومية استهلاكية واحدة مع التكميم.
2026-08-03
نماذج الأساس للرسوم البيانية
النقل بدون تدريب على الرسوم البيانية يعاني من نقطة عمياء متعددة الوسائط. CHARM تقدم حلاً
يستبدل CHARM ميزات العقد المعزولة بسياقات رسوم بيانية منظمة تلتقط الدلالات متعددة الوسائط والعلاقات عبر الوسائط. من خلال تعيين الأنماط الخاصة بالمجال إلى مفاهيم عالية المستوى مشتركة، يحقق النموذج نقلًا بدون تدريب عبر الرسوم البيانية مع النصوص والصور والوسائط الأخرى.
2026-08-01
توليد الفيديو
MiniMax H3 يخفض الأسعار أمام منافسي الفيديو ويخطط لفتح الأوزان
تدمج MiniMax توليد الصور والفيديو والصوت في نموذج واحد، وتسعّر المخرجات بأقل من ثلث أسعار النماذج السائدة لكل ثانية، وتخطط لفتح الأوزان خلال أيام. ويظل السؤال المفتوح: إلى أي مدى تصمد المخرجات خارج عروضها التجريبية الخاصة؟
2026-07-30
الذكاء الاصطناعي
نموذج 7B يتفوق على النماذج الأكبر ويعمل على الهاتف ويغير معادلة تكلفة الذكاء الاصطناعي
نموذج Qwen2.5-Omni من Alibaba Cloud هو نموذج 7B يتعامل مع النصوص والصور والصوت والفيديو، ويولد الكلام والنص في الوقت الفعلي. تعمل هندسة Thinker-Talker وعناصر التموضع TMRoPE على تمكين التفاعل المتدفق، ويعمل المتغير 3B على شرائح SoC المحمولة مثل Snapdragon 8 Gen 1 بسرعات قابلة للاستخدام.
2026-07-23
الذكاء الاصطناعي متعدد الوسائط
Qwen2.5-Omni من علي بابا: نموذج يريد أن يسمع ويرى ويتحدث دفعة واحدة
يعالج Qwen2.5-Omni من سحابة علي بابا النصوص والصور والصوت والفيديو من طرف إلى طرف، ويولد نصًا وكلامًا طبيعيًا في الوقت الفعلي. تظهر المعايير أنه غالبًا ما يتطابق أو يتفوق على النماذج المتخصصة أحادية الوسائط، مما يشير إلى تحول نحو البنى الموحدة.
2026-07-20
الذكاء الاصطناعي متعدد الوسائط
نموذج بحجم 12 مليار معلمة يتفوق على آخر بحجم 90 مليارًا. عقيدة التوسع في خطر
Pixtral-12B يضاهي أو يتفوق على نماذج أكبر منه بسبعة أضعاف في المقاييس متعددة الوسائط، دون التضحية بأداء اللغة. تطلق ميسترال أيضًا معيارًا مفتوحًا جديدًا لتقييم الرؤية واللغة العملي، مما يتحدى فكرة أن الأكبر دائمًا أفضل.
2026-07-17
الذكاء الاصطناعي الفيزيائي
تشغل كيوين من علي بابا الآن أدمغة 150 ألف روبوت وسيارة ونظارة وطائرة درون
تعمل عائلة نماذج كيوين من علي بابا الآن على تشغيل أكثر من 150 ألف جهاز، بدءًا من الروبوتات البشرية وحتى كاميرات الأطفال، حيث تتحول الشركة من روبوتات المحادثة إلى الذكاء الاصطناعي الفيزيائي، لتدمج النماذج متعددة الوسائط في الروبوتات والسيارات والنظارات والطائرات بدون طيار.
2026-07-14
جوجل ديب مايند
Gemma 4 تجعل كل نموذج مفتوح الوزن آخر يبدو أكبر بعشر مرات
عائلة نماذج Gemma 4 مفتوحة الوزن ومتعددة الوسائط بطبيعتها من جوجل ديب مايند تقدم وضع التفكير، وهندسة بدون مشفر، وخيارات خليط الخبراء. نموذج 2.3 مليار معامل يطابق أداء نموذج Gemma 3 ذو 27 مليار معامل. نموذج 31 مليار معامل يتصدر لوحات المتصدرين للنماذج مفتوحة الوزن.
2026-07-13
Alibaba Cloud
EMR Serverless Spark من Alibaba Cloud يعالج الآن الصور والفيديو باستخدام SQL فقط، دون الحاجة إلى بايثون
يدعم EMR Serverless Spark من Alibaba Cloud الآن الصور وأطر الفيديو مباشرة في SQL، مما يسمح لمهندسي البيانات بتجاوز تكاليف بايثون. دراسة حالة حول معالجة بيانات القيادة الذاتية تظهر خطوط أنابيب ETL آلية تعمل بنماذج الرؤية Qwen لتحل محل التصنيف اليدوي.
2026-07-09