الذكاء الاصطناعي متعدد الوسائط

13 published articles

نماذج اللغات الكبيرة5 min read

ذكاء اصطناعي مفتوح الأوزان

dots3-note من شياوهونغشو: نموذج MoE مفتوح الأوزان بـ 280 مليار معامل يُفعّل 16 مليارًا فقط

أصدر استوديو dots التابع لشياوهونغشو نموذج dots3-note preview، أول نموذج بأوزان مفتوحة لديها: نموذج MoE متعدد الوسائط بـ 280 مليار معامل، 16 مليارًا نشطًا، ونافذة سياق تبلغ 512 ألف رمز. يستهدف التصميم المتناثر خفض تكلفة التشغيل على عقدة واحدة مزوّدة بـ 8 وحدات معالجة رسومية، لكن البطاقة التعريفية لم تنشر أرقام المقاييس بعد.

2026-08-20

نماذج اللغات الكبيرة5 min read

توليد الفيديو

MiniMax تخلّت عن معماريتها المُثبتة لكي يقوم H3 بكل شيء

تقول MiniMax إن H3 يوحّد توليد النصوص والصور والفيديو والصوت في نموذج واحد، ويسعّر مخرجات 2K بأقل من ثلث أسعار النماذج السائدة، ويخطط لفتح الأوزان خلال أيام. لكن التفاصيل الصغيرة هي القصة الحقيقية: تخلت الشركة عن المعمارية التي منحتها ميزة للوصول إلى ذلك.

2026-08-07

Qwen / Alibaba4 min read

Qwen / Alibaba Cloud

Qwen2.5-Omni يتفوق على Gemini-1.5-Pro في OmniBench ويعمل بأقل من 12GB

تفوّق نموذج Qwen2.5-Omni مفتوح المصدر من Alibaba على Gemini-1.5-Pro في OmniBench وتصدّر لوحة صدارة MMAU للاستدلال الصوتي. وتخفض النسخ المكمّمة ذاكرة VRAM إلى أقل من 12GB، بينما يوفّر دعم MNN دردشة صوتية فورية على الهواتف.

2026-08-07

إنترنت الأشياء وأجهزة الاستشعار4 min read

مراجعة نموذج

Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط

غوص عميق في النموذج مفتوح المصدر الذي يعالج النصوص والصور والصوت والفيديو في وقت واحد مع توليد كلام متدفق، متفوقًا على GPT-4o-mini وGemini في اختبارات معيارية متعددة، مع إمكانية تشغيله على بطاقة رسومية استهلاكية واحدة مع التكميم.

2026-08-03

المختبرات والأبحاث3 min read

نماذج الأساس للرسوم البيانية

النقل بدون تدريب على الرسوم البيانية يعاني من نقطة عمياء متعددة الوسائط. CHARM تقدم حلاً

يستبدل CHARM ميزات العقد المعزولة بسياقات رسوم بيانية منظمة تلتقط الدلالات متعددة الوسائط والعلاقات عبر الوسائط. من خلال تعيين الأنماط الخاصة بالمجال إلى مفاهيم عالية المستوى مشتركة، يحقق النموذج نقلًا بدون تدريب عبر الرسوم البيانية مع النصوص والصور والوسائط الأخرى.

2026-08-01

الذكاء الاصطناعي4 min read

توليد الفيديو

MiniMax H3 يخفض الأسعار أمام منافسي الفيديو ويخطط لفتح الأوزان

تدمج MiniMax توليد الصور والفيديو والصوت في نموذج واحد، وتسعّر المخرجات بأقل من ثلث أسعار النماذج السائدة لكل ثانية، وتخطط لفتح الأوزان خلال أيام. ويظل السؤال المفتوح: إلى أي مدى تصمد المخرجات خارج عروضها التجريبية الخاصة؟

2026-07-30

Qwen / Alibaba2 min read

الذكاء الاصطناعي

نموذج 7B يتفوق على النماذج الأكبر ويعمل على الهاتف ويغير معادلة تكلفة الذكاء الاصطناعي

نموذج Qwen2.5-Omni من Alibaba Cloud هو نموذج 7B يتعامل مع النصوص والصور والصوت والفيديو، ويولد الكلام والنص في الوقت الفعلي. تعمل هندسة Thinker-Talker وعناصر التموضع TMRoPE على تمكين التفاعل المتدفق، ويعمل المتغير 3B على شرائح SoC المحمولة مثل Snapdragon 8 Gen 1 بسرعات قابلة للاستخدام.

2026-07-23

الذكاء الاصطناعي5 min read

الذكاء الاصطناعي متعدد الوسائط

Qwen2.5-Omni من علي بابا: نموذج يريد أن يسمع ويرى ويتحدث دفعة واحدة

يعالج Qwen2.5-Omni من سحابة علي بابا النصوص والصور والصوت والفيديو من طرف إلى طرف، ويولد نصًا وكلامًا طبيعيًا في الوقت الفعلي. تظهر المعايير أنه غالبًا ما يتطابق أو يتفوق على النماذج المتخصصة أحادية الوسائط، مما يشير إلى تحول نحو البنى الموحدة.

2026-07-20

نماذج اللغات الكبيرة2 min read

الذكاء الاصطناعي متعدد الوسائط

نموذج بحجم 12 مليار معلمة يتفوق على آخر بحجم 90 مليارًا. عقيدة التوسع في خطر

Pixtral-12B يضاهي أو يتفوق على نماذج أكبر منه بسبعة أضعاف في المقاييس متعددة الوسائط، دون التضحية بأداء اللغة. تطلق ميسترال أيضًا معيارًا مفتوحًا جديدًا لتقييم الرؤية واللغة العملي، مما يتحدى فكرة أن الأكبر دائمًا أفضل.

2026-07-17

NLP والتعلم الآليFeatured4 min read

الذكاء الاصطناعي الفيزيائي

تشغل كيوين من علي بابا الآن أدمغة 150 ألف روبوت وسيارة ونظارة وطائرة درون

تعمل عائلة نماذج كيوين من علي بابا الآن على تشغيل أكثر من 150 ألف جهاز، بدءًا من الروبوتات البشرية وحتى كاميرات الأطفال، حيث تتحول الشركة من روبوتات المحادثة إلى الذكاء الاصطناعي الفيزيائي، لتدمج النماذج متعددة الوسائط في الروبوتات والسيارات والنظارات والطائرات بدون طيار.

2026-07-14

نماذج اللغات الكبيرةFeatured4 min read

جوجل ديب مايند

Gemma 4 تجعل كل نموذج مفتوح الوزن آخر يبدو أكبر بعشر مرات

عائلة نماذج Gemma 4 مفتوحة الوزن ومتعددة الوسائط بطبيعتها من جوجل ديب مايند تقدم وضع التفكير، وهندسة بدون مشفر، وخيارات خليط الخبراء. نموذج 2.3 مليار معامل يطابق أداء نموذج Gemma 3 ذو 27 مليار معامل. نموذج 31 مليار معامل يتصدر لوحات المتصدرين للنماذج مفتوحة الوزن.

2026-07-13

نماذج اللغات الكبيرة2 min read

Alibaba Cloud

EMR Serverless Spark من Alibaba Cloud يعالج الآن الصور والفيديو باستخدام SQL فقط، دون الحاجة إلى بايثون

يدعم EMR Serverless Spark من Alibaba Cloud الآن الصور وأطر الفيديو مباشرة في SQL، مما يسمح لمهندسي البيانات بتجاوز تكاليف بايثون. دراسة حالة حول معالجة بيانات القيادة الذاتية تظهر خطوط أنابيب ETL آلية تعمل بنماذج الرؤية Qwen لتحل محل التصنيف اليدوي.

2026-07-09

← PreviousPage 1 / 2 · 13 articlesNext →