الذكاء الاصطناعي متعدد الوسائط
9 published articles
نماذج الأساس للرسوم البيانية
النقل بدون تدريب على الرسوم البيانية يعاني من نقطة عمياء متعددة الوسائط. CHARM تقدم حلاً
يستبدل CHARM ميزات العقد المعزولة بسياقات رسوم بيانية منظمة تلتقط الدلالات متعددة الوسائط والعلاقات عبر الوسائط. من خلال تعيين الأنماط الخاصة بالمجال إلى مفاهيم عالية المستوى مشتركة، يحقق النموذج نقلًا بدون تدريب عبر الرسوم البيانية مع النصوص والصور والوسائط الأخرى.
2026-08-01
توليد الفيديو
MiniMax H3 يخفض الأسعار أمام منافسي الفيديو ويخطط لفتح الأوزان
تدمج MiniMax توليد الصور والفيديو والصوت في نموذج واحد، وتسعّر المخرجات بأقل من ثلث أسعار النماذج السائدة لكل ثانية، وتخطط لفتح الأوزان خلال أيام. ويظل السؤال المفتوح: إلى أي مدى تصمد المخرجات خارج عروضها التجريبية الخاصة؟
2026-07-30
الذكاء الاصطناعي
نموذج 7B يتفوق على النماذج الأكبر ويعمل على الهاتف ويغير معادلة تكلفة الذكاء الاصطناعي
نموذج Qwen2.5-Omni من Alibaba Cloud هو نموذج 7B يتعامل مع النصوص والصور والصوت والفيديو، ويولد الكلام والنص في الوقت الفعلي. تعمل هندسة Thinker-Talker وعناصر التموضع TMRoPE على تمكين التفاعل المتدفق، ويعمل المتغير 3B على شرائح SoC المحمولة مثل Snapdragon 8 Gen 1 بسرعات قابلة للاستخدام.
2026-07-23
الذكاء الاصطناعي متعدد الوسائط
Qwen2.5-Omni من علي بابا: نموذج يريد أن يسمع ويرى ويتحدث دفعة واحدة
يعالج Qwen2.5-Omni من سحابة علي بابا النصوص والصور والصوت والفيديو من طرف إلى طرف، ويولد نصًا وكلامًا طبيعيًا في الوقت الفعلي. تظهر المعايير أنه غالبًا ما يتطابق أو يتفوق على النماذج المتخصصة أحادية الوسائط، مما يشير إلى تحول نحو البنى الموحدة.
2026-07-20
الذكاء الاصطناعي متعدد الوسائط
نموذج بحجم 12 مليار معلمة يتفوق على آخر بحجم 90 مليارًا. عقيدة التوسع في خطر
Pixtral-12B يضاهي أو يتفوق على نماذج أكبر منه بسبعة أضعاف في المقاييس متعددة الوسائط، دون التضحية بأداء اللغة. تطلق ميسترال أيضًا معيارًا مفتوحًا جديدًا لتقييم الرؤية واللغة العملي، مما يتحدى فكرة أن الأكبر دائمًا أفضل.
2026-07-17
الذكاء الاصطناعي الفيزيائي
تشغل كيوين من علي بابا الآن أدمغة 150 ألف روبوت وسيارة ونظارة وطائرة درون
تعمل عائلة نماذج كيوين من علي بابا الآن على تشغيل أكثر من 150 ألف جهاز، بدءًا من الروبوتات البشرية وحتى كاميرات الأطفال، حيث تتحول الشركة من روبوتات المحادثة إلى الذكاء الاصطناعي الفيزيائي، لتدمج النماذج متعددة الوسائط في الروبوتات والسيارات والنظارات والطائرات بدون طيار.
2026-07-14
جوجل ديب مايند
Gemma 4 تجعل كل نموذج مفتوح الوزن آخر يبدو أكبر بعشر مرات
عائلة نماذج Gemma 4 مفتوحة الوزن ومتعددة الوسائط بطبيعتها من جوجل ديب مايند تقدم وضع التفكير، وهندسة بدون مشفر، وخيارات خليط الخبراء. نموذج 2.3 مليار معامل يطابق أداء نموذج Gemma 3 ذو 27 مليار معامل. نموذج 31 مليار معامل يتصدر لوحات المتصدرين للنماذج مفتوحة الوزن.
2026-07-13
Alibaba Cloud
EMR Serverless Spark من Alibaba Cloud يعالج الآن الصور والفيديو باستخدام SQL فقط، دون الحاجة إلى بايثون
يدعم EMR Serverless Spark من Alibaba Cloud الآن الصور وأطر الفيديو مباشرة في SQL، مما يسمح لمهندسي البيانات بتجاوز تكاليف بايثون. دراسة حالة حول معالجة بيانات القيادة الذاتية تظهر خطوط أنابيب ETL آلية تعمل بنماذج الرؤية Qwen لتحل محل التصنيف اليدوي.
2026-07-09
مصدر مفتوح
أول وكيل ويب مفتوح المصدر لا يحتاج إلى HTML يتفوق على GPT-4o
وكلاء MolmoWeb، المتوفرون بأحجام 4B و8B، تم تدريبهم على MolmoWebMix، وهي مجموعة بيانات جديدة تجمع أكثر من 130,000 تجربة تركيبية وبشرية. يتفوقون على النماذج المغلقة ويضعون معايير جديدة لأبحاث وكلاء الويب المفتوح.
2026-04-10