الرؤية والانتشار
توليد الصور والفيديو ونماذج متعددة الوسائط.
8 published articles
أبحاث الذكاء الاصطناعي للفيديو
كيف يوقف التقطير المطابق للسياق معلمي الفيديو عن رؤية المستقبل
درّب تقطير الفيديو طويلًا طلابًا سببيين ضد معلّمين يقيّمون مقاطع كاملة بمعرفة مستقبلية. يستبدل CMD هذا التقييم بمعلّم سببي، ويضيف أهدافًا تُقيَّم بادئيًا، ويفيد بنتائج من الطراز الأول بين الأساليب الانحدارية الذاتية.
2026-08-14
أدوات تصميم بالذكاء الاصطناعي
بدّل عنصرًا واحدًا، وتُعيد قوالب Reve رسم الباقي
تحوّل قوالب Reve لقطة منتج واحدة إلى تصميم متكامل: استبدل المنتج أو النص ويتحدّث باقي القالب تلقائيًا. الميزة متاحة الآن على Reve.com.
2026-08-08
الرؤية الحاسوبية
CABiNet يبقى ضمن نقطتين من YOLO26x مع ثُمن القدرة الحاسوبية
مجموعة نماذج VDD للتجزئة الدلالية تقدم نماذج YOLO26 وCABiNet المدربة على لقطات طائرات متنوعة إلى Hugging Face. يتصدر YOLO26x-sem بنتيجة 78.83% mIoU، لكن نتيجة CABiNet-Large البالغة 77.76% عند 54.8 GFLOPs تطرح قضية الكفاءة.
2026-08-07
توليد الفيديو بالذكاء الاصطناعي
Wan3.0-Video يُفوتر بالثانية: مقطع من 30 ثانية يصل إلى 6 دولارات
يُفوتر Wan3.0-Video من Alibaba بالثانية على DashScope، حيث يكلف مقطع بدقة 1080P لمدة 30 ثانية 6 دولارات لكل عملية توليد. نستعرض طبقات التسعير، وسير عمل الإدخال المتعدد، والأسئلة التي يتركها الإدراج دون إجابة.
2026-08-07
AI image generation
Reve 2.1 يحقق المركز الثاني على Arena بعُشر القدرة الحاسوبية
تدّعي Reve 2.1 احتلال المركز الثاني على لوحات صدارة Arena بعد تدريبها على أقل من عُشر قوة الحوسبة التي استخدمتها المختبرات حولها. كما تكشف الشركة تفاصيل الإخراج بدقة 4K والمناطق القابلة للعنونة وعرض النصوص متعدد اللغات.
2026-08-05
الرؤية الحاسوبية، النماذج العالمية وأبحاث الذكاء الاصطناعي
PhiZero: تعليم الذكاء الاصطناعي للفيديو التفكير في الفيزياء قبل العرض
PhiZero، نموذج عالمي من CASIA، يتعلم «لغة فيزيائية» منفصلة ومضغوطة من الفيديو الخام ويستخدمها للتفكير في كيفية تطور المشهد قبل عرض الإطارات. يجادل المؤلفون بأن تصميم التفكير-ثم-العرض هذا ينتج فيديو أكثر تماسكاً فيزيائياً من التنبؤ المباشر بالبكسل.
2026-07-31
أبحاث الذكاء الاصطناعي
VideoCoCo يصلح فيزياء فيديو الذكاء الاصطناعي المعطوبة بالتفكير في كود Blender
يتعامل VideoCoCo مع كود Blender القابل للتنفيذ كسلسلة تفكير: وكيل برمجة يكتب سيناريو المشهد، ومحاكٍ يشغّله، ومحرك فيديو يجعل النتيجة واقعية فوتوغرافيًا. يستهدف هذا التقسيم مشكلة الفيزياء في تحويل النص إلى فيديو ويحقق أفضل متوسط نتائج على PhyGenBench وVBench-2.0.
2026-07-30
توليد الصور بالذكاء الاصطناعي
أداة الصور الصينية بالذكاء الاصطناعي التي أصلحت ما عجز عنه ميدجورني
أداة GLM-Image من Zhipu AI تسد فجوة واضحة في توليد الصور بالذكاء الاصطناعي: عرض النص الصيني بدقة، مجانًا، بدون حدود أو علامات مائية. أداة عملية للمبدعين الناطقين بالصينية.
2026-07-17