فهم الفيديو

3 published articles

الذكاء الاصطناعي4 min read

متعدد الوسائط / مفتوح المصدر

حزمة إضافات Qwen تمنح وكيل البرمجة لديك عينين ويدين وذاكرة فيديو

أصدر فريق Qwen التابع لشركة Alibaba حزمة Qwen-MM-Plugins، وهي مجموعة أدوات بترخيص Apache-2.0 تمنح وكلاء البرمجة مهارات متعددة الوسائط بشكل أصلي: قراءة الصور والفيديو بدقة ديناميكية، والتعرف الضوئي على الحروف (OCR)، والتأريض (grounding)، والتعرف التلقائي على الكلام (ASR)، وذاكرة الفيديو الطويل، وتوليد الفيديو، والتحكم عبر عميل خفيف في Blender وFreeCAD. سكربت واحد يثبّتها عبر Claude Code وCodex وQoder وOpenClaw وQwen Code وGemini CLI.

2026-08-15

الذكاء الاصطناعي4 min read

فهم الفيديو

Gemini 3.6 Flash يحصي تغيّرات الحالة لكنه يفوت الرمش

تُظهر دراسة جديدة على arXiv أن نماذج لغة الفيديو تفشل في التتبّع البسيط للأحداث. يحصي Gemini 3.6 Flash تغيّرات الحالة المستمرة حتى 12 حدثًا، لكنه لا يملك نطاقًا موثوقًا للرمش العابر؛ فالإطارات الإضافية تضخّم الدقة دون استرجاع أمين، ولا تصح سوى 0.2% من الأعداد النهائية ضمن النظام عالي العد.

2026-08-12

نماذج اللغات الكبيرة4 min read

الذكاء الاصطناعي مفتوح المصدر

نموذج AV-Flamingo من Nvidia يتصدى لفهم الفيديو الطويل حيث تفشل معظم النماذج

تطلق Nvidia نموذج AV-Flamingo، وهو نموذج لغوي كبير سمعي-بصري مفتوح المصدر مصمم لفهم الفيديو الطويل والمعقد. يستخدم منهجًا تدريبيًا ثلاثي المراحل وإطار استدلال متسلسل مع طابع زمني للتعامل مع الاستدلال الزمني والمتعدد الوسائط الذي يعيق معظم النماذج.

2026-07-28