نماذج الفيديو الحدودية: تقرير خاص
Perceptron Mk1 يراهن على مستقبل ذكاء الفيديو في المشاهدة لا في التوليد
Perceptron Mk1 نموذج لغوي-بصري مغلق المصدر مُسعّر للاستخدام المستمر، موجّه نحو فهم الفيديو الموقّع زمنيًا والاستدلال المتجسّد. سباق ذكاء الفيديو الحقيقي لا يدور حول صنع مقاطع أجمل، والمعايير التي تمزج الفئتين معًا تضلل.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-06 · قراءة 6 دقائق

أهم انقسام في ذكاء الفيديو لا علاقة له بمدى واقعية المقاطع. إنه بين النماذج التي تصنع الفيديو والنماذج التي تفهم الفيديو. نادرًا ما تبدأ مشكلات المؤسسات بطلب مثل «ولّد مشهد مستودع سينمائي». بل تبدأ بأسئلة: هل مسح المشغّل رمز الباركود قبل وضع الصندوق على الناقل؟ هل نجحت قبضة الروبوت أم انزلقت؟ متى حجبت الرافعة الشوكية الكاميرا؟
تلك مهام فهم: استدلال زمني، تتبع كائنات، تعرّف على النصوص (OCR)، تموضع أحداث، إسناد مكاني، مخرجات منظمة. نماذج التوليد لا تقدم أيًا من ذلك، وأي ترتيب لـ«أفضل نموذج فيديو» يخلط الفئتين يخفي هذه الحقيقة.
المحتويات
- الانقسام المهم: التوليد مقابل الفهم
- Perceptron Mk1: مبني للمشاهدة ومُسعّر للتشغيل
- لماذا الفيديو أصعب من الصور
- عائلتا منتجات، ومجموعتان تنافسيتان
- كيف تقرأ معايير الفيديو دون خداع نفسك
- أين تتجه خطوات فهم الفيديو التالية
الانقسام المهم: التوليد مقابل الفهم
يقع Perceptron Mk1 في فرع الفهم. تصفه Perceptron بأنه نموذج لغوي-بصري رائد مغلق المصدر لدعم الصور والفيديو والاستدلال، وتؤطر الإطلاق حول «الفيديو الحدودي والاستدلال المتجسّد»، وتوثّق معرّف النموذج باسم perceptron-mk1: مدخلات نصية وصورية وفيديو، ومخرجات نصية، ونافذة سياقية من 32 ألف رمز.

هناك سبب بحثي يجعل هذه الفئة مهمة أبعد من العروض التوضيحية. وجد معيار S-EMBER لفهم الفيديو، الوارد في تقريرنا عن الإسناد الزمني، أن الاستدلال الدلالي يتحسن باستمرار مع التوسع في حين تظل دقة الإسناد الزمني ثابتة عند زيادة المعاملات أو الدقة أو الإطارات في الثانية. النماذج الأكبر لا تكسب طوابع زمنية أكثر موثوقية.
Perceptron Mk1: مبني للمشاهدة ومُسعّر للتشغيل
المواصفات الرسمية: 0.15 دولار لكل مليون رمز إدخال، و1.50 دولار لكل مليون رمز إخراج، ودعم PNG وJPEG وWebP وMP4 وWebM، واستدلال اختياري، وفيديو يُحلَّل بمعدل إطارات ديناميكي يصل إلى إطارين في الثانية داخل نافذة السياق البالغة 32 ألف رمز. تقول Perceptron إن Mk1 هو أول نموذج في عائلة جديدة مغلقة المصدر، ويتفوق على سلسلة Isaac مفتوحة المصدر السابقة في الصور والفيديو والاستدلال المتجسّد، ويطابق أداء النماذج الحدودية بتكلفة أقل بكثير. الدليل محدث حتى 12 مايو 2026، ويحذر من أن صفحات البائعين وشروط الوصول تتغير بسرعة؛ تحقق من التسعير قبل الشراء.
السعر هو الجزء الصامت. استدلال الفيديو مكلف لأن المقطع الواحد يتحول إلى عدد كبير من الرموز البصرية. على سبيل المقارنة، رصد تغطيتنا لإطلاق Claude Sonnet 5 سعرًا تمهيديًا قدره 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، وتحول تسعير DeepSeek V4 جعل رموز الإخراج بسعر 1.74 دولار لكل مليون خلال ساعات العمل. وبهذه الأرقام، يقلل Mk1 من سعر النموذجين الرئيسيين مع قبوله مدخلات فيديو.
تقرأ واجهات المنتج كقائمة مهام عمل، لا كمساعد دردشة. ميزة الأسئلة والأجوبة عن الفيديو تأخذ ملف MP4 أو WebM وتجيب عن أسئلة مستندة إلى المحتوى. ميزة قص الفيديو تُرجع مقاطع ذات طوابع زمنية. التعلّم داخل السياق يتيح لك عرض مقطع مرجعي والبحث في لقطات جديدة عن تطابقات. المخرجات المنظمة تقيّد الاستجابات وفق نماذج Pydantic أو JSON Schema أو regex، مع النقطة والمربع والمضلع والمسار والمقطع كمخرجات من الدرجة الأولى.
تجعل مواد الإطلاق النية صريحة. فريق لوجستي لا يريد نموذجًا يقول فقط إن منصة نقالة موجودة. إنه يريد سجل حدث يمكنه التصرف بناءً عليه: {"event": "pallet_arrived", "camera": "dock_3", "start": 217.4, "end": 229.8, "confidence": 0.84}.
لماذا الفيديو أصعب من الصور
الصورة الثابتة تخبرك أن كوبًا على الطاولة. الفيديو يخبرك أن شخصًا التقطه، وتردد، وسكب الماء، وأعاده، وأسقطه، ومسح الطاولة. كل حدث يعتمد على الزمن، والزمن يطرح مشكلات لا تواجهها نماذج الصور أبدًا.
يسرد الدليل سبعًا: الترتيب الزمني (هل مُسح الباركود قبل أن يصطدم الصندوق بالناقل؟)، ثبات الأشياء (نفس الصندوق يمر خلف عربة)، التعرف على الأفعال (الانحناء بالقرب من آلة ليس الضغط على زر التوقف الطارئ)، الإسناد الزمني (الطابع الزمني هو المنتج)، الدمج متعدد الوسائط (شرائح، كلام، لوحات نتائج، إنذارات)، ذاكرة المدى الطويل (ساعات من اللقطات، أحداث متفرقة)، وبنية المخرجات (JSON، صناديق، مسارات، مقاطع). لهذا السبب لا تنتقل قوة الإجابة عن أسئلة الصور إلى الفيديو.
عائلتا منتجات، ومجموعتان تنافسيتان
فرع التوليد هو ما يعرفه الجميع: Veo 3.1 وVeo 3.1 Lite من Google، وRunway Gen-4.5، وLuma Ray، وKling، وSeedance، وSora 2 Pro من OpenAI مع الصوت المتزامن. ملاحظة تخطيطية: توثيق Sora API الحالي يضع نماذج توليد Sora 2 وVideos API في قائمة الإهمال، ومن المقرر إيقافها في 24 سبتمبر 2026.
لفرع الفهم بنيته الخاصة. Gemini هو المعيار الواسع: نموذج Gemini 3.1 Pro متعدد الوسائط أصليًا يدعم حتى نافذة سياقية من مليون رمز، وتغطي وثائق الفيديو الخاصة به الطوابع الزمنية وواجهة Files API وCloud Storage وعناوين YouTube. Qwen3-VL هو مسار الأوزان المفتوحة، من 2B كثيف إلى 235B-A22B خليط خبراء، بسياق أصلي 256K قابل للتوسعة إلى 1M. صُمم Cosmos Reason 2 بأحجام 2B و8B و32B للذكاء الاصطناعي الفيزيائي مع تموضع نقاط ثنائي وثلاثي الأبعاد. تقسم TwelveLabs المهمة: Marengo للبحث الدلالي، وPegasus للملخصات وتحويل الفيديو إلى نص.
Llama 4 Scout وMaverick نموذجان مفتوحان متعددا الوسائط دُرّبا على إطارات فيديو ثابتة، مفيدان في الأنظمة القائمة على الإطارات لكنهما ليسا واجهة برمجة تطبيقات أصلية لتحليل الفيديو. Claude يتمحور حول الصور، وهو الأقوى كطبقة استدلال فوق الإطارات المستخرجة. قصة OpenAI في واجهات البرمجة هي إدخال نص وصور، لذا تبني الفرق خطوط استخراج إطارات. يقع Mk1 بوضوح في فرع الفهم: Gemini هو المعيار المرجعي للقدرات لقياسه ضده، بينما يظل Qwen3-VL وCosmos Reason 2 البديلين مفتوحَي الأوزان عندما تكون الاستضافة الذاتية مهمة.
| النموذج | الوصول | الأنسب |
|---|---|---|
| Perceptron Mk1 | API، مغلق المصدر | أسئلة وأجوبة بزمن محدد، قص المقاطع، تعليق توضيحي للروبوتات |
| Gemini 3.1 Pro | API، سحابي | أسئلة وأجوبة لفيديو طويل، استدلال متعدد الوسائط |
| Qwen3-VL | أوزان مفتوحة | نشر متعدد الوسائط ذاتي الاستضافة |
| Cosmos Reason 2 | نموذج مفتوح، نظام NVIDIA البيئي | الروبوتات، فيديو صناعي، ذكاء اصطناعي فيزيائي |
| TwelveLabs Marengo / Pegasus | API، منصة | بحث فيديو وتحويل فيديو إلى نص |
كيف تقرأ معايير الفيديو دون خداع نفسك
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.