SevenTnewS

Modelos de video de frontera: informe especial

Perceptron Mk1 apuesta el futuro de la IA de video a observar, no a crear

Perceptron Mk1 es un modelo de visión y lenguaje de código cerrado con un precio pensado para uso continuo, orientado a la comprensión de video con marcas de tiempo y al razonamiento encarnado. La verdadera carrera de la IA de video no consiste en crear clips más bonitos, y los benchmarks que mezclan ambas categorías inducen a error.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-06 · 6 min de lectura

Perceptron Mk1 apuesta el futuro de la IA de video a observar, no a crear

La división más importante en la IA de video no tiene nada que ver con lo realistas que se ven los clips. Está entre los modelos que generan video y los modelos que entienden el video. Los problemas empresariales rara vez empiezan con un prompt como «genera una escena cinematográfica de almacén». Empiezan con preguntas: ¿El operador escaneó el código de barras antes de colocar la caja en la cinta transportadora? ¿El agarre del robot tuvo éxito o se deslizó? ¿Cuándo bloqueó el montacargas la cámara?

Esas son tareas de comprensión: razonamiento temporal, seguimiento de objetos, OCR, localización de eventos, grounding espacial y salida estructurada. Los modelos de generación no aportan nada de eso, y cualquier ranking de «los mejores modelos de video» que mezcle las dos categorías lo oculta.

Contenidos

La división que importa: generación versus comprensión

Perceptron Mk1 se sitúa en la rama de la comprensión. Perceptron lo define como un modelo insignia de visión y lenguaje de código cerrado para imágenes, video y soporte de razonamiento, enmarca el lanzamiento en torno a «video de frontera y razonamiento encarnado» y documenta el ID del modelo como perceptron-mk1: entradas de texto, imagen y video, salida de texto y ventana de contexto de 32K tokens.

Schéma : Challenges of Video Understanding
Los siete desafíos de la comprensión de video que enumera el artículo se remontan a cómo el tiempo complica la percepción, según la guía de Perceptron Mk1.

Hay una razón de investigación por la que esta categoría importa más allá de las demostraciones. S-EMBER, un benchmark de comprensión de video de nuestro informe sobre grounding temporal, descubrió que el razonamiento semántico sigue mejorando con la escala mientras que la precisión del grounding temporal se mantiene plana al escalar parámetros, resolución o fotogramas por segundo. Los modelos más grandes no obtienen marcas de tiempo más fiables.

Perceptron Mk1: construido para observar, con precio para funcionar

La especificación oficial: $0.15 por millón de tokens de entrada, $1.50 por millón de tokens de salida, compatibilidad con PNG, JPEG, WebP, MP4 y WebM, razonamiento opcional y video analizado a una frecuencia de fotogramas dinámica de hasta 2 FPS dentro del contexto de 32K. Perceptron afirma que Mk1 es el primer modelo de una nueva familia de código cerrado, supera a la anterior serie Isaac de código abierto en imagen, video y razonamiento encarnado, e iguala el rendimiento de frontera a un coste materialmente menor. La guía está vigente al 12 de mayo de 2026 y advierte de que las páginas de los proveedores y las condiciones de acceso cambian rápidamente; verifique los precios antes de la compra.

El precio es la parte silenciosa. La inferencia de video es cara porque un clip se convierte en muchos tokens visuales. Para que sirva de referencia, nuestra cobertura del lanzamiento de Claude Sonnet 5 registró un precio de lanzamiento de $2 por millón de tokens de entrada y $10 por millón de tokens de salida, y el cambio de precios de V4 de DeepSeek fijó los tokens de salida en $1.74 por millón durante el horario laboral. Con esas cifras, Mk1 queda por debajo de ambos modelos insignia mientras acepta entradas de video.

Las superficies del producto parecen una lista de verificación de flujos de trabajo, no un chatbot. Video Q&A acepta un MP4 o WebM y responde preguntas fundamentadas. El recorte de video devuelve segmentos con marcas de tiempo. El aprendizaje en contexto permite mostrar un clip de referencia y buscar en el metraje nuevo coincidencias. La salida estructurada limita las respuestas a modelos Pydantic, JSON Schema o regex, con point, box, polygon, track y clip como salidas de primera clase.

El material de lanzamiento hace explícita la intención. Un equipo de logística no quiere un modelo que se limite a decir que hay un palé. Quiere un registro de eventos sobre el que pueda actuar: {"event": "pallet_arrived", "camera": "dock_3", "start": 217.4, "end": 229.8, "confidence": 0.84}.

Por qué el video es más difícil que las imágenes

Una imagen fija te dice que hay una taza sobre una mesa. Un video te dice que alguien la levantó, dudó, sirvió agua, la devolvió, la volcó y limpió la mesa. Cada evento depende del tiempo, y el tiempo introduce problemas que los modelos de imagen nunca enfrentan.

La guía enumera siete: orden temporal (¿se escaneó el código de barras antes de que la caja llegara a la cinta transportadora?), permanencia de objetos (la misma caja pasando detrás de un carro), reconocimiento de acciones (inclinarse cerca de una máquina no es pulsar el botón de parada de emergencia), grounding temporal (la marca de tiempo es el producto), fusión multimodal (diapositivas, voz, marcadores, alarmas), memoria de largo horizonte (horas de metraje, eventos dispersos) y estructura de salida (JSON, cajas, tracks, clips). Por eso la fortaleza del VQA de imágenes no se transfiere.

Dos familias de productos, dos conjuntos competitivos

La rama de generación es la que todo el mundo conoce: Veo 3.1 y Veo 3.1 Lite de Google, Runway Gen-4.5, Luma Ray, Kling, Seedance y Sora 2 Pro de OpenAI con audio sincronizado. Una nota de planificación: la documentación actual de la API de Sora marca los modelos de generación Sora 2 y la API de Videos como obsoletos, con cierre programado para el 24 de septiembre de 2026.

La rama de comprensión tiene su propia estructura. Gemini es el benchmark amplio: Gemini 3.1 Pro, nativamente multimodal, admite una ventana de contexto de hasta 1M de tokens, y su documentación de video cubre marcas de tiempo, la API de Files, Cloud Storage y URLs de YouTube. Qwen3-VL es la vía de pesos abiertos, desde 2B densos hasta una mezcla de expertos de 235B-A22B, con contexto nativo de 256K ampliable a 1M. Cosmos Reason 2, en tamaños de 2B, 8B y 32B, está diseñado para IA física con localización de puntos en 2D y 3D. TwelveLabs divide el trabajo: Marengo para búsqueda semántica y Pegasus para resúmenes y video a texto.

Llama 4 Scout y Maverick son modelos multimodales abiertos entrenados con fotogramas estáticos de video, útiles en sistemas basados en fotogramas, pero no son una API nativa de análisis de video. Claude se centra en imágenes y es más fuerte como capa de razonamiento sobre fotogramas extraídos. En OpenAI, la API se centra en entrada de texto e imagen, por lo que los equipos construyen pipelines de extracción de fotogramas. Mk1 se sitúa de lleno en la rama de comprensión: Gemini es el benchmark de capacidad con el que medirlo, mientras que Qwen3-VL y Cosmos Reason 2 siguen siendo las alternativas de pesos abiertos cuando el autoalojamiento importa.

ModeloAccesoMejor encaje
Perceptron Mk1API, código cerradoPreguntas y respuestas con marcas de tiempo, recorte de video, anotación robótica
Gemini 3.1 ProAPI, nubePreguntas y respuestas sobre video largo, razonamiento multimodal
Qwen3-VLPesos abiertosDespliegues multimodales autoalojados
Cosmos Reason 2Modelo abierto, ecosistema NVIDIARobótica, video industrial, IA física
TwelveLabs Marengo / PegasusAPI, plataformaBúsqueda de video y video a texto

Cómo leer los benchmarks de video sin engañarte</h2

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.