comprensión de video
3 published articles
Multimodal / Código abierto
El paquete de plugins de Qwen le da a tu agente de código ojos, manos y memoria de video
El equipo de Qwen de Alibaba lanzó Qwen-MM-Plugins, un kit de herramientas Apache-2.0 que brinda a los agentes de código habilidades multimodales nativas: lectura de imágenes y video con resolución dinámica, OCR, grounding, ASR, memoria de video largo, generación de video y control de cliente ligero de Blender y FreeCAD. Un solo script lo instala en Claude Code, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.
2026-08-15
Comprensión de video
Gemini 3.6 Flash cuenta cambios de estado pero no detecta parpadeos
Los modelos de lenguaje de video fallan en el registro simple de eventos, según muestra un nuevo estudio de arXiv. Gemini 3.6 Flash cuenta cambios de estado persistentes hasta 12 eventos, pero no tiene una región confiable para los parpadeos transitorios; los fotogramas adicionales inflan la precisión sin una recuperación fiel, con solo el 0.2% de los conteos finales correctos en el régimen de conteo alto.
2026-08-12
IA de código abierto
AV-Flamingo de Nvidia aborda la comprensión de videos largos donde la mayoría de los modelos fallan
Nvidia lanza AV-Flamingo, un modelo de lenguaje grande audiovisual abierto diseñado para la comprensión de videos largos y complejos. Utiliza un plan de estudios de tres etapas y un marco de cadena de pensamiento con marcas de tiempo para manejar el razonamiento temporal y multimodal que desconcierta a la mayoría de los modelos.
2026-07-28