SevenTnewS

comprensión de video

3 published articles

IA4 min read

Multimodal / Código abierto

El paquete de plugins de Qwen le da a tu agente de código ojos, manos y memoria de video

El equipo de Qwen de Alibaba lanzó Qwen-MM-Plugins, un kit de herramientas Apache-2.0 que brinda a los agentes de código habilidades multimodales nativas: lectura de imágenes y video con resolución dinámica, OCR, grounding, ASR, memoria de video largo, generación de video y control de cliente ligero de Blender y FreeCAD. Un solo script lo instala en Claude Code, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.

2026-08-15

IA4 min read

Comprensión de video

Gemini 3.6 Flash cuenta cambios de estado pero no detecta parpadeos

Los modelos de lenguaje de video fallan en el registro simple de eventos, según muestra un nuevo estudio de arXiv. Gemini 3.6 Flash cuenta cambios de estado persistentes hasta 12 eventos, pero no tiene una región confiable para los parpadeos transitorios; los fotogramas adicionales inflan la precisión sin una recuperación fiel, con solo el 0.2% de los conteos finales correctos en el régimen de conteo alto.

2026-08-12

LLMs y Modelos4 min read

IA de código abierto

AV-Flamingo de Nvidia aborda la comprensión de videos largos donde la mayoría de los modelos fallan

Nvidia lanza AV-Flamingo, un modelo de lenguaje grande audiovisual abierto diseñado para la comprensión de videos largos y complejos. Utiliza un plan de estudios de tres etapas y un marco de cadena de pensamiento con marcas de tiempo para manejar el razonamiento temporal y multimodal que desconcierta a la mayoría de los modelos.

2026-07-28