Multimodal / Código abierto
El paquete de plugins de Qwen le da a tu agente de código ojos, manos y memoria de video
El equipo de Qwen de Alibaba lanzó Qwen-MM-Plugins, un kit de herramientas Apache-2.0 que brinda a los agentes de código habilidades multimodales nativas: lectura de imágenes y video con resolución dinámica, OCR, grounding, ASR, memoria de video largo, generación de video y control de cliente ligero de Blender y FreeCAD. Un solo script lo instala en Claude Code, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-15 · 4 min de lectura

Qwen ha lanzado un paquete de plugins que convierte a los agentes de código en agentes multimodales. Qwen-MM-Plugins, publicado en GitHub bajo la organización QwenLM, añade habilidades de visión, audio y 3D a los agentes que se ejecutan dentro de Claude Code, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI. El kit de herramientas es de código abierto bajo Apache-2.0, con la promesa central expresada claramente en el repositorio: hacer que cualquier harness de agente sea multimodal nativo.
Cada capacidad se instala como una skill, de modo que el modelo sabe que el conjunto de herramientas existe, más un servidor MCP opcional que proporciona las propias herramientas, lanzado bajo demanda por uvx. La primera capacidad se llama core. Maneja la visión fundamental, es decir, lectura con resolución dinámica de imágenes, videos, documentos y modelos 3D, además de OCR, grounding, segmentación, ASR, chat de visión y búsqueda web. Los demás paquetes son video-memory, omni-av, video-edit, blender, freecad y edu-agent.
Qué incluye el nuevo repositorio de Qwen
Los siete paquetes de capacidades se instalan por separado, y el repositorio documenta qué funciones aporta cada uno. El desglose es el siguiente.
| Capacidad | Qué hace |
|---|---|
| core | Lectura con resolución dinámica de imágenes, videos, documentos y modelos 3D; OCR, grounding, segmentación, ASR, chat de visión, búsqueda web |
| video-memory | Memoria de grafo jerárquica para QA sobre videos muy largos |
| omni-av | Comprensión omni-nativa de audio/video: ASR con marcas de tiempo y etiquetas de hablante, subtitulado temporal y grounding, conteo de eventos, etiquetado de música |
| video-edit | Flujos de trabajo de edición de video más generación de imágenes, video y audio |
| blender | Controla una instancia de Blender en ejecución mediante un cliente ligero con 22 herramientas: modelado, materiales, iluminación, renderizado |
| freecad | CAD paramétrico en un FreeCAD en ejecución mediante un cliente ligero con 14 herramientas; modelado, edición de propiedades, importación/exportación STEP/STL, análisis FEM |
| edu-agent | Convierte un problema de matemáticas o ciencias en un video explicativo en chino paso a paso. Solo skill, sin servidor MCP |
El repositorio incluye cookbooks que muestran cada capacidad en acción con listados de herramientas, configuración y casos prácticos. Los recuentos de herramientas de Blender y FreeCAD son una buena ventana a lo granular de la integración: 22 herramientas para modelado, materiales, iluminación y renderizado en Blender, 14 para modelado paramétrico y análisis FEM en FreeCAD.
Instala una vez, úsalo en Claude Code, Codex y el resto
Qwen recomienda un instalador guiado, un solo script que gestiona la instalación, configuración, verificación y desinstalación en todos los harness compatibles. Impulsa la instalación nativa de cada harness bajo el capó y escribe un archivo de configuración compartido en ~/.qwen-mm-plugins/config, de modo que los harness de terminal y de interfaz gráfica lean la misma configuración. El comando de una línea descarga desde install.sh en el repositorio.
La instalación manual también funciona. Los harness con marketplaces de plugins, que el repositorio enumera como Claude Code, Qoder, Codex, OpenClaw y Qwen Code, incorporan una capacidad añadiendo el repositorio de GitHub como marketplace e instalando un paquete con nombre. Otros harness, incluidos Gemini CLI, opencode, pi y QwenPaw, registran la skill y el servidor MCP en su propia configuración. El repositorio señala que la vía más fácil es simplemente pedirle al agente que instale la capacidad. Los usuarios de Windows tienen una única ruta compatible, WSL2; Windows nativo aún no ha sido validado.
Qué se necesita para ejecutarlo
La historia de dependencias es deliberadamente ligera. uvx instala las dependencias de Python para el perfil elegido en el primer lanzamiento, por lo que no hay pip manual. Lo único que instalas tú mismo son herramientas del sistema: ffmpeg para video y audio, más libreoffice, blender, texlive o chromium opcionales para visualización. Un comando bash install.sh verify autocomprueba la configuración, confirma la clave de API e informa de las herramientas del sistema que faltan.
La lectura nativa no necesita clave de API. Las herramientas basadas en API sí: DASHSCOPE_API_KEY cubre chat de visión, OCR, grounding, transcripción, comprensión omni de audio-video, generación y construcción de video-memory; SERPER_API_KEY cubre búsqueda web, extractor web y búsqueda de imágenes. El paso de configuración del instalador guiado las escribe en el archivo de configuración compartido, que se lee cuando una variable no está ya en el entorno.
En la práctica, la lectura es de resolución dinámica: cada imagen, fotograma de video y página de documento se redimensiona automáticamente a la cuadrícula de parches del modelo VL. Los ejemplos del repositorio incluyen leer cada número en una captura de pantalla de un panel 4K, pasar un recibo por OCR y totalizar las líneas de artículos, dibujar cajas alrededor de cada coche en una escena callejera, pedir los puntos principales de una conferencia de dos horas con marcas de tiempo, contar los pases completados en un clip deportivo y modelar un perno hexagonal M6 y exportarlo como STEP.
Alibaba Cloud apuesta claramente por que los flujos de trabajo multimodales no pertenezcan solo al ecosistema de Qwen. El movimiento también coincide con la dirección observada en su trabajo con Qwen Studio en chatbot, comprensión de imágenes y video, procesamiento de documentos e integración de búsqueda web, y en Qwen2.5-Omni, la familia de modelos multimodales de extremo a extremo que maneja texto, imágenes, audio y video en un flujo. Con Qwen-MM-Plugins, las mismas capacidades ahora se montan sobre los harness de agentes de otros proveedores. La licencia es Apache-2.0, con código de terceros con licencia MIT incluido para las capacidades de Blender y FreeCAD, y archivos NOTICE específicos incluidos para la atribución.
- Fuente : Qwen-MM-Plugins repository README
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.