多模态 / 开源
Qwen 插件包为你的编码代理装上眼睛、双手和视频记忆
阿里巴巴 Qwen 团队发布了 Qwen-MM-Plugins,这是一个 Apache-2.0 工具包,为编码代理提供原生多模态技能:动态分辨率图像和视频读取、OCR、grounding、ASR、长视频记忆、视频生成,以及通过瘦客户端控制 Blender 和 FreeCAD。一个脚本即可在 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI 中完成安装。

Qwen 发布了一个插件包,将编码代理转变为多模态代理。Qwen-MM-Plugins 以 QwenLM 组织名义发布在 GitHub 上,为运行在 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI 中的代理添加了视觉、音频和 3D 技能。该工具包以 Apache-2.0 开源,其核心承诺在仓库中明确写出:让任何代理框架都具备多模态原生能力。
每个能力安装为一个技能(让模型知晓工具集的存在),外加一个可选的 MCP 服务器来提供工具本身,由 uvx 按需启动。第一个能力名为 core,负责基础视觉,包括对图像、视频、文档和 3D 模型的动态分辨率读取,以及 OCR、grounding、分割、ASR、视觉对话和网页搜索。其余能力包为 video-memory、omni-av、video-edit、blender、freecad 和 edu-agent。
新版 Qwen 仓库包含什么
七个能力包分别安装,仓库中记录了每个包具备的功能。具体如下。
| 能力 | 功能 |
|---|---|
| core | 对图像、视频、文档和 3D 模型进行动态分辨率读取;OCR、grounding、分割、ASR、视觉对话、网页搜索 |
| video-memory | 分层图记忆,用于超长视频问答 |
| omni-av | 全原生音视频理解:带时间戳和说话人标签的 ASR、时序字幕和 grounding、事件计数、音乐标注 |
| video-edit | 视频编辑工作流,外加图像、视频和音频生成 |
| blender | 通过瘦客户端驱动运行中的 Blender,提供 22 个工具:建模、材质、灯光、渲染 |
| freecad | 通过瘦客户端在运行中的 FreeCAD 中进行参数化 CAD,提供 14 个工具;建模、属性编辑、STEP/STL 导入/导出、FEM 分析 |
| edu-agent | 将数学或科学问题转化为逐步讲解的中文教学视频。仅技能,无 MCP 服务器 |
仓库附带 cookbook,展示每个能力的实际用法,包括工具列表、设置步骤和完整案例。Blender 和 FreeCAD 的工具数量很好地体现了该集成的精细程度:Blender 中有 22 个工具用于建模、材质、灯光和渲染,FreeCAD 中有 14 个用于参数化建模和 FEM 分析。
一次安装,通用于 Claude Code、Codex 及其他工具
Qwen 推荐使用引导式安装器,这是一个单一脚本,负责在所有支持的框架中完成安装、配置、验证和卸载。它在底层驱动各框架自身的原生安装,并写入一个共享配置文件 ~/.qwen-mm-plugins/config,因此终端和 GUI 框架读取的是同一份配置。一行命令从仓库中的 install.sh 获取内容。
手动安装也可行。拥有插件市场的框架(仓库中列出为 Claude Code、Qoder、Codex、OpenClaw 和 Qwen Code)可通过将 GitHub 仓库添加为市场并安装指定包来获取能力。其他框架包括 Gemini CLI、opencode、pi 和 QwenPaw,则在各自配置中注册技能和 MCP 服务器。仓库还指出,最简单的方式是直接让代理自行安装该能力。Windows 用户只有一条受支持的路径,即 WSL2;原生 Windows 尚未经过验证。
运行所需条件
依赖设计刻意保持轻量。uvx 会在首次启动时为所选配置安装 Python 依赖,因此无需手动执行 pip。你需要自行安装的只有系统工具:处理视频和音频的 ffmpeg,以及可选的 libreoffice、blender、texlive 或用于可视化的 chromium。运行 bash install.sh verify 会对安装进行自检、确认 API 密钥并报告缺失的系统工具。
原生读取不需要 API 密钥。基于 API 的工具则需要:DASHSCOPE_API_KEY 用于视觉对话、OCR、grounding、转录、全音视频理解、生成和 video-memory 构建;SERPER_API_KEY 用于网页搜索、网页提取和图像搜索。引导式安装器的配置步骤会将这些密钥写入共享配置文件,当环境中不存在相应变量时就会读取该文件。
实际使用中,读取是动态分辨率的:每张图像、每帧视频和每个文档页面都会自动缩放到 VL 模型的 patch 网格。仓库中的示例包括:读取 4K 仪表盘截图中的每一个数字、对收据进行 OCR 并汇总各明细项、在街景中框出每辆汽车、带时间戳地提取两小时讲座的要点、统计体育片段中完成的传球次数,以及为 M6 六角螺栓建模并导出为 STEP 文件。
阿里云显然在押注多模态工作流不应局限于 Qwen 生态内部。这一举措也与 Qwen Studio 在聊天机器人、图像和视频理解、文档处理及网页搜索集成方面的方向一致,也与 Qwen2.5-Omni 一致, , 后者是端到端多模态模型系列,以流式方式处理文本、图像、音频和视频。借助 Qwen-MM-Plugins,同样的能力如今也运行在其他厂商的代理框架之上。许可证为 Apache-2.0,其中 Blender 和 FreeCAD 能力使用了第三方 MIT 许可代码,并附有相应的 NOTICE 文件以保留署名。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。