视频理解
3 published articles
人工智能4 min read
多模态 / 开源
Qwen 插件包为你的编码代理装上眼睛、双手和视频记忆
阿里巴巴 Qwen 团队发布了 Qwen-MM-Plugins,这是一个 Apache-2.0 工具包,为编码代理提供原生多模态技能:动态分辨率图像和视频读取、OCR、grounding、ASR、长视频记忆、视频生成,以及通过瘦客户端控制 Blender 和 FreeCAD。一个脚本即可在 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI 中完成安装。
2026-08-15
人工智能4 min read
视频理解
Gemini 3.6 Flash 能数清状态变化,却漏掉眨眼
一项新的 arXiv 研究表明,视频语言模型在简单的事件记录任务上表现失败。Gemini 3.6 Flash 最多可正确计数 12 个持续性状态变化事件,但对瞬时眨眼没有可靠的计数区间;额外帧推高了准确率,却无法实现忠实的恢复,高计数场景下最终计数正确的比例仅为 0.2%。
2026-08-12
大语言模型与模型4 min read
开源AI
英伟达AV-Flamingo:攻克长视频理解,碾压多数模型
英伟达发布AV-Flamingo,一款专为长视频、复杂视频理解设计的开源音视频大语言模型。它采用三阶段课程学习法和带时间戳的思维链框架,能够处理许多模型难以应对的时间推理与跨模态推理任务。
2026-07-28