前沿视频模型:特别报道
Perceptron Mk1 押注视频AI的未来在于观看而非生成
Perceptron Mk1 是一款闭源视觉语言模型,定价适合持续运行,目标应用于带时间戳的视频理解和具身推理。AI视频真正的竞赛不在于生成更精美的片段,而将两类模型混在一起的基准测试会误导人。

AI视频中最关键的分野与片段外观的真实度无关,而在于生成视频的模型与理解视频的模型之间。企业问题很少以“生成一个电影感的仓库场景”这样的提示词开始。它们始于问题:操作员在将箱子放到传送带上之前是否扫描了条形码?机器人的抓取是成功还是滑落?叉车在什么时候挡住了摄像头?
这些都属于理解任务:时间推理、目标跟踪、OCR、事件定位、空间定位、结构化输出。生成模型无法提供其中任何一项,而任何将两类模型混为一谈的“最佳视频模型”排行榜都会掩盖这一点。
目录
关键分野:生成与理解
Perceptron Mk1 属于理解分支。Perceptron 称其为旗舰级闭源视觉语言模型,支持图像、视频和推理,并以“前沿视频与具身推理”为核心发布,同时将模型 ID 记录为 perceptron-mk1:文本、图像和视频输入,文本输出,32K token 上下文窗口。

除了演示之外,这一类别的价值还有研究层面的原因。S-EMBER 是一个视频理解基准,出自我们关于时间定位的报道。该基准发现,语义推理会随规模持续提升,而时间定位精度在扩大参数、分辨率或每秒帧数时却保持不变。更大的模型并不会带来更可靠的时间戳。
Perceptron Mk1:为观看而生,为运行而定价
官方规格:每百万输入 token 0.15 美元,每百万输出 token 1.50 美元,支持 PNG、JPEG、WebP、MP4 和 WebM,可选推理模式,视频在 32K 上下文内以最高 2 FPS 的动态帧率进行分析。Perceptron 表示,Mk1 是一个新闭源系列的首款模型,在图像、视频和具身推理方面超越了此前的开源 Isaac 系列,并以显著更低的成本匹配前沿性能。该指南信息截至 2026 年 5 月 12 日,并提醒供应商页面和访问条款变化很快;采购前请核实定价。
价格是最容易被忽略的部分。视频推理成本高昂,因为一个片段会变成大量视觉 token。作为参考,我们对 Claude Sonnet 5 发布的报道记录了每百万输入 token 2 美元、每百万输出 token 10 美元的入门定价,而DeepSeek V4 的定价调整将工作时间的输出 token 定价为每百万 1.74 美元。按这些数字计算,Mk1 在支持视频输入的同时,价格低于这两款旗舰模型。
产品界面看起来像工作流清单,而非聊天机器人。视频Q&A接受MP4或WebM,并回答基于视频内容的问题。视频剪辑返回带时间戳的片段。上下文学习允许你展示一个参考片段,并在新素材中搜索匹配项。结构化输出将响应约束为 Pydantic 模型、JSON Schema 或正则表达式,并将点、框、多边形、轨迹和片段作为一等输出。
发布材料明确表达了这一意图。物流团队不想要一个仅仅说“托盘存在”的模型。他们想要的是可以直接采取行动的事件记录:{"event": "pallet_arrived", "camera": "dock_3", "start": 217.4, "end": 229.8, "confidence": 0.84}。
为什么视频比图像更难
一张静态图片告诉你杯子在桌子上。一段视频则告诉你有人拿起它、犹豫了一下、倒了水、把它放回去、碰倒了它,然后擦干了桌子。每个事件都依赖于时间,而时间带来的问题是图像模型从未面对过的。
该指南列出了七项:时间排序(条形码是在箱子碰到传送带之前扫描的吗)、物体恒存性(同一个箱子经过手推车后方)、动作识别(靠在机器旁不等于按下紧急停止按钮)、时间定位(时间戳就是产品本身)、多模态融合(幻灯片、语音、记分牌、警报)、长时记忆(数小时的素材、稀疏事件)以及输出结构(JSON、框、轨迹、片段)。这就是图像VQA的能力无法迁移的原因。
两个产品家族,两个竞争格局
生成分支是人人都知道的那个:Google 的 Veo 3.1 和 Veo 3.1 Lite、Runway Gen-4.5、Luma Ray、Kling、Seedance,以及带同步音频的 OpenAI Sora 2 Pro。一个规划提示:当前的 Sora API 文档将 Sora 2 生成模型和 Videos API 标记为已弃用,计划于 2026 年 9 月 24 日关闭。
理解分支有自己的格局。Gemini 是宽泛的基准:原生多模态的 Gemini 3.1 Pro 支持高达 1M token 的上下文窗口,其视频文档涵盖时间戳、Files API、Cloud Storage 和 YouTube URL。Qwen3-VL 是开放权重路线,从 2B 稠密模型到 235B-A22B 的混合专家模型,原生 256K 上下文可扩展至 1M。Cosmos Reason 2 提供 2B、8B 和 32B 三种尺寸,专为物理AI设计,支持 2D 和 3D 点定位。TwelveLabs 将任务拆分:Marengo 负责语义搜索,Pegasus 负责摘要和视频转文本。
Llama 4 Scout 和 Maverick 是基于视频帧静态图像训练的开源多模态模型,适用于基于帧的系统,但并非原生的视频分析 API。Claude 以图像为中心,最擅长作为从抽取帧上进行推理的推理层。OpenAI 的 API 目前仅支持文本和图像输入,因此团队需要构建帧抽取流水线。Mk1 完全处于理解分支:Gemini 是衡量其能力的基准,而 Qwen3-VL 和 Cosmos Reason 2 在需要自托管时仍是开放权重的替代选择。
| 模型 | 访问方式 | 最佳适用场景 |
|---|---|---|
| Perceptron Mk1 | API,闭源 | 带时间戳的Q&A、视频剪辑、机器人标注 |
| Gemini 3.1 Pro | API,云端 | 长视频Q&A、多模态推理 |
| Qwen3-VL | 开放权重 | 自托管多模态部署 |
| Cosmos Reason 2 | 开放模型,NVIDIA 生态 | 机器人、工业视频、物理AI |
| TwelveLabs Marengo / Pegasus | API,平台 | 视频搜索与视频转文本 |
如何阅读视频基准测试而不自欺欺人</h2
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。