AI研究
阿里巴巴通义千问将世界建模转化为语言问题
Qwen-AgentWorld是一种原生语言世界模型,可在七个领域模拟智能体环境。通过从一开始就将环境建模作为训练目标,它为基于视频的世界模型和特定领域模拟器提供了另一种选择,用于具身AI。

阿里巴巴通义千问团队发布了Qwen-AgentWorld,一种基于语言的世界模型,可在七个领域模拟智能体环境:基于文本的MCP、搜索、终端和软件工程任务。该团队没有将世界建模作为事后想法附加到通用大语言模型上,而是从持续预训练到监督微调再到强化学习,将环境模拟作为核心训练目标。OPID为语言智能体提供密集奖励信号,告别外部记忆依赖
这一发布是对具身AI主流方法的刻意突破,后者通常基于视频生成或特定领域的物理模拟器构建世界模型。Qwen-AgentWorld将环境本身视为一种语言,该团队表示此举能以更少的架构复杂性实现更好的泛化能力。Fast-LeWM:并行动作前缀预测大幅降低潜在世界模型规划成本
环境的语言
当今大多数世界模型可分为两类。像Sora这样的通用视频生成模型能学习丰富的视觉先验知识,但在模拟具身物理方面存在困难。特定领域的模拟器虽然精确但范围狭窄:一个操作模拟器无法评估搜索智能体,反之亦然。Qwen-AgentWorld完全回避了这一矛盾,它将环境编码为一系列令牌,就像语言模型编码句子或代码库一样。桌面AI代理的真正瓶颈不是模型,而是技能库
由于该模型经过训练以预测环境的下一状态(即行动后的结果),它可以模拟任何能表示为状态转移的领域。模拟搜索智能体与网络索引交互的相同权重,也可以模拟终端会话或代码仓库交互。
该团队在所有七个领域验证了这种方法,尽管帖子中未公布详细的基准数据。他们声称,一个单一模型无需针对每个领域进行调整,就能达到与特定领域模拟器相当的竞争力。验证地平线:为什么验证编码代理现在比构建它们更难
与机器人套件的联系
AgentWorld的发布紧随Qwen-Robot Suite之后,后者是一组针对具身智能的基础模型,包括Qwen-RobotNav、Qwen-RobotManip和Qwen-RobotWorld。博客文章明确将这两项工作联系起来,表明AgentWorld为套件内机器人智能体的训练和评估提供了模拟基础。
该套件已展示了一项显著的集成能力:Qwen-Omni观察物理场景,通过语音随机提出操作任务,并实时评估执行情况。然后RobotManip组件在无预定任务列表的情况下即时完成这些任务。AgentWorld模型可作为模拟层,在部署到物理硬件之前,训练这种开放式指令跟随能力。本地大语言模型中Gemma和Qwen如何驯服大规模开源仓库问题分类
这种流程(在语言中模拟,在物理世界中部署)是该团队对他们明确指出的瓶颈的回应:"看到不等于行动"。视觉感知与物理控制之间的差距在大多数具身系统中仍未解决,而Qwen-AgentWorld将此差距视为一个翻译问题:从视觉观察到语言状态再到行动。
对该领域的影响
如果这些性能声明在第三方评估中得到证实,Qwen-AgentWorld将代表具身AI研究模拟堆栈的一次重大简化。当前的方法要求研究人员将视觉模型、物理引擎和任务规划器拼接在一起,每个部分都有各自的失败模式。一个单一语言模型若能处理所有三个角色,将减少级联错误的表面积。 Ai2发布olmo-eval:为LLM开发者提供每个检查点的显微级评估
这种方法也引发了关于具身任务是否需要基于视频的世界模型的问题。如果语言级模拟足以训练后来能在物理世界中运行的智能体,那么对于这一特定应用而言,视频生成模型上的大量计算投入可能被错误分配。
然而,该方法的边界仍不明确。所测试的七个领域都是基于文本或符号的:MCP协议、搜索查询、终端命令、代码仓库。尚不清楚相同的语言模拟是否能转移到需要精细物理推理的任务,例如操作可变形物体或在崎岖地形中导航。Qwen-Robot Suite的Nav和Manip组件可能填补这一空白,但这两个系统之间的集成程度尚未公开量化。
未解问题
博客文章未指定模型权重或API的发布日期,社区需等待代码访问权限才能运行独立基准测试。在此之前,核心声明, , 语言世界模型能在视频模型和物理模拟器无法泛化的领域进行泛化, , 仍是一个基于内部验证的强假设。IFBench:测试AI指令遵循能力的新基准
如果这一假设得到证实,其影响可能超出具身AI领域。任何可以建模为马尔可夫决策过程并以语言表达的领域,都能被一个单一模型模拟。这包括经济模拟、游戏环境、网络协议,以及潜在的科学实验。Qwen-AgentWorld是一场赌博,赌语言是足以捕捉所有这一切的通用表示。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。