SevenTnewS

具身智能

机器人仿真栈正在悄然分裂与重组

机器人仿真已成为具身智能训练的支柱。随着引擎的增多和专业化,问题不再是哪一个最快,而是哪些抽象层将作为共享基础设施存活下来。NVIDIA、DeepMind和迪士尼支持的Newton指向了一个开放、分层的未来。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 4 分钟

机器人仿真栈正在悄然分裂与重组
来源 : The State of Si…

2026年的机器人仿真景观与五年前截然不同。那时,选择很简单:选择一个CPU引擎, , MuJoCo、PyBullet、Gazebo, , 凑一个奖励函数,然后希望策略有一半概率能迁移到真实机器人上。如今,生态系统是GPU原生引擎、批量仿真器、可微物理和渲染管线的复杂交织,这些东西两年前几乎不存在。机器人团队最难的决定已不再是机械问题,而是选择建立在哪个仿真抽象层上。

NVIDIA在Hugging Face上发布的最新物理AI仿真栈概览,清晰记录了这种分裂。它涵盖了为人形机器人、四足机器人、飞行器、自动驾驶汽车和灵巧操作器设计的引擎。文中提到了MuJoCo、MuJoCo Warp、Isaac Sim、Isaac Lab,以及由NVIDIA、Google DeepMind和迪士尼研究在Linux基金会支持下新成立的Newton引擎。仅从广度就能看出:再也没有单一引擎能主导一切,因为没有任何引擎能覆盖所有需求。

图表 : 物理引擎求解器多样性
Newton引擎在一个API下提供五种不同的求解器类型(MuJoCo/Featherstone, XPBD/Kamino, VBD, MPM, Style3D),在本文引用的模拟引擎中种类无与伦比。

其中最古老且仍最广泛使用的是MuJoCo。它的吸引力在于关节体动力学的速度和确定性。它从未为逼真渲染或大规模GPU并行设计,但其接触建模和广义坐标仿真仍然是可靠的基准。真正的转变来自MuJoCo Warp,这是NVIDIA Warp框架中一个GPU加速的重实现,它用批量吞吐量换取了单步延迟。如今,在数千个并行环境中训练强化学习策略的团队将MuJoCo Warp视为吞吐量层,而非仿真层。

Isaac Sim处于保真度光谱的另一端。它基于NVIDIA Omniverse和OpenUSD,提供逼真的RTX渲染和完整的传感器套件,包括摄像头、深度、激光雷达、雷达、分割。当你需要跨越感知而非动力学的仿真到现实差距时,你会选择这个引擎。但大规模逼真渲染成本高昂,并非每个训练循环都需要它。NVIDIA的智能体就绪框架Isaac Lab将渲染后端与物理后端解耦。最新的Isaac Lab 3.0版本允许开发者选择带RTX的PhysX用于传感器密集型工作流,或轻量级Newton物理后端用于高吞吐量无头仿真。抽象层终于变得模块化。

Newton本身是最具启发性的部分。作为一个开源、GPU加速、可扩展且可微的物理引擎,它为Isaac Lab和MuJoCo Playground等框架充当物理层。它提供多种求解器, , 广义坐标(MuJoCo、Featherstone)、最大坐标(XPBD、Kamino)、隐式(VBD)、基于粒子(MPM)、布料专用(Style3D), , 而非规定一种。栈中没有其他引擎在单一API下提供这种求解器灵活性。这是该领域的发展方向:朝着一个共享的物理层前进,不同仿真器和框架在此基础上构建,而不是各自从头重新实现接触模型。

该文章有意指出,这一核心基础设施的日益增长的部分是开源的。MuJoCo自2021年以来一直开源。Isaac Sim和Isaac Lab也是开源的。Newton由Linux基金会管理。对于一个只有一块消费级GPU的学生或小团队来说,进入门槛比以往任何时候都低。这并非偶然,它反映了社区共识:仿真基础设施受益于共享投资,而非专有孤岛。

该文章没有解决的是哪种抽象层将在标准化竞争中胜出。生态系统仍然太年轻。但它提出的问题是对的:随着栈的分裂和重组,哪些部分将成为每个人都依赖的共享基础?答案很重要,因为它决定了下一代具身智能研究将把时间、人才和计算资源投资在哪里。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。