SevenTnewS

人工智能与机器人

训练手术机器人更快了:Nvidia的Cosmos-H-Dreams运行速度达160帧/秒

Nvidia的Cosmos-H-Dreams将手术模拟转变为交互式实时体验。在单个GPU上以160帧/秒运行,它让外科医生、受训者和AI策略能够在生成的视频闭环中进行练习,无需实体机器人。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-01 · 阅读需 3 分钟

训练手术机器人更快了:Nvidia的Cosmos-H-Dreams运行速度达160帧/秒

手术机器人训练正陷入瓶颈。每一个新策略、每一种缝合技术、每一种故障模式都必须在真实的达芬奇或Versius系统上进行测试。这意味着硬件稀缺、迭代缓慢、成本高昂。Nvidia希望通过一个实时模拟手术视频的生成式世界模型打破这一循环,让人类和算法无需接触实体即可进行练习。

今天发布的Cosmos-H-Dreams将Nvidia早期的Cosmos-H-Surgical-Simulator提炼成一个因果学生模型,在单个RTX PRO 6000 GPU上以约160帧/秒的速度运行。该模型接收初始RGB帧和机器人运动学的实时流,然后交互式生成下一段视频帧。它通过Nvidia的加速流式推理库FlashDreams提供服务,该库利用流式KV缓存、CUDA Graph捕获和模型编译来降低延迟。

从缓慢梦想的教师到快速梦想的学生

基础是Cosmos-Predict2.5-2B,这是一个在Open-H-Embodiment数据集上训练的动作条件世界模型。教师模型(Cosmos-H-Surgical-Simulator)已经能够从单个起始场景和机器人轨迹生成看似合理的未来帧,但其运行速度约为10帧/秒,对于实时交互来说太慢。教师模型在JHU dVRK桌面混合数据集上进行了微调,包括诸如针掉落、投掷失误等故障场景。这些故障很重要,因为用于训练策略的模拟器必须重现错误动作的后果,而不仅仅是理想情况。

为了构建学生模型,研究团队采用了自强制蒸馏(self-forcing distillation)。学生模型在训练期间学习生成自己的上下文,然后从冻结的教师模型接收分布匹配的监督。这样它就能处理训练时的干净输入与部署时自身不完美输出之间的不匹配。结果是每个潜在帧仅需最少两次去噪步骤即可运行,而教师模型需要更多步骤。

三种方式进入模拟

Cosmos-H-Dreams提供三种接口。浏览器客户端发送键盘命令并通过WebRTC接收生成的帧。Meta Quest客户端将追踪到的控制器运动映射为机器人动作,并通过WebXR显示合成场景。同一模型还可以连接到学习的手术策略,在闭环内交换生成的观察结果和预测的动作。Nvidia通过与CMR Surgical的Versius外科医生控制器集成展示了这一点。

发布的检查点专门用于达芬奇研究套件的桌面缝合,但团队提供了逐步指南,使系统适应其他设备。教师微调和自强制蒸馏流程已在GitHub上记录。

实时模拟器尚未达到的

Nvidia谨慎地将Cosmos-H-Dreams定位为研发平台,而非诊断系统、术中成像替代品或实体手术机器人的控制器。该模型的响应需要超越视觉质量进行评估。团队提出了闭环基准:工具尖端到达和姿态精度、夹爪周期保真度、空闲稳定性以及模拟与真实策略结果之间的一致性。这些将决定生成式模拟能否在不引入伪影的情况下真正加速手术策略开发。

从长远来看,实时世界模型可以支持延迟感知的远程手术、交互式手术排练和术中决策支持。但就目前而言,直接价值是为任何训练手术机器人的人提供更便宜、更快速的迭代。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。