SevenTnewS

IA y Robótica

El entrenamiento de robots quirúrgicos se vuelve más rápido: Cosmos-H-Dreams de Nvidia funciona a 160 fps

Cosmos-H-Dreams de Nvidia convierte la simulación quirúrgica en una experiencia interactiva en tiempo real. Funcionando a 160 fps en una sola GPU, permite a cirujanos, aprendices y políticas de IA practicar dentro de un bucle cerrado de video generado sin necesidad de un robot físico.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-01 · 3 min de lectura

El entrenamiento de robots quirúrgicos se vuelve más rápido: Cosmos-H-Dreams de Nvidia funciona a 160 fps

El entrenamiento de robots quirúrgicos está estancado en un cuello de botella. Cada nueva política, cada técnica de sutura, cada modo de fallo debe probarse en un sistema físico da Vinci o Versius. Eso significa hardware escaso, iteración lenta y configuraciones costosas. Nvidia quiere romper ese bucle con un modelo mundial generativo que simula video quirúrgico en tiempo real, permitiendo que personas y algoritmos practiquen sin tocar metal.

Cosmos-H-Dreams, anunciado hoy, es la destilación del anterior Cosmos-H-Surgical-Simulator de Nvidia en un modelo estudiante causal que funciona a aproximadamente 160 cuadros por segundo en una sola GPU RTX PRO 6000. El modelo toma un cuadro RGB inicial y una transmisión en vivo de cinemática del robot, luego genera el siguiente bloque de cuadros de video de forma interactiva. Se sirve a través de FlashDreams, la biblioteca acelerada de inferencia en streaming de Nvidia, que utiliza caché KV en streaming, captura de gráficos CUDA y compilación de modelos para reducir la latencia.

De un maestro que sueña lentamente a un estudiante que sueña rápido

La base es Cosmos-Predict2.5-2B, un modelo mundial condicionado por acciones entrenado en el conjunto de datos Open-H-Embodiment. El maestro (Cosmos-H-Surgical-Simulator) ya genera cuadros futuros plausibles a partir de una única escena inicial y una trayectoria del robot, pero funciona a aproximadamente 10 fps, demasiado lento para interacción en tiempo real. El maestro fue ajustado en la mezcla de mesa JHU dVRK, incluyendo episodios de fallo como caídas de aguja y lanzamientos fallidos. Esos fallos importan, porque un simulador utilizado para entrenar políticas debe reproducir las consecuencias de malas acciones, no solo las ideales.

Para construir el estudiante, el equipo de investigación utilizó destilación auto-forzada. El estudiante aprende a generar su propio contexto durante el entrenamiento, luego recibe supervisión de coincidencia de distribución del maestro congelado. De esta manera maneja el desajuste entre las entradas de entrenamiento limpias y sus propias salidas imperfectas durante el despliegue. El resultado es un modelo que puede funcionar con tan solo dos pasos de eliminación de ruido por cuadro latente en lugar de los muchos pasos del maestro.

Tres formas de habitar la simulación

Cosmos-H-Dreams viene con tres interfaces. Un cliente de navegador envía comandos de teclado y recibe cuadros generados a través de WebRTC. Un cliente de Meta Quest mapea el movimiento del controlador rastreado en acciones del robot y muestra la escena sintetizada a través de WebXR. El mismo modelo también puede conectarse a una política quirúrgica aprendida, con observaciones generadas y acciones predichas intercambiadas dentro de un bucle cerrado. Nvidia demostró esto integrándolo con el controlador quirúrgico Versius de CMR Surgical.

El punto de control liberado está especializado en sutura de mesa da Vinci Research Kit, pero el equipo proporciona una receta paso a paso para adaptar el sistema a otras configuraciones. Los pipelines de ajuste fino del maestro y destilación auto-forzada están documentados en GitHub.

Lo que un simulador en tiempo real aún no es

Nvidia tiene cuidado de enmarcar Cosmos-H-Dreams como una plataforma de investigación y desarrollo, no como un sistema de diagnóstico, un reemplazo para imágenes intraoperatorias, o un controlador para un robot quirúrgico físico. Las respuestas del modelo deben evaluarse más allá de la calidad visual. El equipo propone benchmarks de bucle cerrado: alcance de la punta de la herramienta y precisión de pose, fidelidad del ciclo del efector, estabilidad en reposo, y concordancia entre resultados de políticas simuladas y reales. Esos determinarán si la simulación generativa puede realmente acelerar el desarrollo de políticas quirúrgicas sin introducir artefactos.

A más largo plazo, los modelos mundiales en tiempo real podrían respaldar la telecirugía consciente de latencia, el ensayo quirúrgico interactivo y el apoyo a decisiones intraoperatorias. Pero por ahora, el valor inmediato son iteraciones más baratas y rápidas para cualquiera que entrene robots quirúrgicos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.