IA Física
El modelo de borde de 4 mil millones de parámetros de Nvidia hace algo que la mayoría de los VLM pequeños no hacen
Cosmos 3 Edge de Nvidia alberga modelado del mundo en 4B parámetros, ocupando el primer lugar en VANTAGE-Bench entre su clase de tamaño. Su diseño de transformador dual combina razonamiento con predicción de acciones en tiempo real para robots, todo desplegable en hardware Jetson y RTX.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-28 · 5 min de lectura

Nvidia lanzó Cosmos 3 Edge en Hugging Face hoy, un modelo de mundo abierto de 4 mil millones de parámetros construido para dispositivos de borde como los módulos Jetson T2000 y T3000 recién anunciados. El modelo apunta a hacer por la robótica pequeña en dispositivo lo que las versiones más grandes de Cosmos hacen por la IA física en la nube: ayudar a las máquinas a entender lo que ven, predecir lo que sucede después y, crucialmente, generar acciones en tiempo real.
El número que salta a la vista es el recuento de parámetros. Con 4B, Cosmos 3 Edge compite en una parte relativamente poco glamorosa del espectro de tamaños de modelos, lo suficientemente pequeño como para caber en una sola GPU RTX o en un módulo Jetson, y sin embargo, afirma tener el mejor rendimiento y precisión de su clase entre pares del mismo tamaño. Nvidia dice que ocupa el primer lugar en VANTAGE-Bench para análisis de visión y establece un nuevo estado del arte para el aprendizaje de políticas de robots. No son afirmaciones vagas: VANTAGE-Bench es un punto de referencia público para análisis de visión, y la afirmación sobre políticas de robots se refiere a tareas de control donde el modelo genera 32 acciones por inferencia a 15 Hz en Jetson Thor.
Dos transformadores, un cerebro compartido
El diseño es la historia. Cosmos 3 Edge apila dos torres de transformadores, autorregresiva y de difusión, que comparten un conjunto común de capas de atención multimodal pero mantienen capas de normalización y MLP separadas. La torre autorregresiva procesa tokens de visión y texto para comprensión y razonamiento. La torre de difusión maneja tokens de visión, audio y acción para predicción y generación. Los tokens fluyen de manera diferente según el modo: el lenguaje utiliza atención causal (cada token ve solo tokens anteriores), mientras que los tokens de difusión atienden más ampliamente al contexto disponible.

Esa configuración de torre dual es importante porque significa que el modelo puede razonar primero sobre una escena y luego generar una salida, ya sea esa salida un texto de título, un fotograma de video predicho o un ángulo de articulación de robot. La mayoría de los VLM pequeños se limitan a subtitulado o preguntas y respuestas. No producen secuencias de acciones. Cosmos 3 Edge lo hace, y lo hace mapeando diferentes encarnaciones, la pose del efector final de un brazo robótico, el movimiento del ego de un vehículo, el estado de agarre de un gripper, en una representación de acción común de vectores de traslación, rotación y estado de manipulación.
Modo de política: predecir y actuar juntos
El modelo se envía con una variante post-entrenada llamada Cosmos 3 Edge Policy (DROID), ajustada en el conjunto de datos DROID para tareas de pick-and-place. En modo de política, predice una acción junto con su consecuencia visual esperada. Nvidia dice que los desarrolladores pueden usar un pequeño clúster de H100 o una DGX Station para ajustar el modelo de 4B para sus propios flujos de trabajo y luego desplegarlo en hardware de borde.
La ventaja de los pesos abiertos es que usted es dueño del despliegue. La desventaja es que usted es responsable de obtener latencia en tiempo real de un transformador de 4B en un módulo Jetson, lo cual es difícil, pero Nvidia conoce su propio hardware lo suficientemente bien como para publicar orientación junto con el modelo. La compañía también lanzó puntos de control de destilación Cosmos 3 Super 4-Step, que reducen los pasos de difusión de 35, 50 a 4, ofreciendo una inferencia hasta 25 veces más rápida para tareas de texto a imagen e imagen a video. Esa receta de destilación es un modelo separado de 64B, no la variante Edge de 4B, pero apunta a un patrón: Nvidia está construyendo una familia de herramientas de post-entrenamiento, no solo lanzamientos de puntos de control.
Cómo se compara
Cosmos 3 Edge no es un competidor directo de modelos cerrados de frontera como GPT-4o o Gemini, porque no necesita generalizar en todo Internet. Está construido para un segmento más reducido: pisos de fábricas, almacenes, pasillos de hospitales, cualquier lugar donde coexistan una cámara y un brazo robótico. La competencia interesante es contra otros VLM abiertos compactos que afirman tener capacidad robótica, notablemente Qwen2.5-VL (7B, pero puede ser cuantizado) y los diversos ajustes finos de Llama 3.2 (visión 11B). La ventaja de Nvidia es arquitectónica: el diseño de torre dual con atención multimodal compartida y salida de acción nativa no es algo que se obtenga de un VLM estándar. La mayoría de las políticas de robots construidas sobre un VLM agregan una cabeza de acción separada encima. Cosmos 3 Edge integra la acción en la representación desde el principio.
La contrapartida es que necesitas hardware de Nvidia para ejecutarlo bien. El modelo fue diseñado explícitamente para RTX, Jetson y DGX. Eso es conveniente si tu pila ya se ejecuta en Nvidia, menos si estás optimizando para un chip de borde diferente.
Qué significa esto para el campo de la robótica
Los investigadores en robótica han estado pidiendo modelos de mundo abiertos y compactos que puedan ejecutarse en el dispositivo y producir acciones, no solo descripciones. Cosmos 3 Edge responde a eso, pero también impone un costo de trabajo al usuario: el modelo es una base, no una solución llave en mano. Todavía necesitas datos específicos del dominio, cómputo de ajuste fino y hardware robótico para cerrar el ciclo. Los scripts de entrenamiento abiertos que Nvidia lanzó junto con el modelo están destinados a reducir esa barrera, pero no la eliminan.
Quedan algunas preguntas abiertas. Nvidia no publicó números de latencia para los Jetson T2000 o T3000; el anuncio dice que el modelo logra control en tiempo real a 15 Hz en Jetson Thor, pero la mayoría de los despliegues de borde se ejecutarán en los módulos más pequeños. La clasificación de VANTAGE-Bench es autoinformada en el comunicado. Y aunque la arquitectura de torre dual es elegante sobre el papel, los puntos de referencia independientes dirán si las capas de atención compartidas realmente cuellan una torre cuando ambas están activas. Esos detalles determinarán si Cosmos 3 Edge se convierte en el modelo de mundo de borde predeterminado o sigue siendo un diseño de referencia prometedor que pocos equipos despliegan completamente.
- Fuente : Nvidia Cosmos 3 Edge on Hugging Face
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.