SevenTnewS

Modelos de IA | NVIDIA Nemotron 3.5 Lightning

Por qué Nemotron 3.5 Lightning apuesta a que la mayoría de los pasos de un agente no necesitan un modelo grande

El nuevo modelo abierto de Nvidia se ejecuta localmente con 3B de parámetros activos y un contexto de 1M de tokens, diseñado para agentes que permanecen en ejecución. Nvidia afirma hasta 4 veces más rendimiento y un 30 % más rápido en la finalización de tareas que los modelos abiertos comparables.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-14 · 4 min de lectura

Por qué Nemotron 3.5 Lightning apuesta a que la mayoría de los pasos de un agente no necesitan un modelo grande

La propuesta de Nvidia para Nemotron 3.5 Lightning cabe en una frase: la mayor parte del trabajo que hace un agente no necesita un modelo grande. Leer un archivo, llamar a una herramienta, ordenar un resultado, reintentar un paso que falló. Esos son los pasos que llenan el día de un agente, y Nvidia cree que un modelo compacto puede encargarse de ellos en el hardware que ya tienes, en lugar de cobrarte por token en un centro de datos.

El modelo llegó a Ollama el 11 de agosto. Tiene 30 mil millones de parámetros en total y activa solo 3 mil millones por token, un diseño híbrido de Mezcla de Expertos que la compañía dice que fue creado para agentes que se mantienen en ejecución: recopilar contexto, llamar herramientas, trabajar en tareas de varios pasos. Si lo ejecutas localmente, tus datos permanecen en tu dispositivo.

Tres mil millones de parámetros activos, un millón de tokens de memoria

El número que merece atención no es el total de 30B. Es el de 3B activos por token, junto con una ventana de contexto que alcanza 1M de tokens. El modelo es barato de ejecutar, que es lo que quieres para los pasos de alto volumen, y el contexto largo deja espacio para los historiales de herramientas que se acumulan en sesiones de múltiples turnos.

Nvidia enumera los objetivos de hardware: PCs RTX, estaciones de trabajo RTX PRO, DGX Spark y DGX Station, además de centro de datos y nube. Los usuarios de Apple Silicon tienen una versión MLX dedicada, nemotron-3.5-lightning:30b-mlx. La configuración es un solo comando: ollama run nemotron-3.5-lightning. El modelo fue desarrollado con la Nemotron Coalition y entrenado para las herramientas que los desarrolladores ya usan, en codificación, llamada de herramientas, seguimiento de instrucciones y trabajo de múltiples turnos.

Dónde un nivel local se gana su lugar

Las cargas de trabajo sugeridas parecen un catálogo de los trabajos más repetitivos en una operación de IA. Asistentes personales de larga duración que gestionan correo, calendario y reservas. Subagentes de codificación que ejecutan pruebas, buscan en la base de código y aplican refactorizaciones dentro de los entornos que los equipos ya usan. Operaciones de seguridad: enriquecer alertas, clasificar incidentes, consultar registros, correlacionar indicadores y preparar hallazgos estructurados para los analistas.

La sugerencia más interesante es el despliegue híbrido. Nemotron 3.5 Lightning maneja los pasos de alto volumen localmente, y un modelo alojado más grande se encarga de los pocos que realmente lo necesitan. Las integraciones para Claude Code, OpenClaw, Hermes Agent y OpenCode se incluyen junto con el modelo, y el mismo patrón funciona para modelos que se ejecutan en la nube de Ollama, de modo que un agente puede reenviar un solo paso a un modelo más grande sin cambiar nada más. Los pesos abiertos y los conjuntos de datos abiertos completan la propuesta: los equipos pueden reentrenar el modelo para una tarea específica y ejecutar el resultado en cualquier lugar, desde el borde hasta el centro de datos.

El throughput es la métrica que Nvidia vende

En los benchmarks, la compañía afirma un rendimiento 4 veces mayor y una finalización de tareas un 30 % más rápida que los modelos abiertos comparables, con una precisión líder en tareas de agentes, codificación y razonamiento. Son cifras propias de Nvidia, de sus propias configuraciones de prueba; los resultados completos están en el blog de lanzamiento, y la verificación independiente llevará tiempo.

La lógica detrás de las cifras es más fácil de defender. Para un agente que se mantiene en ejecución, el throughput es el número que más importa: más pasos por minuto significa que las tareas largas terminan. Nvidia lo consigue con decodificación especulativa mediante predicción de múltiples tokens, además de las técnicas DFlash y DSpark.

Un argumento conocido, llevado al borde

No es el primer intento de Nvidia ante el problema del costo de los agentes. Los agentes consumen más tokens por tarea que una simple sesión de preguntas y respuestas, lo que eleva las facturas de la nube, y la respuesta de Nvidia en generaciones recientes ha sido servir la mayor parte de esos tokens en hardware más barato. Nemotron 3 Ultra llevó esa lógica desde el lado de la nube: un contexto de 1M de tokens, una receta de ajuste fino construida para orquestación, bucles de retroalimentación de aprendizaje por refuerzo y recuperación de contexto largo, y gráficos de benchmarks que lo sitúan en el cuadrante superior derecho de precisión frente a rendimiento, por delante de las alternativas abiertas existentes en productividad de agentes, generación de código y seguimiento de instrucciones. Nvidia también ha publicado material que sostiene que los datos sintéticos importan más que los pesos del modelo, y que el ajuste, no el preentrenamiento, es el foso.

Nemotron 3.5 Lightning lleva ese patrón al nivel local. La división 30B/3B es una declaración sobre la economía de los agentes: la mayoría de los pasos que un agente consume son baratos de producir, y la mayoría de ellos pueden ejecutarse en el hardware que ya tienes.

Nada de esto resuelve si la apuesta da resultados. Los benchmarks de los proveedores son un punto de partida, no una prueba. Lo que el lanzamiento deja claro es la dirección: Nvidia está tratando el nivel local como una parte de primera clase de la pila de agentes, y un modelo con 3B activos y memoria de un millón de tokens es una afirmación específica y verificable sobre cómo debería funcionar ese nivel.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.