SevenTnewS

Razonamiento de pesos abiertos

Nemotron-4 de Nvidia es rápido, abierto y apunta directamente a la brecha entre Llama y GPT

La línea Nemotron-4 de Nvidia desafía a Llama 3.3 y Mistral Large con puntuaciones MMLU competitivas y un ahorro del 30 % en inferencia. La licencia abierta y la estrategia de doble tamaño la posicionan como una alternativa práctica para equipos que ejecutan cargas de trabajo agénticas a escala.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-25 · 3 min de lectura

Nemotron-4 de Nvidia es rápido, abierto y apunta directamente a la brecha entre Llama y GPT
Fuentes : Nvidia Nemotron…

Nvidia lanzó Nemotron-4 hoy, un modelo de lenguaje de pesos abiertos en variantes de parámetros 8B y 34B. La compañía afirma que la versión de 34B obtiene una puntuación dentro de dos puntos de GPT-4 en el punto de referencia MMLU mientras utiliza un 30 % menos de cómputo durante la inferencia. El modelo se publica bajo una licencia comercial permisiva.

Las cifras se sitúan directamente en una parte disputada del mercado de modelos abiertos. Llama 3.3 70B de Meta, Mistral Large y Qwen 2.5 72B se agrupan en bandas de precisión similares. Lo que distingue a Nemotron-4 es la afirmación de Nvidia sobre el costo de inferencia: un 30 % menos de cómputo para la misma tarea, entrenado con una mezcla de datos web sintéticos y seleccionados.

La brecha que Nvidia está atacando

El ecosistema de modelos abiertos tiene un problema conocido. Puedes elegir un modelo pequeño y rápido como Qwen 2.5 7B que se ejecuta en una sola GPU pero comete errores de razonamiento en tareas de varios pasos. O eliges un modelo grande y capaz como Llama 3.3 70B que obtiene puntuaciones altas en puntos de referencia pero necesita múltiples GPU e inferencia por lotes costosa. No hay mucho en el medio que haga bien ambas cosas.

Nemotron-4 34B se sitúa en esa banda media. Si la afirmación MMLU se mantiene bajo verificación independiente, se convierte en uno de los modelos abiertos más fuertes cerca de su tamaño. Y la variante más pequeña de 8B ofrece a los equipos una opción más barata para tareas de enrutamiento más simples.

El lanzamiento de incrustaciones de Nvidia a principios de este año ya mostró que la compañía entiende este nivel: lo suficientemente fuerte para ser útil, lo suficientemente barato para implementar ampliamente. La línea Nemotron-4 extiende esa lógica al razonamiento.

El territorio no marcado

La fuente no especifica con qué variante de GPT-4 se compara Nvidia, ni si la brecha de dos puntos es en la división completa de MMLU o en un subconjunto. Eso importa porque las puntuaciones de GPT-4 varían según la versión y las condiciones exactas de la prueba. Una brecha de dos puntos en el punto de referencia estándar MMLU es aproximadamente 1-2 puntos porcentuales dependiendo de la referencia, real para comparaciones, pero no transformadora.

La pregunta más grande es cómo se desempeña Nemotron-4 en tareas agénticas. La investigación existente de Nvidia sobre costos de inferencia agéntica sugiere que la compañía ha estado pensando en este problema durante un tiempo. Si los ahorros del 30 % en cómputo son reales a escala, los equipos que ejecutan miles de bucles agénticos por día verían diferencias de costos significativas.

Lo que no está en el anuncio: puntos de referencia de terceros, números de latencia en vivo o un conjunto de evaluación abierto. Los primeros en adoptarlo necesitarán reproducir los resultados ellos mismos.

Dónde encaja

La licencia comercial permisiva es la señal clave. Nvidia no está intentando bloquear Nemotron-4 detrás de un punto final propietario como OpenAI o Anthropic bloquean sus mejores modelos. Está apostando a que la adopción de pesos abiertos alimenta el resto de su ecosistema de hardware y software, chips, marco Nemo, optimizaciones CUDA.

Para los equipos que ya ejecutan Llama o Mistral, el camino de migración es sencillo: misma infraestructura de servicio, diferentes pesos. La pregunta es si Nemotron-4 realmente gana en precisión por token en la práctica, o solo en una tabla de clasificación de puntos de referencia.

La afirmación de ahorro del 30 % en cómputo, si es precisa, le da a Nvidia una narrativa clara: inferencia más barata sin sacrificar capacidad. Eso es un argumento más fuerte que las ganancias marginales en MMLU. Los equipos que optimizan costos evaluarán este modelo contra sus propias cargas de trabajo antes de cambiar, y Nvidia parece saberlo.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.