Generación de vídeo
MiniMax H3 subcotiza a los rivales de vídeo y planea liberar sus pesos
MiniMax agrupa la generación de imagen, vídeo y audio en un solo modelo, fija el precio de la salida en menos de un tercio de las tarifas por segundo convencionales y planea liberar los pesos en cuestión de días. Hasta qué punto los resultados se sostienen fuera de sus propias demos es la cuestión abierta.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-30 · Última actualización: 2026-08-02 · 4 min de lectura

MiniMax lanza H3 como una apuesta por la economía de la generación de vídeo. El modelo toma un contexto mixto de texto, imágenes, vídeo y sonido, y responde con metraje que incluye audio estéreo nativo, de hasta 15 segundos a 2K. El precio de la salida es inferior a un tercio del costo por segundo de los modelos convencionales, y los pesos se prometen para dentro de unos días.
Esa última promesa es lo que los rivales notan primero. La generación de vídeo, sostiene MiniMax, se basa en modelos cerrados, y la velocidad de iteración y la apertura del ecosistema han quedado rezagadas respecto al mundo de los grandes modelos de lenguaje. Liberar H3 aplica el libreto que extendió los LLM abiertos de forma amplia y barata a una categoría que hasta ahora se ha resistido.
Un solo modelo, sin módulos especializados
El principio de diseño es la unificación. Los sistemas anteriores de MiniMax, Hailuo 01 y Hailuo 02, eran modelos de vídeo construidos generación tras generación. H3, en cambio, concentra las divisiones especializadas, expertos separados para tareas de texto a imagen, edición, voz, efectos, música y referencias de vídeo, en un único modelo entrenado con todas ellas. MiniMax llama a la unificación y generalización su primer principio, y el resultado se aprecia en el prompt de demostración: «Utiliza el movimiento de cámara de Hitchcock del vídeo 1, haz que la persona de la imagen 2 cante y toma la voz del audio 3». Una instrucción, cuatro modalidades de entrada, sin enrutamiento entre submódulos.
Los primeros comentarios de las pruebas por invitación, según la compañía, muestran resultados de calidad comercial en el seguimiento de instrucciones, el renderizado de texto y elementos de marca, y la transferencia de movimiento de vídeo a vídeo, en publicidad, comercio electrónico, diseño de producto, UI/UX y juegos. En el preentrenamiento, el modelo combina texto a imagen, texto a vídeo con generación conjunta de audio, modelado multi-toma, texto a audio que trata la voz, los efectos y la música como un solo problema, y referencia y edición generalizadas en pares de imagen, audio y vídeo.
De dónde proviene el precio bajo
El número más contundente del lanzamiento es el precio: a 2K, menos de un tercio del costo por segundo de los modelos convencionales; a 768P, aproximadamente la mitad de las tarifas 720P convencionales. Aún no hay pruebas independientes detrás de estas cifras:
| Afirmación | Detalle (según MiniMax) |
|---|---|
| Salida predeterminada | 2K nativo, clips de hasta 15 segundos |
| Precio por segundo a 2K | Menos de 1/3 de los modelos convencionales |
| Precio por segundo a 768P | Alrededor de 1/2 de los 720P convencionales |
| Compresión H3-VAE | 4x de ganancia en longitud de secuencia |
| Rendimiento de entrenamiento | Casi un 30% más alto de extremo a extremo |
| Pipeline de subtítulos | ~100K tokens de inferencia por muestra, ~4K tokens de subtítulo en promedio |
Dos decisiones de diseño hacen creíble el precio sobre el papel. El tokenizador H3-VAE es una reelaboración completa del tokenizador de la generación anterior, y su mayor compresión produce una ganancia de 4x en longitud de secuencia que reduce el costo de entrenamiento e inferencia. Eso es también lo que convierte a 2K en la resolución predeterminada. Para el escalado, no hay módulo de superresolución dedicado: el modelo base regenera su propio resultado de baja resolución en contexto, reutilizando el contexto multimodal para recuperar texto pequeño y detalles que un escalador convencional tendría que adivinar.
La comprensión del contexto era un centro de costes propio. La mayoría de las muestras de entrenamiento consumían alrededor de 100K tokens de inferencia y producían, en promedio, unos 4K tokens de subtítulo. Ese pipeline, que MiniMax denomina Contextual Omni Representation, es donde el modelo aprende a seguir instrucciones que combinan modalidades y a describir relaciones dentro de un contexto multimodal.
Las notas de arquitectura admiten un cambio de rumbo. MiniMax abandonó la arquitectura Hailuo-02 que una vez le dio una ventaja significativa, porque ese diseño añadía complejidad una vez que la generalización de tareas se convirtió en el objetivo. El contexto multimodal triplicó la varianza de la longitud de secuencia y separó las cargas de trabajo de comprensión y generación, por lo que el equipo pasó a una configuración de entrenamiento heterogénea con ajuste de hardware por carga de trabajo y equilibrio de carga a nivel de muestra. MiniMax afirma que con ello logra un rendimiento de entrenamiento de extremo a extremo casi un 30% superior.
La apuesta por los pesos abiertos
La fecha de apertura es vaga, «en los próximos días», y está condicionada a la ley aplicable. Las razones de MiniMax: impulsar la comunidad de código abierto, facilitar la adaptación a los chips chinos domésticos (la compatibilidad con varios aceleradores domésticos existentes se consideró desde la etapa de diseño) y permitir que los usuarios personalicen su propia versión.
Nada de eso es neutral. La mención a los chips chinos domésticos, sin nombrar ninguno, indica dónde espera MiniMax que crezca su base de usuarios.
Lo que H3 admite que aún no puede hacer
MiniMax enumera sus propios límites. La escala del modelo deja margen de mejora en el grado en que se concretan algunas capacidades, y el detalle fino en algunas escenas aún necesita trabajo, con mayor resolución y mejor calidad en la hoja de ruta. Se promete un informe técnico más completo, y la próxima versión de la serie H está prevista para fusionarse con los modelos de la serie M. En la visión de MiniMax, el lenguaje es un sistema informático generalizable y escalable, y la multimodalidad debe permanecer estrechamente acoplada a él.
La verificación independiente llevará tiempo; el lanzamiento no incluye cifras de referencia. Lo verificable hoy es la estrategia: un modelo omni-modal que suena capaz, con un precio rebajado y con pesos prometidos a la comunidad de código abierto. Para un mercado construido sobre modelos cerrados, eso es una prueba de estrés. Si H3 se acerca a lo prometido, los precios de los rivales tendrán que moverse. Si no, los pesos abiertos igualmente reducen el piso para todos los demás.
- Fuente : MiniMax H3 undercuts video rivals and plans open weights — 2026-07-31
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.