SevenTnewS

Generación de video

MiniMax descartó su arquitectura probada para que H3 lo haga todo

MiniMax afirma que H3 unifica la generación de texto, imagen, video y audio en un solo modelo, fija la salida 2K por debajo de un tercio del precio de los modelos convencionales y planea abrir los pesos en cuestión de días. La letra pequeña es la verdadera historia: la empresa abandonó la arquitectura que le dio una ventaja para conseguirlo.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-07 · 5 min de lectura

MiniMax descartó su arquitectura probada para que H3 lo haga todo

Lanzar un modelo es algo rutinario. Anunciar en la misma publicación que abandonaste la arquitectura detrás de tu generación anterior no lo es. El lanzamiento de H3 de MiniMax hace ambas cosas, y la confesión es la parte más reveladora del anuncio: la empresa afirma que descartó la arquitectura Hailuo-02, que según su propio relato le dio una ventaja significativa, porque esa arquitectura añadía complejidad a un modelo construido en torno a un primer principio: la unificación de tareas.

Según la publicación de lanzamiento, H3 es un modelo de generación omnimodal. Lee un contexto multimodal compuesto de texto, imágenes, video y audio, lo entiende como una sola unidad y genera audio-video con sonido nativo de doble canal, hasta 15 segundos en resolución 2K. La propuesta de precios de MiniMax es directa: a 2K, el costo por segundo es menos de un tercio del de los modelos convencionales, y la salida 768P cuesta la mitad que la 720P convencional, con 2K establecido como opción predeterminada. La empresa también planea abrir los pesos en cuestión de días.

La arquitectura que MiniMax abandonó

La propia historia de MiniMax hace legible el sacrificio. Hailuo 01 construyó el sistema de generación desde cero; Hailuo 02 se centró en la eficiencia de la arquitectura, la calidad de los datos y la escala. El equipo de H3 dice que, de todos modos, dejó de lado ese diseño, porque la generalización de tareas es una tendencia irreversible y los trucos de arquitectura deben ceder ante la definición del modelo. El reemplazo, el H3-Omni Transformer, divide la comprensión y la generación en una configuración de entrenamiento heterogénea. El contexto multimodal triplicó la varianza de las longitudes de secuencia, y las dos cargas de trabajo ahora difieren marcadamente en cómputo. MiniMax afirma que esta configuración, ajustada por carga de trabajo con equilibrio de carga entre muestras, consigue un aumento de casi el 30% en el rendimiento de entrenamiento de extremo a extremo.

Un único pipeline en lugar de una pila de expertos

La unificación recorre todo el preentrenamiento. Texto a imagen, texto a video con audio conjunto y texto a audio conviven en un solo modelo. La voz, los efectos de sonido y la música se modelan juntos, no como dominios separados. La referencia y edición generalizadas cubren imagen a imagen, imagen a video, audio a audio y audio-video a audio-video, con la relación expresada en lenguaje natural, no elegida de un menú fijo. El ejemplo de prompt de MiniMax es una sola frase que combina tres referencias: el movimiento de cámara de Hitchcock de un clip de video, la persona de una imagen y una voz de un archivo de audio. El modelo resuelve el mapeo por sí mismo. El lenguaje, en el diseño de MiniMax, es el puente generalizable entre cualquier tarea y modalidad.

Dos decisiones técnicas sostienen la economía del modelo. El tokenizador H3-VAE fue reconstruido para esta generación, y su mayor compresión proporciona una ganancia de 4x en la longitud de secuencia, reduciendo el costo de entrenamiento e inferencia y haciendo viable la salida nativa 2K. En lugar de un escalador dedicado, H3 regenera sus propios resultados de baja resolución en contexto, reutilizando la capacidad de generación del modelo base y el contexto multimodal original. MiniMax afirma que esto preserva texto pequeño y detalles que los escaladores convencionales tendrían que adivinar.

El pipeline de captioning muestra lo que esto cuesta. Describir el video objetivo, la relación entre contexto y objetivo, y las relaciones entre los elementos dentro del contexto consume alrededor de 100K tokens de inferencia por pieza de material, reduciéndose a un promedio de unos 4K tokens. MiniMax llama a esto Contextual Omni Representation, y señala los comentarios de las pruebas iniciales por invitación como evidencia: sólido seguimiento de instrucciones, renderizado sólido de texto e información de marca, y transferencia de movimiento de video a video, para publicidad, comercio electrónico, diseño de producto, UI/UX y juegos.

El ataque de precios y el plan de pesos abiertos

La afirmación sobre precios es la parte más verificable del anuncio y la menos auditable, porque los modelos convencionales con los que se compara no se nombran. Por debajo de un tercio a 2K, la mitad a 768P, más una afirmación de la mejor relación precio-rendimiento de la industria. La dirección es clara; las pruebas no lo son.

AfirmaciónDetalles de MiniMax
SalidaAudio-video nativo de doble canal, hasta 15 segundos a 2K, 2K por defecto
ComprensiónTexto, imágenes, video y sonido tratados como un único contexto multimodal
Precios2K: menos de 1/3 del costo por segundo convencional; 768P: la mitad de la 720P convencional
AudioVoz, efectos y música modelados juntos, toda la salida en doble canal
Pesos abiertosPrevistos en cuestión de días, sujetos a la legislación y normativa aplicables
Límites conocidosComprensión del contexto, escala del modelo, detalle fino en alta resolución

El plan de pesos abiertos es una apuesta en tres partes: hacer crecer la comunidad de código abierto, acelerar la adaptación de los chips chinos locales, varios de los cuales fueron diseñados para ser compatibles con H3, y permitir que los usuarios personalicen sus propias compilaciones. También es una respuesta al dominio del código cerrado que, según MiniMax, ha frenado la generación de video, un argumento que plantea al comparar con la iteración más rápida del ecosistema de LLM.

Lo que MiniMax admite que aún no puede hacer

El anuncio es sincero sobre las limitaciones. La comprensión del contexto multimodal es el fundamento de la generación, dice MiniMax, y es lo que más margen de mejora tiene; la próxima versión de la serie H se fusionará con la línea de modelos de la serie M. La escala del modelo es una restricción, con el escalado señalado como la dirección explícita. El detalle fino en algunas escenas aún necesita trabajo, con mayor resolución y mejor calidad en la hoja de ruta.

La apuesta es coherente, lo que no es lo mismo que segura. Los pipelines especializados son predecibles: elige una tarea, elige una herramienta, ajústala. Un modelo general intercambia esa previsibilidad por flexibilidad, y MiniMax apuesta a que esa flexibilidad vale más que la arquitectura que abandonó, a precios a los que los rivales tendrán que responder. Si un solo modelo puede reemplazar de verdad la pila de expertos es la pregunta abierta. MiniMax ha elegido responderla en público.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.