SevenTnewS

Generación de video con IA

El Wan3.0 de Alibaba vende video por segundo: $6 por un clip de 30 segundos

Wan3.0 puede convertir un PDF o una presentación de marca en un video de 30 segundos en una sola generación, con un precio por segundo que llega hasta los $0.20 para 1080P. Desglosamos el cálculo por clip y las brechas que Alibaba admite en sus propias pruebas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-16 · 4 min de lectura

El Wan3.0 de Alibaba vende video por segundo: $6 por un clip de 30 segundos

El Wan3.0 de Alibaba, la generación más reciente de la familia de modelos de video Wan, ya está disponible en Alibaba Cloud Model Studio con facturación por segundo: $0.05 para 480P, $0.10 para 720P, $0.20 para 1080P. Una generación completa de 30 segundos cuesta $6 en el nivel superior, y $1.50 como borrador en 480P. Los números importan menos que lo que permiten: iterar con borradores baratos y luego pagar por la pasada final.

El precio por segundo convierte la repetición en una partida del presupuesto

La mayoría de los modelos de video con IA producen clips de unos pocos segundos, suficientes para una toma pero no para una historia, según Alibaba. Wan3.0 amplía la duración de una sola generación a 30 segundos, con una función de duración inteligente que recomienda la extensión a partir del prompt y una opción de extensión de video para continuar más allá de la generación inicial. Una salida más larga cambia el vocabulario creativo: espacio para el ritmo narrativo, movimientos de cámara continuos y secuencias en una sola toma.

El medidor por segundo es donde la economía se vuelve concreta. A 480P, un borrador de 30 segundos cuesta $1.50, lo bastante barato para iterar de forma aproximada. Terminar la misma duración a 1080P cuesta $6 por intento. El propio ejemplo de Alibaba hace el mismo cálculo: iterar a 480P, terminar a 1080P.

ResoluciónPrecio por segundoClip de 30 segundos
480P$0.05$1.50
720P$0.10$3.00
1080P$0.20$6.00

Dos cosas quedan sin resolver. La ficha no dice si las generaciones fallidas o descartadas se siguen facturando, y menciona cuatro modos creativos (referencia, edición, replicación, conducción) sin definir qué los separa. La ficha también limita la concurrencia a dos tareas, lo que significa que una repetición hace cola detrás de lo que ya esté en ejecución. Para los equipos que buscan consistencia de personajes, el medidor al menos hace predecible cada fallo: $6 por repetición.

Documentos dentro, película de marca fuera

El cambio funcional más grande es la entrada. Wan3.0 es el primer modelo de la familia Wan que lee documentos como entrada estructurada: doc, xls, ppt, pdf, txt, key, pages, numbers y md, hasta un archivo o enlace por solicitud, con un límite de 100MB y 50 páginas. Si se combina un documento con un prompt, el prompt actúa como el centro de control que interpreta la entrada y da forma a la salida. La demo de Alibaba es un documento de introducción de una marca de café más una frase de dirección, "Convierte esta historia de marca en un TVC de marca en tonos cálidos", que produce una película de marca completa.

El planteamiento de Alibaba es que la generación de video está pasando de la novedad de contenido a la herramienta de producción. La capacidad de todo-a-video apunta a la publicidad, las demos de interacción de UI y el marketing de destino, donde las películas de destino ya no requieren rodajes en localizaciones a gran escala. Según la lectura de Alibaba, el mismo camino cubre las animaciones de funciones de software y la visualización de datos: el modelo preserva la estética y la textura del diseño original mientras lo eleva al movimiento. Nada en la API decide si esos casos de uso dan resultado, pero la flexibilidad de entrada es lo que permite que una presentación existente se convierta en un video borrador sin reconstruir la idea desde cero.

Las afirmaciones de realismo y las brechas que Alibaba admite

En cuanto a la calidad de salida, Wan3.0 se apoya en dos afirmaciones: rostros realistas y diversos, en lugar del aspecto brillante e intercambiable de los personajes típicos de IA, y una consistencia precisa de referencia-a-video entre personajes, accesorios, espacios y estilo, incluidas emociones distintas en escenas grupales. La capacidad de edición introducida en Wan2.7 continúa, por lo que los visuales, la trama y el diálogo pueden modificarse sin regenerar desde cero. La iteración se convierte en una pasada de revisión, no en un rehacer.

La consistencia es la métrica que más importa a los equipos de producción, sostiene el blog: en el modo referencia-a-video, Wan3.0 reproduce los detalles de referencia con precisión y los mantiene estables en las dimensiones clave. Esa es la diferencia entre un clip que se ve bien de forma aislada y uno que sobrevive a una secuencia de corte.

Alibaba también señala dónde se queda corto el modelo. En las pruebas internas, la textura del audio y la precisión del renderizado de texto en pantalla "están mejorando pero aún no están donde queremos", y ambas son áreas de refinamiento activas. Para un modelo que posiciona documentos y gráficos como entrada, el texto legible en pantalla es una brecha no trivial.

La trayectoria es clara: la familia Wan ha lanzado ocho iteraciones de Wan1.0 a Wan3.0, y Alibaba orienta las mismas capacidades, comprender información más rica y generar una salida físicamente más consistente, hacia la IA corpórea, la conducción autónoma y la simulación industrial. Por ahora, la lectura práctica es más simple. El medidor hace predecible el gasto en video con IA. Que $6 compren un clip utilizable es una pregunta que solo una producción real puede responder.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.