Génération vidéo par IA
Le Wan3.0 d'Alibaba vend la vidéo à la seconde : 6 $ pour un clip de 30 secondes
Le Wan3.0 peut transformer un PDF ou un dossier de marque en vidéo de 30 secondes en une seule génération, avec une tarification à la seconde qui plafonne à 0,20 $ pour la 1080P. Nous détaillons le calcul par clip et les lacunes qu'Alibaba reconnaît dans ses propres tests.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-16 · 4 min de lecture

Le Wan3.0 d'Alibaba, la dernière génération de la famille de modèles vidéo Wan, est désormais disponible sur Alibaba Cloud Model Studio avec une facturation à la seconde : 0,05 $ en 480P, 0,10 $ en 720P, 0,20 $ en 1080P. Une génération complète de 30 secondes revient à 6 $ dans le niveau supérieur, et à 1,50 $ en brouillon 480P. Les chiffres comptent moins que ce qu'ils rendent possible : itérer sur des brouillons bon marché, puis payer le prix fort pour la passe finale.
La tarification à la seconde transforme la reprise en ligne budgétaire
La plupart des modèles vidéo IA produisent des clips de quelques secondes, suffisants pour un plan mais pas pour une histoire, comme le dit Alibaba. Wan3.0 étend la durée de génération unique à 30 secondes, avec une fonction de durée intelligente qui recommande une longueur à partir du prompt et une option d'extension vidéo pour continuer au-delà de la génération initiale. Des sorties plus longues changent le vocabulaire créatif : place au rythme narratif, aux mouvements de caméra continus et aux séquences en plan-séquence.
Le compteur à la seconde est ce qui rend l'économie concrète. En 480P, un brouillon de 30 secondes coûte 1,50 $, assez peu cher pour une itération grossière. Terminer la même durée en 1080P coûte 6 $ par tentative. L'exemple d'Alibaba fait le même calcul : itérer en 480P, finir en 1080P.
| Résolution | Prix par seconde | Clip de 30 secondes |
|---|---|---|
| 480P | 0,05 $ | 1,50 $ |
| 720P | 0,10 $ | 3,00 $ |
| 1080P | 0,20 $ | 6,00 $ |
Deux points restent en suspens. La fiche ne précise pas si les générations échouées ou abandonnées sont facturées, et elle nomme quatre modes créatifs (référence, édition, réplication, conduite) sans définir ce qui les distingue. La fiche plafonne également le nombre de tâches simultanées à deux, ce qui signifie qu'une reprise passe derrière tout ce qui tourne déjà. Pour les équipes qui cherchent la cohérence des personnages, le compteur rend au moins chaque échec prévisible : 6 $ par reprise.
Des documents en entrée, un film de marque en sortie
Le changement fonctionnel le plus important concerne l'entrée. Wan3.0 est le premier modèle de la famille Wan à lire des documents comme entrée structurée : doc, xls, ppt, pdf, txt, key, pages, numbers et md, jusqu'à un fichier ou un lien par requête, limité à 100 Mo et 50 pages. Associez un document à un prompt, et le prompt agit comme le centre de contrôle qui interprète l'entrée et façonne la sortie. La démo d'Alibaba est un document d'introduction de marque de café associé à une phrase d'orientation, « Transformez cette histoire de marque en un spot publicitaire aux tons chauds », qui produit un film de marque complet.
Le cadre d'Alibaba est que la génération vidéo passe de la nouveauté de contenu à l'outil de production. La capacité « tout-en-vidéo » vise la publicité, les démos d'interaction d'interface et le marketing de destination, où les films de destination ne nécessitent plus de tournages en extérieur à grande échelle. Selon Alibaba, le même chemin couvre les animations de fonctionnalités logicielles et la visualisation de données : le modèle préserve l'esthétique et la texture du design d'origine tout en le faisant passer au mouvement. Rien dans l'API ne décide si ces cas d'usage sont rentables, mais la flexibilité des entrées est ce qui permet à un dossier existant de devenir une vidéo de brouillon sans reconstruire l'idée de zéro.
Les promesses de réalisme, et les lacunes qu'Alibaba reconnaît
Sur la qualité de sortie, Wan3.0 s'appuie sur deux affirmations : des visages réalistes et variés au lieu de l'aspect brillant et interchangeable des personnages IA typiques, et une cohérence précise de la référence vers la vidéo à travers les personnages, les accessoires, les espaces et le style, y compris des émotions distinctes dans les scènes de groupe. La capacité d'édition introduite dans Wan2.7 est conservée, afin que les visuels, l'intrigue et le dialogue puissent être modifiés sans régénérer de zéro. L'itération devient une passe de révision, pas une reprise.
La cohérence est la mesure qui compte le plus pour les équipes de production, soutient le blog : en mode référence-vers-vidéo, Wan3.0 reproduit précisément les détails de la référence et les maintient stables sur les dimensions clés. C'est la différence entre un clip qui semble correct isolément et un clip qui survit à une séquence de coupe.
Alibaba signale également les points faibles du modèle. Dans les tests internes, la texture audio et la précision du rendu du texte à l'écran « s'améliorent mais ne sont pas encore là où nous le souhaitons », et ces deux domaines font l'objet de raffinements actifs. Pour un modèle qui positionne les documents et les graphiques comme entrée, un texte lisible à l'écran est une lacune non négligeable.
La trajectoire est claire : la famille Wan a livré huit itérations de Wan1.0 à Wan3.0, et Alibaba oriente les mêmes capacités, comprendre des informations plus riches et générer des sorties physiquement plus cohérentes, vers l'IA incarnée, la conduite autonome et la simulation industrielle. Pour l'instant, la lecture pratique est plus simple. Le compteur rend les dépenses en vidéo IA prévisibles. Savoir si 6 $ achètent un clip utilisable est une question à laquelle seule une campagne de production peut répondre.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.