Génération vidéo
MiniMax H3 sous-cote ses rivaux du secteur vidéo et prévoit des poids ouverts
MiniMax regroupe la génération d'images, de vidéo et d'audio dans un seul modèle, facture la sortie à moins d'un tiers des tarifs grand public par seconde et prévoit d'ouvrir les poids dans les prochains jours. La question ouverte reste de savoir si les sorties tiennent la route en dehors de ses propres démos.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-30 · Dernière mise à jour : 2026-08-02 · 4 min de lecture

MiniMax lance H3 comme un pari sur l'économie de la génération vidéo. Le modèle accepte un contexte mixte de texte, d'images, de vidéo et de son, et répond avec des séquences qui portent un son stéréo natif, jusqu'à 15 secondes en 2K. La sortie est facturée à moins d'un tiers du tarif des modèles grand public par seconde, et les poids sont promis dans les prochains jours.
Cette dernière promesse est ce que les rivaux remarquent en premier. La génération vidéo, soutient MiniMax, repose sur des modèles fermés, et la vitesse d'itération comme l'ouverture de l'écosystème ont pris du retard sur le monde des grands modèles de langage. L'ouverture de H3 applique à une catégorie qui y a jusqu'ici résisté la méthode qui a diffusé les LLM ouverts à grande échelle et à moindre coût.
Un seul modèle, pas de stack spécialisé
Le principe de conception est l'unification. Les précédents systèmes MiniMax, Hailuo 01 et Hailuo 02, étaient des modèles vidéo construits génération après génération. H3, lui, fusionne les divisions spécialisées, experts distincts pour le texte-vers-image, l'édition, la voix, les effets, la musique et les tâches de référence vidéo, en un seul modèle entraîné sur l'ensemble. MiniMax fait de l'unification et de la généralisation son premier principe, et le résultat se voit dans le prompt de démonstration : "Utilisez le mouvement de caméra hitchcockien de la vidéo 1, faites chanter la personne de l'image 2 et reprenez la voix de l'audio 3." Une seule instruction, quatre modalités d'entrée, aucun routage entre sous-modèles.
Les retours des premiers tests sur invitation, selon l'entreprise, montrent des résultats de qualité commerciale sur le suivi d'instructions, le rendu de textes et d'éléments de marque, et le transfert de mouvement vidéo-vers-vidéo, dans les domaines de la publicité, du commerce électronique, du design de produits, de l'UI/UX et des jeux. En pré-entraînement, le modèle combine le texte-vers-image, le texte-vers-vidéo avec génération audio conjointe, la modélisation multi-plans, le texte-vers-audio qui traite la voix, les effets et la musique comme un seul problème, ainsi que la référence et l'édition généralisées sur des paires image, audio et vidéo.
D'où vient le prix bas
Le chiffre le plus marquant de l'annonce est le prix : en 2K, moins d'un tiers du coût par seconde des modèles grand public ; en 768P, environ la moitié des tarifs 720P grand public. Aucun test indépendant ne vient encore étayer ces chiffres :
| Affirmation | Détail (selon MiniMax) |
|---|---|
| Sortie par défaut | 2K natif, clips jusqu'à 15 secondes |
| Prix par seconde en 2K | Moins d'1/3 des modèles grand public |
| Prix par seconde en 768P | Environ 1/2 des tarifs 720P grand public |
| Compression H3-VAE | Gain de longueur de séquence 4x |
| Débit d'entraînement | Près de 30 % plus élevé de bout en bout |
| Pipeline de légendes | ~100K jetons d'inférence par échantillon, ~4K jetons de légende en moyenne |
Deux choix de conception rendent le prix crédible sur le papier. Le tokeniseur H3-VAE est une refonte complète du tokeniseur de la génération précédente, et sa compression plus élevée procure un gain de longueur de séquence de 4x qui réduit le coût d'entraînement et d'inférence. C'est aussi ce qui fait du 2K la résolution par défaut. Pour la montée en résolution, il n'y a pas de module de super-résolution dédié : le modèle de base régénère son propre résultat basse résolution en contexte, réutilisant le contexte multimodal pour retrouver les petits textes et les détails qu'un upscaler conventionnel devrait deviner.
La compréhension du contexte était un centre de coût à part entière. La plupart des échantillons d'entraînement consommaient environ 100K jetons d'inférence et produisaient, en moyenne, environ 4K jetons de légende. Ce pipeline, que MiniMax appelle Contextual Omni Representation, est l'endroit où le modèle apprend à suivre des instructions qui mélangent les modalités et à décrire les relations au sein d'un contexte multimodal.
Les notes d'architecture admettent un revirement. MiniMax a abandonné l'architecture Hailuo-02 qui lui avait autrefois donné un avantage significatif, car cette conception ajoutait de la complexité une fois la généralisation des tâches devenue l'objectif. Le contexte multimodal a triplé la variance de longueur des séquences et séparé les charges de travail de compréhension et de génération, si bien que l'équipe est passée à un dispositif d'entraînement hétérogène avec un réglage du matériel par charge de travail et un équilibrage de charge au niveau des échantillons. MiniMax revendique un débit d'entraînement de bout en bout près de 30 % plus élevé grâce à cela.
Le pari des poids ouverts
La date d'ouverture est vague, "dans les prochains jours", et conditionnée au droit applicable. Les raisons de MiniMax : faire avancer la communauté open source, faciliter l'adaptation aux puces chinoises domestiques (la compatibilité avec plusieurs accélérateurs domestiques existants a été envisagée dès la phase de conception), et laisser les utilisateurs personnaliser leur propre version.
Rien de tout cela n'est neutre. Le clin d'œil aux puces chinoises domestiques, sans en nommer aucune, signale là où MiniMax s'attend à voir sa base d'utilisateurs croître.
Ce que H3 admet ne pas encore pouvoir faire
MiniMax liste ses propres limites. L'échelle du modèle laisse une marge d'amélioration sur le degré de complétude de certaines capacités, et les détails fins de certaines scènes demandent encore du travail, avec une résolution plus élevée et une qualité plus fine sur la feuille de route. Un rapport technique plus complet est promis, et la prochaine version de la série H doit fusionner avec les modèles de la série M. Selon MiniMax, le langage est un système de calcul généralisable et évolutif, et la multimodalité doit y rester étroitement couplée.
La vérification indépendante prendra du temps ; l'annonce ne contient aucun chiffre de benchmark. Ce qui est vérifiable aujourd'hui, c'est la stratégie : un modèle omnimodal qui semble performant, vendu au rabais, avec des poids promis à la communauté open source. Pour un marché bâti sur des modèles fermés, c'est un test de résistance. Si H3 tient ses promesses, les tarifs des rivaux devront bouger. Dans le cas contraire, les poids ouverts abaissent quand même le plancher pour tous les autres.
- Source : MiniMax H3 undercuts video rivals and plans open weights — 2026-07-31
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.