Alternatives

Générateur de vidéo MiniMax M3 ? Le modèle, c’est H3

M3 avale de la vidéo et rend du texte, jamais une image. Celui qui fabrique la vidéo, c’est H3 — et voici ce que M3 voit vraiment d’un clip.

8 min de lectureRédactionRédaction
Générateur de vidéo MiniMax M3 ? Le modèle, c’est H3

MiniMax M3 ne génère pas de vidéo, et ne l’a jamais fait. La vidéo, il la prend en entrée — jusqu’à une trentaine de minutes de métrage par requête — et il ressort du texte. Des descriptions, des critiques, des découpages, du code. Le modèle MiniMax qui fabrique de la vidéo, c’est H3, sorti deux mois après M3, à une lettre près dans la chaîne de l’API.

Il y a deux façons d’arriver ici, et elles appellent des réponses opposées.

Si vous cherchiez un générateur de vidéo MiniMax M3, le modèle que vous voulez s’appelle H3 et vous pouvez en générer un tout de suite — même éditeur, bonne lettre. Si vous pensiez bien à M3 et voulez savoir ce qu’il fait d’un métrage, lisez la suite. La réponse est bien plus précise que « rien », et la vraie limite n’est pas celle qui figure sur la fiche technique.

MiniMax M3 peut-il générer de la vidéo ?

Non. Je suis allé voir le pipeline tag en premier, parce qu’il tranche la question en une vérification et que vous pouvez la refaire en moins d’une minute.

MiniMax M3MiniMax H3
Pipeline tag Hugging Faceimage-text-to-textimage-text-to-video
Chaîne du modèleMiniMax-M3MiniMax-H3
Point d’entrée/v1/chat/completions/v2/video_generation
Comment on l’appelleChat, synchroneCréer une tâche, sonder l’identifiant, récupérer le fichier
Facturé enTokensSecondes produites
Ce qui revientDu texteUn MP4

Le pipeline tag est la ligne rapide. C’est un champ déclaré sur le dépôt du modèle et il nomme la modalité de sortie — celui de M3 dit text. Un modèle dont le task tag se termine par -to-text n’a aucun chemin vers un fichier vidéo, quelle que soit la formulation de la requête.

La ligne de facturation est celle qui mord les équipes plutôt que les particuliers. Chiffrez un projet sur le mauvais modèle et l’estimation n’est pas légèrement fausse : elle est dans la mauvaise unité — des tokens contre des secondes produites — et rien en aval ne se réconcilie.

Donnez un clip à M3 : voici ce qu’il voit vraiment

Bon à savoir même si vous ne faites que de la vidéo, parce que M3 s’avère utile sur le chemin de l’entrée.

M3 est nativement multimodal : texte, images et vidéo arrivent par le même point d’entrée de chat, entraînés ensemble dès le départ plutôt que par un adaptateur visuel greffé sur un modèle de texte. La fiche de déploiement NVIDIA situe le plafond long format autour de 30 minutes de métrage par requête, et MiniMax annonce 84,6 sur Video-MME à 512 images — sa propre évaluation, donc à lire comme une déclaration de l’éditeur.

Trois choses comptent plus que ce score.

La vidéo entre sous forme d’images, pas de fichier. Vous échantillonnez le clip et passez une séquence ordonnée d’images fixes. L’évaluation publiée par MiniMax échantillonnait à 1 FPS.

Ce qui fait du plafond un budget de tokens déguisé en durée. Chaque image échantillonnée dépense une part de la fenêtre de contexte de 1 048 576 tokens. C’est pourquoi la limite apparaît en minutes sur une page de déploiement et en images dans une configuration d’évaluation : 512 images à 1 FPS, cela fait environ huit minutes et demie de métrage réel. Une demi-heure n’est une demi-heure que si vous acceptez de la regarder à une image par seconde — échantillonnez deux minutes à 12 FPS et vous aurez dépensé le même budget sur un douzième de la durée. Réglez votre cadence sur le plan, pas sur la longueur du fichier.

M3 n’entend pas votre clip. Le chemin vidéo est une suite d’images fixes et la bande-son ne voyage pas avec elles. L’indice est dans le protocole Video-MME de MiniMax lui-même, qui intercalait les sous-titres sous forme de texte toutes les 30 secondes au lieu d’injecter l’audio. Donc tout ce que M3 dit des dialogues, de la musique ou de l’ambiance, il l’a déduit des images et du texte que vous lui avez donné. Si les dialogues comptent, collez une transcription.

Reste une inversion nette pour retenir la paire : H3 se définit par le son qu’il produit, M3 par le son qu’il ne peut pas prendre. Même éditeur, deux mois d’écart.

Si décrire un métrage que vous avez déjà est le vrai travail, notre outil pour extraire le prompt d’une vidéo en fait la version taillée pour H3 : il lit un clip et renvoie un prompt structuré à partir duquel générer directement, au lieu d’une prose qu’il faut ensuite convertir à la main.

Quatre noms répondent maintenant à « MiniMax 3 »

Le nom que vous avez vuCe que c’estFait de la vidéo ?
MiniMax H3Le modèle vidéo. Texte, images, vidéo et audio en entrée ; 4 à 15 secondes en sortie, jusqu’en 2KOui
MiniMax H3 MaxLe H3 post-entraîné par fal — plus rapide, plafonné en 768p, deux points d’entréeOui, avec un plafond plus bas
MiniMax M3Le modèle de texte, de code et d’agent. Lit la vidéo, écrit du texteNon
Music-3.0Le modèle musical de MiniMaxNon

Trois produits avec un 3 dans le nom sont sortis en 2026, les chaînes d’API de deux d’entre eux diffèrent d’un caractère, et MiniMax vend la fenêtre d’un million de tokens de M3 sur la « compréhension de vidéo longue » — exact, et indiscernable de la génération vidéo au premier coup d’œil.

H3 Max est la manière la plus récente d’atterrir au mauvais endroit. C’est un vrai modèle validé par MiniMax, listé à côté de H3 dans sa propre documentation, mais pas un modèle que l’on substitue librement : hébergé seulement, sans poids publiés, en 768p plutôt qu’en 2K. Ce que « Max » maximise réellement, et ce qu’il abandonne parcourt tout l’échange.

Le modèle qu’exige votre travail

Ce qui doit sortirLe modèle
Une vidéo, avec le son, à partir d’une idée écriteMiniMax H3De texte à vidéo
Une vidéo qui part d’une photo que vous avezMiniMax H3Animer une photo
Une vidéo qui tient un personnage, une voix ou un style d’un plan à l’autreMiniMax H3La cohérence des personnages
Un prompt ou une description tirés d’un métrage existantl’un ou l’autreExtraire le prompt d’une vidéo
Du texte, du code, un agent, une lecture à long contexteMiniMax M3Les pages M3 de MiniMax

M3 écrit le prompt, H3 le génère

M3 a bien un poste dans une chaîne vidéo. Ce n’est simplement pas le poste de la génération.

H3 ne veut pas d’une phrase. Il veut une longue description structurée — plan par plan, avec les mouvements de caméra, les minutages et le son écrits dans des champs nommés. MiniMax fabrique cette description avec une étape hébergée appelée Context-IR, qui ne fait pas partie de la publication ouverte, et sa propre documentation invite les développeurs à bâtir leur propre prétraitement.

M3 comble cette ouverture presque trop bien. Une fenêtre d’un million de tokens contient à la fois une charte de marque et un découpage ; l’entrée image et vidéo native lui permet de lire vos éléments de référence ; et il sort du texte, ce qui est précisément ce que H3 consomme. La chaîne est donc M3 écrit le prompt, H3 le génère — et la recherche qui vous a amené ici était à une lettre d’un vrai flux de travail plutôt que d’une erreur.

Le passage de relais complet — le prompt système qui fait émettre à M3 le format à trois champs de H3, ce que l’échange coûte face à la génération, et l’endroit où les deux licences divergent — est dans MiniMax H3 vs MiniMax M3. Pour ne pas avoir à le bâtir, notre générateur de prompts produit la même structure dans le navigateur.

MiniMax M3 et la vidéo : questions fréquentes

MiniMax M3 est-il un modèle vidéo ? C’est un modèle multimodal qui lit la vidéo. Ce n’est pas un modèle de génération vidéo — son pipeline tag est image-text-to-text.

MiniMax M3 sait-il faire du texte à vidéo ? Non. H3 le sait, et c’est le modèle que MiniMax a bâti pour cela.

Qu’est-ce que ce « générateur de vidéo MiniMax M3 » que je vois passer ? Presque toujours une interface MiniMax H3 qui emploie l’orthographe M3 pour capter cette recherche. Le générateur est réel ; le nom de modèle affiché dessus est faux.

H3 Max est-il la même chose que M3 ? Non, et ce sont les deux qu’on intervertit le plus facilement par accident. H3 Max fait de la vidéo et c’est un H3 post-entraîné ; M3 fait du texte. La lettre commune est une coïncidence.

M3 comprend-il l’audio de la vidéo que je lui envoie ? Non. Ce sont des images qui entrent, pas la bande-son. Collez une transcription sous forme de texte quand les dialogues comptent.

Combien de paramètres a MiniMax M3 ? Environ 428B au total, dont à peu près 23B actifs par token, répartis sur 128 experts dont quatre s’activent par token. Les métadonnées safetensors de Hugging Face indiquent exactement 427 040 140 160.

MiniMax M3 et MiniMax H3 sont-ils tous deux en poids ouverts ? Les deux publient des poids sous des licences restreintes qui ne sont pas de l’open source au sens OSI, et les restrictions n’ont pas la même forme : M3 ne porte pas de limite territoriale, H3 exclut quatre marchés. Ce que la licence H3 interdit vraiment décortique ce côté-là.

Je veux juste faire une vidéo. Commencez par MiniMax H3, de texte à vidéo — sans M3, et le son arrive dans la même passe.


Dernière vérification le 31 août 2026. Le plafond de 30 minutes est le chiffre de déploiement publié par NVIDIA plutôt qu’une garantie de l’API MiniMax, et le score Video-MME est celui de MiniMax — les deux sont sourcés pour que vous puissiez les revérifier au lieu de les croire sur parole. MiniMax livre assez vite pour qu’un quatrième « 3 » soit une possibilité réelle.

Rédaction

Rédigé par

Rédaction

minimax-h3ai.video

Publié sur le MiniMax H3 AI Video Generator, une interface tierce indépendante bâtie sur MiniMax H3.

Tous les articles