Générateur de vidéo à personnage cohérent

Aucun modèle vidéo ne se souvient de votre personnage d’une requête à l’autre, et ceux qui prétendent le contraire stockent un fichier et vous le renvoient. Vous pouvez donc sauter l’identité qu’il faut entraîner d’abord : joignez les images fixes, le clip et la voix au plan que vous demandez, jusqu’à douze fichiers dans une seule requête.
Le premier clip est gratuit. Sans carte.

Écrivez le plan suivant

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • Donnez au personnage un fichier, pas un adjectif : une image fixe de face vaut mieux qu’un paragraphe de description, à chaque fois
  • Dites à quoi sert chaque fichier : celui-ci pour le visage, celui-là pour le mouvement, cet autre pour la voix
  • Nommez les traits qui ne doivent pas bouger — les cheveux, la veste, la cicatrice. Tout ce qui n’est pas nommé est redessinable
  • Une scène, c’est une requête par plan, et les mêmes références repartent à chaque fois

Sans carte : chaque clip de cette page se lit sans compte, et un compte gratuit en lance un à vous — 4 s, 768P, avec le son, sans filigrane, à télécharger et à exploiter commercialement.

Quatre façons de tenir un personnage, tirées des exemples publiés par MiniMax. Chaque carte ouvre le prompt complet.

Vidéo à personnage cohérent : un couple à l’évier s’envoie de la mousse de liquide vaisselle, le visage de la femme venant d’une image fixe et son minutage d’un clip de référence distinct

Le visage vient d’une image, le jeu vient d’un clip

Le prompt entre, la distribution sort

Le prompt à gauche. Ce qu’il a rendu à droite.

Le visage vient d’une image, le jeu vient d’un clip16:9 · 15 s · 1 image de référence + 1 clip de référence

Deux fichiers, deux rôles. L’image fixe dit qui c’est ; le clip dit comment cette personne bouge, à quelle vitesse, avec quel minutage. Aucun des deux ne fait le travail de l’autre — et le prompt nomme quel fichier répond à quelle question avant de décrire la moindre action.

The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.

Vidéo à personnage cohérent : un couple à l’évier s’envoie de la mousse de liquide vaisselle, le visage de la femme venant d’une image fixe et son minutage d’un clip de référence distinct
Un personnage tenu quinze secondes16:9 · 15 s · 2 images de référence

Lisez la première proposition : utiliser l’image 2 comme référence fixe du personnage, puis quatre traits nommés un par un — les cheveux noirs à demi attachés, la couronne ajourée en argent, la robe, la palette. Cette liste, c’est tout le procédé. Les traits que vous ne nommez pas sont ceux que le modèle est libre de redessiner.

Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.

Vidéo à personnage cohérent : une héroïne xianxia en robe blanche et couronne d’argent traverse une séquence enneigée, son costume inchangé d’un plan à l’autre
Deux rôles principaux, un teaser9:16 · 15 s · 2 images de référence

Une distribution, pas un personnage. Le prompt fixe les deux rôles à leurs images de référence avant d’écrire le moindre temps, parce qu’une scène à deux personnes, ce sont deux identités qui peuvent dériver séparément — et celle qui dérive est celle que vous n’avez pas fixée.

Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.

Vidéo à personnage cohérent : un teaser vertical de romance vampirique garde les deux mêmes têtes d’affiche dans une embrasure, un couloir et un plan serré à deux
Nouvelle distribution, même chorégraphie16:9 · 6 s · 1 clip de référence

Ce qui est tenu ici n’est pas un visage, c’est un enchaînement. Trois hommes en costume deviennent trois capybaras, et chaque temps d’une figure au sol en neuf mouvements survit à l’échange, parce que c’est le clip et non la phrase qui porte le minutage.

Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.

Vidéo à personnage cohérent : trois capybaras en costume exécutent un enchaînement au sol complexe, suivant exactement le mouvement des trois hommes du clip de référence

Ce que c’est, et ce que ce n’est pas

Ici, rien ne se souvient de votre personnage. C’est tout le problème, et toute la méthode.

Cette partie vient en premier, parce qu’elle décide si vous avez quelque chose à faire ici. Tous les produits qui vendent de la cohérence de personnage vous vendent une identité stockée : Higgsfield entraîne un Soul ID, Vidu conserve un jeu de références, Runway ancre une session. Ce qui est stocké, c’est un fichier, et ce qui se passe au moment de générer, c’est que le fichier est joint à votre requête.
La question n’est donc pas de savoir si un outil se souvient. Elle est de savoir combien de fichiers il accepte d’un coup, et ce que vous payez pour les garder quelque part.

Les mesures sont dures pour tout le monde, et cela vaut la peine de le savoir avant de faire un budget. Sur le Face Consistency Benchmark, un visage à l’intérieur d’un seul clip texte-vers-vidéo dérive 2,1 à 5,7 fois plus loin que la même mesure faite sur des images réelles : 0,0843 de distance cosinus ArcFace pour de la vraie vidéo contre 0,1734 pour le meilleur modèle mesuré et 0,4843 pour le pire. Entre deux clips distincts, cela empire plutôt que l’inverse : les méthodes conditionnées par référence de la comparaison ContextAnyone n’atteignent que 0,54 à 0,59 de similarité ArcFace d’une vidéo à l’autre.
Une image de référence est le plus gros levier qui existe, et ce n’est pas un verrou. Ce qu’elle achète, c’est un visage qu’un spectateur lit comme la même personne, sur la plupart des prises, pour le prix d’une prise.

Par mois, pour une identité stockée
$15–$129

Par mois, pour une identité stockée

Par tentative ailleurs, selon la durée
$0.45–$2.00

Par tentative ailleurs, selon la durée

Images, clips et audio dans une requête
9 · 3 · 3

Images, clips et audio dans une requête

Un plan de 8 secondes ici, avec le son
~$1.52

Un plan de 8 secondes ici, avec le son

  • Aucune identité à entraîner avant le premier plan
  • Aucune bibliothèque de personnages dont il faut payer le loyer
  • Aucune passe de lip sync à acheter séparément
  • Aucun filigrane à justifier, sur aucun forfait

Ce que vous fournissez

Quatre façons de dire qui est ce personnage

Une seule chose compte : le modèle redessine chaque pixel, le visage compris. Il ne colle jamais votre référence dans l’image. Le rôle de chaque fichier ci-dessous est donc de contraindre un redessin, pas de fournir un élément fini.

  • Des images fixes du personnage

    Jusqu’à neuf. Une seule image de face propre vaut mieux que trois mauvais angles : sur une référence prise de trois quarts, les scores d’identité mesurés chutent de plus de moitié. Ajoutez le costume et l’accessoire comme images séparées.

    Le signal le plus fort · jusqu’à 9 images
  • Un clip où il apparaît déjà

    Jusqu’à trois. Une vidéo porte ce qu’une image fixe ne porte pas : la démarche, le minutage, la façon de tenir une pause, une trajectoire de caméra. Deux des quatre exemples de cette page y prennent leur jeu d’acteur.

    Mouvement et rythme · jusqu’à 3 clips
  • Sa voix

    Jusqu’à trois fichiers audio, et une identité est une voix autant qu’un visage. H3 référence le timbre et dit votre nouvelle réplique avec, dans la même passe que l’image. L’audio doit voyager avec une image ou un clip.

    Un timbre, pas un clone · jusqu’à 3 audio
  • Rien qu’une description

    Cela fonctionne à l’intérieur d’un plan et cesse de fonctionner entre les plans. Écrivez-la une fois, générez le personnage, gardez l’image qui vous plaît et servez-vous-en comme référence pour tout ce qui suit.

    Un seul plan · de texte à vidéo

Les quatre tournent sur le même modèle au même tarif — 8 crédits la seconde en 768P, 13 en 2K, plus 5 pour le clip. Les références ne coûtent rien de plus. Chaque limite et chaque tarif, avec la date du dernier changement.

Du début à la fin

Comment tenir un personnage en quatre étapes

L’ordre compte plus ici que sur n’importe quelle autre page du site, parce qu’une distribution que vous n’avez pas fixée au plan un est une distribution que vous ne rattraperez pas au plan six.

  1. Un personnage xianxia en robe blanche, l’image qui devient la référence

    Distribuez les rôles avant d’écrire

    Choisissez les images qui vont devenir le personnage, et choisissez-les comme si vous faisiez un casting : une face bien propre, un trois-quarts, le costume, l’accessoire. Sur une entrée de trois quarts seule, les scores d’identité mesurés chutent de plus de moitié — la face n’est donc pas une préférence, c’est le fichier porteur.

    Jusqu’à 9 imagesUne face bien propre
  2. Un plan de cuisine à deux dont les visages viennent d’une image fixe et le minutage d’un clip

    Donnez à chaque fichier un rôle dans la phrase

    H3 lit le prompt avec un modèle de langage : on peut donc lui dire quel fichier répond à quelle question. L’image 1 est le personnage ; la vidéo 1 est l’action et le rythme est une phrase qui fonctionne. Joindre quatre fichiers et décrire une scène, non.

    Nommez le fichierNommez son rôle
  3. Deux rôles principaux dans un teaser vertical, tenus de part et d’autre d’une coupe

    L’apparence des rôles masculin et féminin suit strictement les images de référence… leurs voix suivent le timbre de l’audio de référence.

    ImageSon

    Reportez la distribution sur le plan suivant

    Rien n’est mémorisé d’une requête à l’autre. Le plan deux reprend les mêmes références que le plan un, plus — et c’est la partie que tout le monde saute — une image que vous avez gardée du plan un. Le résultat du plan précédent est la meilleure référence que vous aurez jamais pour le suivant.

    Rejoindre les fichiers à chaque foisGarder une image
  4. Un rôle masculin dessiné en gros plan, la prise finale
    Piste audio · 32 kHzSHOT-01.MP4

    Brouillon en 768P, version finale en 2K

    Une seconde en 768P coûte 8 crédits contre 13 en 2K, et remonter ensuite un clip 768P terminé vers le 2K coûte exactement ce qu’aurait coûté un rendu direct en 2K — les six prises qu’il faut pour attraper un visage vous coûtent donc moins cher. Une génération ratée est remboursée automatiquement.

    768P · 8 crédits la seconde2K · 13 crédits la seconde

Quatre étapes, rien à installer, sans carte. Ouvrir le générateur.

Ce que personne ne vous dit

Ça dérive entre les plans, pas à l’intérieur. Voici ce que ça vous coûte.

Toutes les pages qui vendent de la cohérence de personnage vous montrent un clip, et à l’intérieur d’un clip le problème est presque résolu. Le travail que vous avez vraiment, ce sont six clips qui se montent ensemble, et c’est une autre mesure : celle qui suit, prise entre des vidéos plutôt qu’à l’intérieur de l’une d’elles.

  1. 01Le vrai chiffre est celui d’un plan à l’autre

    Les méthodes conditionnées par référence obtiennent 0,54 à 0,59 de similarité ArcFace entre deux vidéos de la même personne. À l’intérieur d’un clip, elles font mieux. Budgétez la coupe, pas la prise.

    0,54–0,59 entre clips

  2. 02Une image de face en vaut trois de trois quarts

    Quand l’image de référence n’est pas de face, les scores d’identité du meilleur modèle de base publié chutent de plus de 50 %. Si vous avez une bonne image de votre personnage, c’est celle-là qu’il faut envoyer — et l’envoyer à chaque fois.

    chute de plus de 50 %, entrée non frontale

  3. 03Les plafonds sont 9 images, 3 clips, 3 audio

    Douze fichiers en tout dans une requête, et l’audio doit voyager avec une image ou une vidéo plutôt que seul. Ce plafond est le chiffre qui mérite d’être comparé : la plupart des portes d’accès à ce modèle ne publient pas le leur.

    12 fichiers, une requête

  4. 04Nommez ce qui ne doit pas changer

    Les exemples publiés qui tiennent énumèrent les traits un par un : les cheveux à demi attachés, la couronne d’argent, la couleur de la veste. Un trait que vous n’avez pas nommé est un trait que le redessin est libre de réinterpréter, et il le fait généralement dès le quatrième plan.

    des traits, énumérés

  5. 05Une scène, c’est une requête par plan

    H3 rend un plan continu de 4 à 15 secondes. Une scène de six plans, ce sont six requêtes à environ $1.52 chacune et une passe dans votre logiciel de montage — soit à peu près $9 la scène, le chiffre à mettre en balance avec un abonnement mensuel par identité.

    6 plans ≈ $9

Les sources, pour que vous puissiez vérifier : les chiffres de dérive à l’intérieur d’un clip sont la colonne ArcFace du Face Consistency Benchmark (vraie vidéo 0,0843, meilleur modèle mesuré 0,1734, pire 0,4843 — plus bas est meilleur) ; les chiffres entre clips et la chute sur entrée non frontale viennent de ContextAnyone et de FaithfulFaces. Aucune de ces études n’a testé MiniMax H3, et nous n’avons pas fait tourner le benchmark nous-mêmes : elles sont là pour donner l’échelle du problème, pas pour classer ce modèle.

Pourquoi ceci plutôt qu’une bibliothèque de personnages

Un personnage est autant une voix qu’un visage

Demandez à quiconque monte une série verticale. La moitié des prises jetées le sont parce que le visage a tenu et pas l’interprétation — et sur la plupart des outils, la voix est un second produit, acheté à part et synchronisé à la main.

  • Une requête, une passe

    La voix revient avec le visage

    La stéréo 32 kHz est rendue à côté de l’image, et l’audio peut faire partie de vos références : le timbre que vous joignez est donc le timbre qui dit la nouvelle réplique. Pas d’étape de lip sync, pas d’abonnement voix séparé.

  • Douze fichiers d’un coup

    Toute la distribution tient dans une requête

    Neuf images, trois clips, trois fichiers audio, douze en tout. Un duo avec costumes et une image du décor tient largement là-dedans, et c’est pour cela que le teaser vampirique ci-dessus tient deux personnes plutôt qu’une.

  • Rien de stocké

    Aucune identité à entraîner, aucun loyer dessus

    Il n’y a pas de Soul ID ici, pas d’emplacement de personnage et pas de frais par identité : les fichiers vivent sur votre disque et montent avec la requête. C’est moins bien s’il vous faut une troupe entière ; c’est mieux si vous avez un personnage et six plans.

  • Un tarif, six formats

    Le vertical coûte ce que coûte le large

    21:9, 16:9, 4:3, 1:1, 3:4 et 9:16 sont facturés au même tarif à la seconde, parce que le fournisseur compte des secondes et ignore la forme. La série verticale est verticale, et cela ne coûte rien de plus.

Ce à quoi vous renoncez

Une garantie. C’est la limite honnête de toute la catégorie : une référence fait lire le visage comme la même personne sur la plupart des prises, et d’un plan à l’autre les chiffres publiés tournent autour de 0,55 de similarité, pas autour de 1. Si votre livrable exige un visage exact à l’image près — un acteur connu, un visage de marque, un droit à l’image — engagez la personne et filmez-la. Générez les plans autour d’elle.

Des travaux qui reviennent

Quatre travaux de personnage qui survivent à quinze secondes

Quatre travaux différents, quatre clips réellement faits comme ça, et derrière chaque bouton le prompt qui les a produits. Tous demandent un fichier à vous — le badge sur le clip dit lequel, et le bouton ouvre la bonne porte.

  • Vidéo à personnage cohérent : des enfants courent dans un champ en été, l’un d’eux remplacé par un golden retriever et une veste recolorée, tous les autres intacts
    16:9 · 6 s · 2 images de référence + 1 clip de référence

    Changez-en un, gardez les autres

    Deux modifications dans une seule phrase : l’enfant du fond devient le chien de l’image 1, la veste la plus à gauche change de couleur. Personne d’autre n’est mentionné dans le cadre, et personne d’autre ne change. C’est la forme d’une note que vous donneriez à un monteur, et c’est la forme que lit H3.

  • Vidéo à personnage cohérent : une silhouette en costume assorti est ajoutée à gauche d’un plan à deux et avance au même pas que les autres
    16:9 · 6 s · 1 clip de référence

    Ajoutez quelqu’un qui a sa place là

    Une ligne, et le nouvel arrivant hérite de l’uniforme, de la démarche et de la lumière. Le modèle n’incruste pas un détourage : il redessine le plan avec une personne de plus dedans, ce qui explique que l’ombre tombe juste et pourquoi vous ne pouvez pas récupérer les pixels d’origine.

  • Vidéo à personnage cohérent : le personnage masculin d’un jeu otome en blouson de cuir traverse un PV nocturne en ville, son design inchangé à chaque coupe
    16:9 · 15 s · 2 images de référence

    Un personnage dessiné, tenu au modèle

    C’est en illustration que la dérive se voit le plus, parce qu’un visage dessiné n’a aucune marge photographique où se cacher : l’écart entre les yeux correspond à la charte, ou il n’y correspond pas. L’image 2 est une référence stricte d’identité, et le reste du prompt est de la caméra et de l’ambiance.

  • Vidéo à personnage cohérent : une dispute de série verticale dans un petit restaurant, les deux mêmes interprètes tenus d’un bout à l’autre de l’échange
    9:16 · 15 s · 2 images de référence

    Une scène verticale avec une distribution fixe

    La série verticale est le travail pour lequel cette page existe : des dizaines de plans, les deux mêmes visages, en vertical. Quinze secondes, c’est un plan — la distribution est ce que vous rejoignez à la requête suivante, et le montage se fait dans votre logiciel, pas ici.

Les quatre sont des exemples publiés par MiniMax, réunis sous licence CC BY 4.0 — et c’est pourquoi chaque bouton peut charger le prompt exactement tel qu’il a été lancé.

Ce que ça coûte vraiment

Une scène de six plans avec un personnage coûte 414 crédits. Environ $9.

Un clip, c’est 5 crédits fixes pour la passe de compréhension du prompt, plus 8 crédits par seconde en 768P ou 13 par seconde en 2K. Les références sont gratuites : joindre neuf images coûte autant que n’en joindre aucune. Un crédit vaut un centime du tarif public que MiniMax publie elle-même, et tout est donc vérifiable sur une page que ce site ne contrôle pas. Une génération ratée est remboursée automatiquement, ce qui compte plus ici qu’ailleurs : tenir un visage est un travail que l’on recommence.

Ce que coûte un plan de personnage, par durée

Un plan de 4 s, 768P
37 crédits
Un plan de 8 s, 768P
69 crédits
Un plan de 15 s, 768P
125 crédits
Six plans de 8 s, 768P
414 crédits
Un plan de 8 s, 2K
109 crédits
Six plans de 8 s, 2K
654 crédits

Tous les tarifs · chaque limite et chaque tarif, datés · ce que coûte vraiment une seconde en 2K

Mêmes crédits mensuels dans les deux cas

  • GratuitSans CB

    Un vrai clip MiniMax H3, avec le son. Au-delà de 4 s · 768P, on passe aux crédits.

    $0pour toujours

    Aucune carte bancaire à aucun moment

    Commencer

    Simple vérification anti-robot — pas d’e-mail

    1 clip sur MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · avec le son
    7 jours de check-in — 37 crédits, un clip de plus

    N’importe quel pack à partir de $9.9 débloque MiniMax H3 — tous les modes, 768P et 2K

    • MiniMax H3 en 2K natifPayant uniquement
    • Audio natif avec l’imagePayant uniquement
    • Un clip, sans carte
    • 1 clip à la fois
    • Les clips échoués ne coûtent rien
    • Génération privée
    • N’importe quel pack débloque MiniMax H3 sur tous les modes

    Le gratuit, c’est un autre moteur. Voir les forfaits

    Vitesse et file d’attente

    File
    Voie gratuite
    Tâches simultanées
    1
    Lot
    1
    Historique gardé
    24 h · 7 jours une fois connecté
    Support
    Communauté
  • Lite−30 %

    Débloquez MiniMax H3 en 2K natif. Le plus petit forfait payant — c’est Pro que la plupart des gens prennent.

    $16.9/mo$24.9

    $202.8 facturés à l’année · $96 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    750 crédits / mois · ~20 vidéos

    4 s · 768P · de texte à vidéo

    ou ~13 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • MiniMax H3 en 2K natif — avec l’audio natif
    • Dialogues, effets et musique dans le même fichier
    • Jusqu’à 15 secondes15 s
    • ~20 vidéos par mois en 4 s 768P, de texte à vidéo
    • Les clips échoués ne coûtent rien
    • Remboursé sous 7 jours si crédits non utilisés
    • 1 tâche à la fois
    • 2 variantes d’un même prompt en lot

    Usage commercial inclus — ce que cela couvre

    Vitesse et file d’attente

    File
    Standard
    Tâches simultanées
    1
    Lot
    2
    Historique gardé
    7 jours
    Support
    E-mail · 48 h
  • Recommandé pour la plupart
    Pro−30 %

    $32 de plus que Lite. ~47 vidéos par mois, le même MiniMax H3, file d’attente plus rapide.

    $39.9/mo$56.9

    $478.8 facturés à l’année · $204 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    1 775 crédits / mois · ~47 vidéos

    4 s · 768P · de texte à vidéo

    ou ~31 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • Tout le forfait Lite
    • ~47 vidéos par mois en 4 s 768P, de texte à vidéo
    • 3 tâches simultanées
    • Extraire le prompt
    • 4 variantes d’un même prompt en lot
    • Historique gardé 7 jours
    • Remboursé sous 7 jours si crédits non utilisés

    Usage commercial inclus — ce que cela couvre

    Vitesse et file d’attente

    File
    Rapide
    Tâches simultanées
    3
    Lot
    4
    Historique gardé
    7 jours
    Support
    E-mail · 12 h
  • Studio−30 %

    Un mois entier de volume, la priorité dans la file, et un humain qui répond en 4 heures.

    $99.9/mo$142.9

    $1 198.8 facturés à l’année · $516 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    4 425 crédits / mois · ~119 vidéos

    4 s · 768P · de texte à vidéo

    ou ~77 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • Tout le forfait Pro
    • ~119 vidéos par mois en 4 s 768P, de texte à vidéo
    • 8 tâches simultanées
    • 4 variantes d’un même prompt en lot
    • Historique gardé 7 jours
    • Support prioritaire en 4 heures
    • Le coût en crédits le plus bas
    • Remboursé sous 7 jours si crédits non utilisés

    Usage commercial inclus — ce que cela couvre

    Vitesse et file d’attente

    File
    Prioritaire — en tête de file
    Tâches simultanées
    8
    Lot
    4
    Historique gardé
    7 jours
    Support
    Prioritaire · 4 h

Peut-on vraiment s’en servir

Oui, commercialement — et la question du droit à l’image est la vôtre

C’est la seule page de ce site où les droits qui comptent ne sont pas les nôtres. Charger un visage n’est pas charger un logo : voici donc la position avant que vous ne dépensiez quoi que ce soit.

  • Utilisation commercialeLe clip offert compris. Aucun filigrane sur aucun forfait, aucune redevance par clip, aucune licence séparée à acheter. MiniMax ne revendique aucun droit sur ce que vous générez, et ce site n’en ajoute aucun de son côté.
  • Un visage qui ne vous appartient pasC’est le point qui compte ici. Rien sur cette page ne vous donne de droits sur l’image de quelqu’un, et le visage d’une personne réelle n’est pas à vous parce que vous en aviez une photo. Obtenez l’autorisation que vous obtiendriez pour un tournage.
  • Vos propres interprètesUne image de référence de quelqu’un qui a donné son accord reste la vôtre. Le fichier chargé sert à exécuter votre requête ; ce qui revient est à vous pour la diffusion, et les mêmes vérifications que sur des images tournées s’appliquent.
  • Ce qui est refuséLa violence graphique et le contenu sexuel sont refusés au filtre d’entrée avant qu’une seule seconde ne soit facturée, tout comme un contenu conçu pour faire passer une personne générée pour une vraie personnalité publique. Ce contrôle porte sur le prompt et sur ce que vous joignez.

L’usage responsable en entier

Avant de dépenser quoi que ce soit

Vidéo à personnage cohérent : questions fréquentes

Les huit questions que l’on pose avant d’engager un personnage dans une scène, répondues avec les chiffres derrière.

Ce générateur de vidéo à personnage cohérent est-il gratuit ?

Le premier clip l’est, et c’est le vrai modèle — 4 secondes, 768P, avec le son, sans filigrane, sans carte — et il n’expire pas. Tout sur cette page se lit sans aucun compte. Ensuite, un plan de 8 secondes en 768P coûte 69 crédits et un plan de 15 secondes 125 ; les crédits démarrent à $9.9, ce qui met une scène de six plans à environ $9. Une génération ratée ne vous coûte rien.

Le personnage aura-t-il vraiment la même tête à chaque plan ?

Il se lira comme la même personne, oui, sur la plupart des prises. Identique à l’image près, non — et aucun outil de cette catégorie ne le fait. Les mesures publiées situent la similarité d’identité conditionnée par référence entre deux clips autour de 0,54 à 0,59, contre une base sur images réelles bien plus serrée. Prévoyez de garder quatre prises sur six, et de rejoindre les mêmes références à chaque requête.

Combien de fichiers de référence puis-je joindre ?

Jusqu’à 9 images, 3 clips vidéo et 3 fichiers audio, soit 12 fichiers dans une seule requête. L’audio doit voyager avec une image ou un clip plutôt que seul. Joindre des références ne coûte rien de plus : le prix, ce sont les secondes que vous rendez.

Photos ou clip vidéo — qu’est-ce qui tient le mieux un personnage ?

Ils tiennent des choses différentes. Une image fixe est le signal le plus fort pour le visage et le costume ; un clip porte la démarche, le minutage et la caméra. Utilisez les deux et dites lequel fait quoi dans le prompt. Si vous n’avez qu’un fichier, que ce soit une image de face bien propre : sur une entrée non frontale, les scores d’identité mesurés chutent de plus de moitié.

Le personnage peut-il garder la même voix ?

Oui — joignez un audio en référence et H3 dit votre nouvelle réplique avec ce timbre, rendu dans la même passe que l’image plutôt que doublé après coup. C’est une référence de timbre, pas une voix clonée que vous pouvez mettre en banque, et il lui faut une image ou un clip à côté.

En quoi est-ce différent d’un Soul ID ou d’une bibliothèque de personnages ?

Ces outils stockent une identité pour vous et facturent un abonnement pour la troupe — $15 à $129 par mois chez Higgsfield, par exemple. Ici, rien n’est stocké : vos fichiers montent avec chaque requête et vous payez des secondes. Moins bien si vous gérez vingt personnages, mieux si vous en avez un et six plans à faire.

Puis-je faire une scène entière d’un coup ?

Non. H3 rend un plan continu de 4 à 15 secondes entières à 24 images par seconde : une scène est donc une requête par plan et le montage se fait dans votre logiciel. Les durées tombent sur une grille de 17n+5 images, ce qui fait de 192 images — exactement 8,000 secondes — la seule seconde entière de la plage, et celle à utiliser si vos plans doivent se monter sur une musique.

Puis-je utiliser le visage de quelqu’un comme référence ?

Seulement si vous en avez le droit. Rien ici ne vous donne de droits sur l’image d’une personne, et générer une vraie personnalité publique est refusé au filtre d’entrée. Pour vos propres interprètes, obtenez la même autorisation que pour un tournage ; ce qui revient est ensuite à vous pour un usage commercial, sur tous les forfaits, y compris le gratuit.

Arrêtez de décrire votre personnage. Distribuez-le.

Une image fixe, une phrase disant à quoi sert chaque fichier, et un plan en retour en quatre-vingt-dix secondes environ. Le premier est offert — sans carte, sans filigrane, et il est à vous pour un usage commercial.

Inscription gratuite · 1 clip sur MiniMax H3

Rédigé et tenu à jour par l’équipe éditoriale de MiniMax H3 AI Video GeneratorPublié le Mis à jour le Version de l’outil 2026.09.4