Aucun modèle vidéo ne se souvient de votre personnage d’une requête à l’autre, et ceux qui prétendent le contraire stockent un fichier et vous le renvoient. Vous pouvez donc sauter l’identité qu’il faut entraîner d’abord : joignez les images fixes, le clip et la voix au plan que vous demandez, jusqu’à douze fichiers dans une seule requête. Le premier clip est gratuit. Sans carte.
Quatre façons de tenir un personnage, tirées des exemples publiés par MiniMax. Chaque carte ouvre le prompt complet.
Le visage vient d’une image, le jeu vient d’un clip
Le prompt entre, la distribution sort
Le prompt à gauche. Ce qu’il a rendu à droite.
Le visage vient d’une image, le jeu vient d’un clip16:9 · 15 s · 1 image de référence + 1 clip de référence
Deux fichiers, deux rôles. L’image fixe dit qui c’est ; le clip dit comment cette personne bouge, à quelle vitesse, avec quel minutage. Aucun des deux ne fait le travail de l’autre — et le prompt nomme quel fichier répond à quelle question avant de décrire la moindre action.
The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.
Un personnage tenu quinze secondes16:9 · 15 s · 2 images de référence
Lisez la première proposition : utiliser l’image 2 comme référence fixe du personnage, puis quatre traits nommés un par un — les cheveux noirs à demi attachés, la couronne ajourée en argent, la robe, la palette. Cette liste, c’est tout le procédé. Les traits que vous ne nommez pas sont ceux que le modèle est libre de redessiner.
Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.
Deux rôles principaux, un teaser9:16 · 15 s · 2 images de référence
Une distribution, pas un personnage. Le prompt fixe les deux rôles à leurs images de référence avant d’écrire le moindre temps, parce qu’une scène à deux personnes, ce sont deux identités qui peuvent dériver séparément — et celle qui dérive est celle que vous n’avez pas fixée.
Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.
Nouvelle distribution, même chorégraphie16:9 · 6 s · 1 clip de référence
Ce qui est tenu ici n’est pas un visage, c’est un enchaînement. Trois hommes en costume deviennent trois capybaras, et chaque temps d’une figure au sol en neuf mouvements survit à l’échange, parce que c’est le clip et non la phrase qui porte le minutage.
Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.
Ce que c’est, et ce que ce n’est pas
Ici, rien ne se souvient de votre personnage. C’est tout le problème, et toute la méthode.
Cette partie vient en premier, parce qu’elle décide si vous avez quelque chose à faire ici. Tous les produits qui vendent de la cohérence de personnage vous vendent une identité stockée : Higgsfield entraîne un Soul ID, Vidu conserve un jeu de références, Runway ancre une session. Ce qui est stocké, c’est un fichier, et ce qui se passe au moment de générer, c’est que le fichier est joint à votre requête. La question n’est donc pas de savoir si un outil se souvient. Elle est de savoir combien de fichiers il accepte d’un coup, et ce que vous payez pour les garder quelque part.
Les mesures sont dures pour tout le monde, et cela vaut la peine de le savoir avant de faire un budget. Sur le Face Consistency Benchmark, un visage à l’intérieur d’un seul clip texte-vers-vidéo dérive 2,1 à 5,7 fois plus loin que la même mesure faite sur des images réelles : 0,0843 de distance cosinus ArcFace pour de la vraie vidéo contre 0,1734 pour le meilleur modèle mesuré et 0,4843 pour le pire. Entre deux clips distincts, cela empire plutôt que l’inverse : les méthodes conditionnées par référence de la comparaison ContextAnyone n’atteignent que 0,54 à 0,59 de similarité ArcFace d’une vidéo à l’autre. Une image de référence est le plus gros levier qui existe, et ce n’est pas un verrou. Ce qu’elle achète, c’est un visage qu’un spectateur lit comme la même personne, sur la plupart des prises, pour le prix d’une prise.
Par mois, pour une identité stockée
$15–$129
Par mois, pour une identité stockée
Par tentative ailleurs, selon la durée
$0.45–$2.00
Par tentative ailleurs, selon la durée
Images, clips et audio dans une requête
9 · 3 · 3
Images, clips et audio dans une requête
Un plan de 8 secondes ici, avec le son
~$1.52
Un plan de 8 secondes ici, avec le son
Aucune identité à entraîner avant le premier plan
Aucune bibliothèque de personnages dont il faut payer le loyer
Aucune passe de lip sync à acheter séparément
Aucun filigrane à justifier, sur aucun forfait
Ce que vous fournissez
Quatre façons de dire qui est ce personnage
Une seule chose compte : le modèle redessine chaque pixel, le visage compris. Il ne colle jamais votre référence dans l’image. Le rôle de chaque fichier ci-dessous est donc de contraindre un redessin, pas de fournir un élément fini.
01
Des images fixes du personnage
Jusqu’à neuf. Une seule image de face propre vaut mieux que trois mauvais angles : sur une référence prise de trois quarts, les scores d’identité mesurés chutent de plus de moitié. Ajoutez le costume et l’accessoire comme images séparées.
Le signal le plus fort · jusqu’à 9 images
02
Un clip où il apparaît déjà
Jusqu’à trois. Une vidéo porte ce qu’une image fixe ne porte pas : la démarche, le minutage, la façon de tenir une pause, une trajectoire de caméra. Deux des quatre exemples de cette page y prennent leur jeu d’acteur.
Mouvement et rythme · jusqu’à 3 clips
03
Sa voix
Jusqu’à trois fichiers audio, et une identité est une voix autant qu’un visage. H3 référence le timbre et dit votre nouvelle réplique avec, dans la même passe que l’image. L’audio doit voyager avec une image ou un clip.
Un timbre, pas un clone · jusqu’à 3 audio
04
Rien qu’une description
Cela fonctionne à l’intérieur d’un plan et cesse de fonctionner entre les plans. Écrivez-la une fois, générez le personnage, gardez l’image qui vous plaît et servez-vous-en comme référence pour tout ce qui suit.
L’ordre compte plus ici que sur n’importe quelle autre page du site, parce qu’une distribution que vous n’avez pas fixée au plan un est une distribution que vous ne rattraperez pas au plan six.
01
Distribuez les rôles avant d’écrire
Choisissez les images qui vont devenir le personnage, et choisissez-les comme si vous faisiez un casting : une face bien propre, un trois-quarts, le costume, l’accessoire. Sur une entrée de trois quarts seule, les scores d’identité mesurés chutent de plus de moitié — la face n’est donc pas une préférence, c’est le fichier porteur.
Jusqu’à 9 imagesUne face bien propre
02
Donnez à chaque fichier un rôle dans la phrase
H3 lit le prompt avec un modèle de langage : on peut donc lui dire quel fichier répond à quelle question. L’image 1 est le personnage ; la vidéo 1 est l’action et le rythme est une phrase qui fonctionne. Joindre quatre fichiers et décrire une scène, non.
Nommez le fichierNommez son rôle
L’apparence des rôles masculin et féminin suit strictement les images de référence… leurs voix suivent le timbre de l’audio de référence.
ImageSon
03
Reportez la distribution sur le plan suivant
Rien n’est mémorisé d’une requête à l’autre. Le plan deux reprend les mêmes références que le plan un, plus — et c’est la partie que tout le monde saute — une image que vous avez gardée du plan un. Le résultat du plan précédent est la meilleure référence que vous aurez jamais pour le suivant.
Rejoindre les fichiers à chaque foisGarder une image
Piste audio · 32 kHzSHOT-01.MP4
04
Brouillon en 768P, version finale en 2K
Une seconde en 768P coûte 8 crédits contre 13 en 2K, et remonter ensuite un clip 768P terminé vers le 2K coûte exactement ce qu’aurait coûté un rendu direct en 2K — les six prises qu’il faut pour attraper un visage vous coûtent donc moins cher. Une génération ratée est remboursée automatiquement.
768P · 8 crédits la seconde2K · 13 crédits la seconde
Ça dérive entre les plans, pas à l’intérieur. Voici ce que ça vous coûte.
Toutes les pages qui vendent de la cohérence de personnage vous montrent un clip, et à l’intérieur d’un clip le problème est presque résolu. Le travail que vous avez vraiment, ce sont six clips qui se montent ensemble, et c’est une autre mesure : celle qui suit, prise entre des vidéos plutôt qu’à l’intérieur de l’une d’elles.
01Le vrai chiffre est celui d’un plan à l’autre
Les méthodes conditionnées par référence obtiennent 0,54 à 0,59 de similarité ArcFace entre deux vidéos de la même personne. À l’intérieur d’un clip, elles font mieux. Budgétez la coupe, pas la prise.
0,54–0,59 entre clips
02Une image de face en vaut trois de trois quarts
Quand l’image de référence n’est pas de face, les scores d’identité du meilleur modèle de base publié chutent de plus de 50 %. Si vous avez une bonne image de votre personnage, c’est celle-là qu’il faut envoyer — et l’envoyer à chaque fois.
chute de plus de 50 %, entrée non frontale
03Les plafonds sont 9 images, 3 clips, 3 audio
Douze fichiers en tout dans une requête, et l’audio doit voyager avec une image ou une vidéo plutôt que seul. Ce plafond est le chiffre qui mérite d’être comparé : la plupart des portes d’accès à ce modèle ne publient pas le leur.
12 fichiers, une requête
04Nommez ce qui ne doit pas changer
Les exemples publiés qui tiennent énumèrent les traits un par un : les cheveux à demi attachés, la couronne d’argent, la couleur de la veste. Un trait que vous n’avez pas nommé est un trait que le redessin est libre de réinterpréter, et il le fait généralement dès le quatrième plan.
des traits, énumérés
05Une scène, c’est une requête par plan
H3 rend un plan continu de 4 à 15 secondes. Une scène de six plans, ce sont six requêtes à environ $1.52 chacune et une passe dans votre logiciel de montage — soit à peu près $9 la scène, le chiffre à mettre en balance avec un abonnement mensuel par identité.
6 plans ≈ $9
Les sources, pour que vous puissiez vérifier : les chiffres de dérive à l’intérieur d’un clip sont la colonne ArcFace du Face Consistency Benchmark (vraie vidéo 0,0843, meilleur modèle mesuré 0,1734, pire 0,4843 — plus bas est meilleur) ; les chiffres entre clips et la chute sur entrée non frontale viennent de ContextAnyone et de FaithfulFaces. Aucune de ces études n’a testé MiniMax H3, et nous n’avons pas fait tourner le benchmark nous-mêmes : elles sont là pour donner l’échelle du problème, pas pour classer ce modèle.
Pourquoi ceci plutôt qu’une bibliothèque de personnages
Un personnage est autant une voix qu’un visage
Demandez à quiconque monte une série verticale. La moitié des prises jetées le sont parce que le visage a tenu et pas l’interprétation — et sur la plupart des outils, la voix est un second produit, acheté à part et synchronisé à la main.
Une requête, une passe
La voix revient avec le visage
La stéréo 32 kHz est rendue à côté de l’image, et l’audio peut faire partie de vos références : le timbre que vous joignez est donc le timbre qui dit la nouvelle réplique. Pas d’étape de lip sync, pas d’abonnement voix séparé.
Douze fichiers d’un coup
Toute la distribution tient dans une requête
Neuf images, trois clips, trois fichiers audio, douze en tout. Un duo avec costumes et une image du décor tient largement là-dedans, et c’est pour cela que le teaser vampirique ci-dessus tient deux personnes plutôt qu’une.
Rien de stocké
Aucune identité à entraîner, aucun loyer dessus
Il n’y a pas de Soul ID ici, pas d’emplacement de personnage et pas de frais par identité : les fichiers vivent sur votre disque et montent avec la requête. C’est moins bien s’il vous faut une troupe entière ; c’est mieux si vous avez un personnage et six plans.
Un tarif, six formats
Le vertical coûte ce que coûte le large
21:9, 16:9, 4:3, 1:1, 3:4 et 9:16 sont facturés au même tarif à la seconde, parce que le fournisseur compte des secondes et ignore la forme. La série verticale est verticale, et cela ne coûte rien de plus.
Ce à quoi vous renoncez
Une garantie. C’est la limite honnête de toute la catégorie : une référence fait lire le visage comme la même personne sur la plupart des prises, et d’un plan à l’autre les chiffres publiés tournent autour de 0,55 de similarité, pas autour de 1. Si votre livrable exige un visage exact à l’image près — un acteur connu, un visage de marque, un droit à l’image — engagez la personne et filmez-la. Générez les plans autour d’elle.
Des travaux qui reviennent
Quatre travaux de personnage qui survivent à quinze secondes
Quatre travaux différents, quatre clips réellement faits comme ça, et derrière chaque bouton le prompt qui les a produits. Tous demandent un fichier à vous — le badge sur le clip dit lequel, et le bouton ouvre la bonne porte.
16:9 · 6 s · 2 images de référence + 1 clip de référence
Changez-en un, gardez les autres
Deux modifications dans une seule phrase : l’enfant du fond devient le chien de l’image 1, la veste la plus à gauche change de couleur. Personne d’autre n’est mentionné dans le cadre, et personne d’autre ne change. C’est la forme d’une note que vous donneriez à un monteur, et c’est la forme que lit H3.
16:9 · 6 s · 1 clip de référence
Ajoutez quelqu’un qui a sa place là
Une ligne, et le nouvel arrivant hérite de l’uniforme, de la démarche et de la lumière. Le modèle n’incruste pas un détourage : il redessine le plan avec une personne de plus dedans, ce qui explique que l’ombre tombe juste et pourquoi vous ne pouvez pas récupérer les pixels d’origine.
16:9 · 15 s · 2 images de référence
Un personnage dessiné, tenu au modèle
C’est en illustration que la dérive se voit le plus, parce qu’un visage dessiné n’a aucune marge photographique où se cacher : l’écart entre les yeux correspond à la charte, ou il n’y correspond pas. L’image 2 est une référence stricte d’identité, et le reste du prompt est de la caméra et de l’ambiance.
9:16 · 15 s · 2 images de référence
Une scène verticale avec une distribution fixe
La série verticale est le travail pour lequel cette page existe : des dizaines de plans, les deux mêmes visages, en vertical. Quinze secondes, c’est un plan — la distribution est ce que vous rejoignez à la requête suivante, et le montage se fait dans votre logiciel, pas ici.
Les quatre sont des exemples publiés par MiniMax, réunis sous licence CC BY 4.0 — et c’est pourquoi chaque bouton peut charger le prompt exactement tel qu’il a été lancé.
Ce que ça coûte vraiment
Une scène de six plans avec un personnage coûte 414 crédits. Environ $9.
Un clip, c’est 5 crédits fixes pour la passe de compréhension du prompt, plus 8 crédits par seconde en 768P ou 13 par seconde en 2K. Les références sont gratuites : joindre neuf images coûte autant que n’en joindre aucune. Un crédit vaut un centime du tarif public que MiniMax publie elle-même, et tout est donc vérifiable sur une page que ce site ne contrôle pas. Une génération ratée est remboursée automatiquement, ce qui compte plus ici qu’ailleurs : tenir un visage est un travail que l’on recommence.
Oui, commercialement — et la question du droit à l’image est la vôtre
C’est la seule page de ce site où les droits qui comptent ne sont pas les nôtres. Charger un visage n’est pas charger un logo : voici donc la position avant que vous ne dépensiez quoi que ce soit.
Utilisation commercialeLe clip offert compris. Aucun filigrane sur aucun forfait, aucune redevance par clip, aucune licence séparée à acheter. MiniMax ne revendique aucun droit sur ce que vous générez, et ce site n’en ajoute aucun de son côté.
Un visage qui ne vous appartient pasC’est le point qui compte ici. Rien sur cette page ne vous donne de droits sur l’image de quelqu’un, et le visage d’une personne réelle n’est pas à vous parce que vous en aviez une photo. Obtenez l’autorisation que vous obtiendriez pour un tournage.
Vos propres interprètesUne image de référence de quelqu’un qui a donné son accord reste la vôtre. Le fichier chargé sert à exécuter votre requête ; ce qui revient est à vous pour la diffusion, et les mêmes vérifications que sur des images tournées s’appliquent.
Ce qui est refuséLa violence graphique et le contenu sexuel sont refusés au filtre d’entrée avant qu’une seule seconde ne soit facturée, tout comme un contenu conçu pour faire passer une personne générée pour une vraie personnalité publique. Ce contrôle porte sur le prompt et sur ce que vous joignez.
Ce que nous avons appris en tenant des personnages avec MiniMax H3
Mesuré sur de vraies générations plutôt que lu sur une fiche de modèle : les plafonds de références, la grille d’images sur laquelle une coupe doit tomber, et la façon dont le son s’écrit.
Vidéo à personnage cohérent : questions fréquentes
Les huit questions que l’on pose avant d’engager un personnage dans une scène, répondues avec les chiffres derrière.
01
Ce générateur de vidéo à personnage cohérent est-il gratuit ?
Le premier clip l’est, et c’est le vrai modèle — 4 secondes, 768P, avec le son, sans filigrane, sans carte — et il n’expire pas. Tout sur cette page se lit sans aucun compte. Ensuite, un plan de 8 secondes en 768P coûte 69 crédits et un plan de 15 secondes 125 ; les crédits démarrent à $9.9, ce qui met une scène de six plans à environ $9. Une génération ratée ne vous coûte rien.
02
Le personnage aura-t-il vraiment la même tête à chaque plan ?
Il se lira comme la même personne, oui, sur la plupart des prises. Identique à l’image près, non — et aucun outil de cette catégorie ne le fait. Les mesures publiées situent la similarité d’identité conditionnée par référence entre deux clips autour de 0,54 à 0,59, contre une base sur images réelles bien plus serrée. Prévoyez de garder quatre prises sur six, et de rejoindre les mêmes références à chaque requête.
03
Combien de fichiers de référence puis-je joindre ?
Jusqu’à 9 images, 3 clips vidéo et 3 fichiers audio, soit 12 fichiers dans une seule requête. L’audio doit voyager avec une image ou un clip plutôt que seul. Joindre des références ne coûte rien de plus : le prix, ce sont les secondes que vous rendez.
04
Photos ou clip vidéo — qu’est-ce qui tient le mieux un personnage ?
Ils tiennent des choses différentes. Une image fixe est le signal le plus fort pour le visage et le costume ; un clip porte la démarche, le minutage et la caméra. Utilisez les deux et dites lequel fait quoi dans le prompt. Si vous n’avez qu’un fichier, que ce soit une image de face bien propre : sur une entrée non frontale, les scores d’identité mesurés chutent de plus de moitié.
05
Le personnage peut-il garder la même voix ?
Oui — joignez un audio en référence et H3 dit votre nouvelle réplique avec ce timbre, rendu dans la même passe que l’image plutôt que doublé après coup. C’est une référence de timbre, pas une voix clonée que vous pouvez mettre en banque, et il lui faut une image ou un clip à côté.
06
En quoi est-ce différent d’un Soul ID ou d’une bibliothèque de personnages ?
Ces outils stockent une identité pour vous et facturent un abonnement pour la troupe — $15 à $129 par mois chez Higgsfield, par exemple. Ici, rien n’est stocké : vos fichiers montent avec chaque requête et vous payez des secondes. Moins bien si vous gérez vingt personnages, mieux si vous en avez un et six plans à faire.
07
Puis-je faire une scène entière d’un coup ?
Non. H3 rend un plan continu de 4 à 15 secondes entières à 24 images par seconde : une scène est donc une requête par plan et le montage se fait dans votre logiciel. Les durées tombent sur une grille de 17n+5 images, ce qui fait de 192 images — exactement 8,000 secondes — la seule seconde entière de la plage, et celle à utiliser si vos plans doivent se monter sur une musique.
08
Puis-je utiliser le visage de quelqu’un comme référence ?
Seulement si vous en avez le droit. Rien ici ne vous donne de droits sur l’image d’une personne, et générer une vraie personnalité publique est refusé au filtre d’entrée. Pour vos propres interprètes, obtenez la même autorisation que pour un tournage ; ce qui revient est ensuite à vous pour un usage commercial, sur tous les forfaits, y compris le gratuit.
Arrêtez de décrire votre personnage. Distribuez-le.
Une image fixe, une phrase disant à quoi sert chaque fichier, et un plan en retour en quatre-vingt-dix secondes environ. Le premier est offert — sans carte, sans filigrane, et il est à vous pour un usage commercial.