Synchronisation labiale IA

Déposez une photo, tapez ce qu’elle doit dire, et récupérez une vidéo qui parle — la voix vient avec, il n’y a donc aucun fichier audio à préparer. De quatre à quinze secondes, jusqu’en 2K, dans onze langues.

Depuis une photo

Créer une image

JPG · PNG · WEBP · HEIC · 30 Mo max · un seul visage

0 / 7000

Le locuteur garde le même visage, les mêmes cheveux, les mêmes vêtements et les mêmes couleurs du début à la fin ; seuls la caméra et le mouvement décrit changent.

Chaque clip de cette page se lit et se télécharge sans compte. Lancer votre propre réplique est facturé à la seconde produite — 60 crédits achètent le plancher de quatre secondes en 768P.

Vraie sortie MiniMax H3 · Appuyez sur Essayer pour charger le prompt entier, pas un résumé

Une animatrice de podcast au casque sourit devant un micro de bureau en disant sa réplique, synchronisation labiale MiniMax H38s · 16:9 · 768P

Une photo et une phrase

Ce qui arrive à votre photo

Une seule photo fixe, et la voix qui vient avec

Rien n’est peint sur votre image. La photo devient la première image d’un plan où cette personne parle, et la voix est générée dans la même passe — il n’y a donc aucun fichier audio à préparer.

La photo qui est entrée : une femme à la terrasse d’un café, la tête penchée sur une tasse d’espresso, sans parler

Votre photo

Généré — image et son ensemble

De quatre à quinze secondes entières à 24 images par seconde, en 768P ou 2K, dans onze langues que nous avons testées de bout en bout. JPG, PNG, WEBP, HEIC et HEIF entrent directement, ce qui mérite d’être dit parce que la plupart des photos de personnes sont des photos de téléphone et que la plupart des outils vous font discrètement convertir d’abord. Une photo de téléphone s’anime souvent mieux qu’un portrait retouché — la retouche enlève la texture dont le mouvement a besoin. Des dents, si vous avez le choix : une bouche fermée ne porte aucune information sur ce qu’il y a derrière les lèvres, alors le modèle invente un intérieur, et les intérieurs inventés sont ce qui fait qu’un résultat sonne faux.

Votre photo est l’image 1
001

Votre photo est l’image 1

Toute seconde entière
4 à 15 s

Toute seconde entière

Langues testées de bout en bout
11

Langues testées de bout en bout

Son issu de la même passe
Stéréo

Son issu de la même passe

  • Aucun fichier audio à préparer
  • Aucun calage image par image
  • Aucune passe de synchro labiale séparée

Le clip terminé

À quoi ressemble la synchro labiale IA quand elle est réussie

Ce que vous voyez est ce qui est sorti — aucun agrandissement, aucun étalonnage, aucune seconde passe. Le prompt entier qui l’a produit est imprimé à côté, pas un résumé. Appuyez sur Essayer et il tombe directement dans le champ ci-dessus, à la durée et au format où il a été fait, pour que vous changiez une ligne et voyiez ce qui bouge. Montez le son : ce que vous entendez est sorti de la même passe que la bouche qui le dit.

Plus de prompts détaillés ↗
La femme de la photo ci-dessus, maintenant face caméra, la bouche ouverte au milieu d’un mot, la même table et la même rue derrière elle16:9 · 6s

Le prompt entier, pas un résumé

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6s · 16:9

La photo ci-dessus, et les six secondes qu’elle est devenue

Un passage, un prompt, exactement tel que le modèle l’a rendu

Ce qui peut ouvrir la bouche

Ce n’est pas forcément la photo d’une personne

  • Une femme devant un miroir de coiffeuse éclairé tient une huile à lèvres et parle à la caméra, son visage tenu sur la photo de référence à chaque coupe16:9 · 15s
    Une personnePhotoUne photo de référence tenue sur tous les plans, y compris un gros plan sur la bouche — c’est là qu’une synchro labiale survit à taille réelle, ou pas.
  • Un homme et une femme se disputent dans un salon, caméra à l’épaule, chacun prenant une réplique à son tour16:9 · 15s
    Deux personnes, une image165 caractèresLes deux parlent, en alternance, et le prompt entier tenait en une phrase. Les balises de locuteur servent quand il faut dire qui parle en premier ; ce passage ne les a pas utilisées.
  • Une fillette en chapeau de paille parle à un petit nuage de pluie coiffé d’une couronne de fleurs dans une serre, tous deux dessinés en 2D peint16:9 · 15s
    Un personnage dessinéIllustrationDu 2D peint, et la bouche est dessinée de la même main que le reste de l’image. Rien de photoréaliste nulle part dans le plan.
  • Un chat noir en feutre mou et une souris en robe à pois discutent sur un banc de parc à l’heure dorée16:9 · 15s
    Un personnage animalAnimalUn chat et une souris, une réplique chacun. Les visages ne sont pas humains et les bouches tombent quand même sur les syllabes.

Ces quatre-là sont les passages d’autres personnes, pas les nôtres — c’est pourquoi ils portent la marque Hailuo dans le coin, et pas les clips ailleurs sur cette page. Cette marque est le reçu : chacun a été publié avec son prompt par @SimplyAnnisa, @heydin_ai et @ManuAGI01, et vous pouvez lire chaque mot des quatre à ces adresses.

Ce qui n’est pas ici, parce que nous ne l’avons pas lancé : la photo d’un vrai chien ou d’un vrai chat, et un portrait peint. Ni l’un ni l’autre n’est bloqué et les deux valent l’essai — la même position que cette page tient sur les langues au-delà des onze qu’elle a vérifiées. Nous n’affirmons pas ce que nous n’avons pas vu revenir.

Toute la procédure

Faire parler une photo en trois étapes

L’étape qui décide du résultat est la première, et il faut environ quatre secondes pour la réussir. Les deux premières cartes montrent le champ en haut de cette page en plein travail — le fichier qu’il a pris, la réplique tapée dedans. La troisième est ce qui est revenu.

  1. La ligne d’envoi du champ de cette page avec une photo acceptée : la vignette de la femme à la terrasse du café, le nom de fichier ref-espresso.webp, et une coche verte affichant 1280×724 · 1.77:1 · 62 Ko

    Déposez un visage

    Une photo convient, et deux à quinze secondes de séquence aussi. Un seul visage, tourné vers la caméra, rien en travers de la bouche. Les fichiers HEIC de l’iPhone entrent directement, et le champ vous relit le fichier — taille, forme, poids — avant que vous ayez dépensé quoi que ce soit.

    Un seul visageJPG · PNG · WEBP · HEIC
  2. Le champ de prompt de cette page avec une réplique tapée dedans — (S1) speaks warmly, [English] I have used this every morning for a month — et le compteur affichant 73 / 7000

    Dites ce qu’ils disent

    Tapez la phrase et une balise de langue, et la voix arrive avec — il n’y a aucun fichier audio à préparer. La réplique dans le champ fait soixante-treize caractères sur les 7 000 dont vous disposez ; tout le reste sert à décrire le plan.

    73 caractères sur 7 000Aucune voix à caster
  3. Le clip terminé, son audio déjà dans le fichier
    Piste audio · 32 kHzLIP-SYNC.MP4

    Écoutez, puis changez un mot

    Le clip arrive avec le son déjà dans le fichier. La plupart des gens gardent le deuxième ou le troisième, pas le premier — chaque essai est conservé, vous corrigez donc au lieu de tout recommencer.

    4 à 15s · jusqu’en 2KSon déjà multiplexé

Les deux premières cartes sont des captures du champ en haut de cette page, pas un dessin. La photo que vous envoyez n’est jamais modifiée — ce qui revient est un nouveau fichier. Le clip de la troisième carte est celui de MiniMax, publié avec son prompt dans l’article de lancement de H3 : la photo a fixé le visage, une piste vocale a fixé le chant, un extrait de film a fixé le mouvement de caméra. Ce passage a pris la voie audio ; le champ ci-dessus accepte les deux.

Cas d’usage

À quoi sert la synchro labiale IA

Quatre points de départ. Chacun dépose dans le champ du haut le prompt entier derrière un clip terminé, à la durée et au format où il a été fait.

  • Une animatrice de podcast sourit devant un micro de bureau en disant une réplique, synchronisation labiale MiniMax H3
    16:9 · 8s

    Une réplique face caméra

    Le clip entier tient en une personne et une phrase. Restez sous une douzaine de mots à six secondes — les phrases longues sur des durées courtes sont la raison habituelle d’un premier essai décevant.

  • Deux personnages tiennent un échange tendu dans un intérieur de château sombre, les deux identités tenues sur toute la scène
    9:16 · 9s

    Une réplique de dialogue pour une scène

    Un personnage dit la réplique dans le plan que vous avez déjà en tête. Décrivez la personne autant que les mots — vêtements, cheveux, un trait distinctif — et le visage reste en place sur tout le clip.

  • Une femme devant une boulangerie parle à la caméra du croissant géant qu’elle tient, synchro labiale tenue sur cinq plans
    9:16 · 15s

    Quelqu’un qui parle d’un produit

    Une photo de la personne plus une photo du produit, et les répliques écrites plan par plan. C’est celui qui va jusqu’aux quinze secondes, donc aussi celui qui vous montre où est le plafond.

  • Une femme dans un studio bleu suit un morceau de rap en playback, son visage verrouillé sur la photo de référence
    16:9 · 15s

    Un chant, pas une réplique parlée

    Réglez le ton sur chanté, ou envoyez la voix et laissez-la mener la bouche. La piste envoyée devient la bande-son finale plutôt qu’une référence pour en fabriquer une, et son envoi n’est pas facturé. Gardez le clip au moins aussi long que la piste.

Vous partez d’une vidéo et les pixels d’origine doivent survivre ? C’est du doublage, et un outil qui découpe et recolle le fait mieux que cette page — ici, tout reconstruit le plan au lieu de le retoucher.

Langues

Onze langues, et le format de réplique qui les pilote

Onze que nous avons testées de bout en bout — dans chacune, la bouche est formée à partir des sons propres à cette langue plutôt qu’à partir d’une approximation anglaise. Écrivez la réplique parlée dans sa propre langue et la diction tombe juste ; écrivez-la en anglais avec une balise de langue et elle tombe à côté. Comment s’écrit la réplique donne le format.

Onze vérifiées en synchro labiale

11

  • Arabe
  • Chinois
  • Anglais
  • Français
  • Allemand
  • Italien
  • Japonais
  • Coréen
  • Portugais
  • Russe
  • Espagnol

Pour situer : la documentation de Google pour Veo 3.1 indique que l’anglais est pleinement pris en charge et que les autres langues n’ont pas été évaluées. Besoin du même visage ou de la même voix sur plusieurs clips ? Passez par image de référence.

Le coût d’un passage

Ce que vous pouvez inspecter, ce que coûte un passage, ce que change un forfait

Une chose d’abord : c’est un outil payant. Une synchro labiale sans son n’est pas une synchro labiale, donc cette page fait tourner MiniMax H3 et non le moteur muet qui ne produit que l’image, et il n’y a pas d’essai à vous offrir. Ce que vous pouvez faire sans payer, c’est inspecter le travail : chaque clip ci-dessus se lit et se télécharge sans compte, avec le prompt qui l’a fait. Un passage démarre à 60 crédits — quatre secondes en 768P, la plus courte durée que le modèle produise. Chaque essai est conservé, et c’est le deuxième qui compte, parce que presque personne ne garde le premier clip. Monter d’un forfait achète plus de crédits chaque mois, le 2K sur des clips plus longs sans rationner, et un coût plus bas par seconde terminée.

Comment c’est facturé

Facturé à
la seconde produite
Génération échouée
remboursée
Audio que vous envoyez
non facturé
Clips de cette page
lecture · sans compte

Tous les tarifs.

Mêmes crédits mensuels dans les deux cas

  • GratuitSans CB

    Un clip sans compte, sur le moteur gratuit. MiniMax H3 lui-même est payant.

    $0pour toujours

    Aucune carte bancaire à aucun moment

    Commencer

    Simple vérification anti-robot — pas d’e-mail

    1 clip, sans compte

    Agnes Video V2.0 · 16:9 · 5 s · muet
    Connectez-vous gratuitement — 3 clips par jour sur Agnes, muets

    N’importe quel pack à partir de $9.9 débloque MiniMax H3 — tous les modes, 768P et 2K

    • MiniMax H3 en 2K natifPayant uniquement
    • Audio natif avec l’imagePayant uniquement
    • Un clip, sans compte
    • 1 clip à la fois
    • Les clips échoués ne coûtent rien
    • Génération privée
    • N’importe quel pack débloque MiniMax H3 sur tous les modes

    Le gratuit, c’est un autre moteur. Voir les forfaits

    Vitesse et file d’attente

    File
    Voie gratuite
    Tâches simultanées
    1
    Lot
    1
    Historique gardé
    24 h · 7 jours une fois connecté
    Support
    Communauté
  • Lite−33 %

    Débloquez MiniMax H3 en 2K natif. Le plus petit forfait payant — c’est Pro que la plupart des gens prennent.

    $9.9/mo$14.9

    $118.8 facturés à l’année · $60 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    1 290 crédits / mois · ~55 vidéos

    4 s · 768P · de texte à vidéo

    ou ~29 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • MiniMax H3 en 2K natif — avec l’audio natif
    • Dialogues, effets et musique dans le même fichier
    • Jusqu’à 15 secondes15 s
    • ~55 vidéos par mois en 4 s 768P, de texte à vidéo
    • Les clips échoués ne coûtent rien
    • Remboursé sous 7 jours si crédits non utilisés
    • 1 tâche à la fois
    • 2 variantes d’un même prompt en lot

    Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax

    Vitesse et file d’attente

    File
    Standard
    Tâches simultanées
    1
    Lot
    2
    Historique gardé
    7 jours
    Support
    E-mail · 48 h
  • Recommandé pour la plupart
    Pro−33 %

    $30 de plus que Lite. ~166 vidéos par mois, le même MiniMax H3, file d’attente plus rapide.

    $29.9/mo$44.9

    $358.8 facturés à l’année · $180 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    4 990 crédits / mois · ~166 vidéos

    4 s · 768P · de texte à vidéo

    ou ~88 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • Tout le forfait Lite
    • ~166 vidéos par mois en 4 s 768P, de texte à vidéo
    • 3 tâches simultanées
    • Extraire le prompt
    • 4 variantes d’un même prompt en lot
    • Historique gardé 7 jours
    • Remboursé sous 7 jours si crédits non utilisés

    Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax

    Vitesse et file d’attente

    File
    Rapide
    Tâches simultanées
    3
    Lot
    4
    Historique gardé
    7 jours
    Support
    E-mail · 12 h
  • Studio−33 %

    Un mois entier de volume, la priorité dans la file, et un humain qui répond en 4 heures.

    $99.9/mo$149.9

    $1 198.8 facturés à l’année · $1 200 économisés par an

    Remboursement sous 7 jours · annulable à tout moment

    12 990 crédits / mois · ~555 vidéos

    4 s · 768P · de texte à vidéo

    ou ~294 en 4 s 2K

    Mêmes crédits en mensuel ou en annuel

    • Tout le forfait Pro
    • ~555 vidéos par mois en 4 s 768P, de texte à vidéo
    • 8 tâches simultanées
    • 4 variantes d’un même prompt en lot
    • Historique gardé 7 jours
    • Support prioritaire en 4 heures
    • Le coût en crédits le plus bas
    • Remboursé sous 7 jours si crédits non utilisés

    Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax

    Vitesse et file d’attente

    File
    Prioritaire — en tête de file
    Tâches simultanées
    8
    Lot
    4
    Historique gardé
    7 jours
    Support
    Prioritaire · 4 h

Comment c’est fait

Pourquoi la bouche tient à pleine résolution

Tous les autres outils de synchro labiale cherchent la bouche dans votre image et la remplacent. Celui-ci ne la cherche jamais — et cette seule différence est toute la raison pour laquelle la bouche ne se lit pas comme une rustine.

  • L’indice

    Une bouche qui ne colle pas à la peau

    Une rustine à une résolution différente du visage autour, et une ligne le long de la mâchoire qui grouille dès que la tête tourne. Une fois que vous l’avez vue vous ne voyez plus qu’elle — et ce n’a jamais été la faute de votre photo.

  • La cause

    Un carré de 96 pixels, recollé

    La méthode habituelle trouve la bouche, découpe un petit carré autour — souvent 96 sur 96 — génère de nouvelles formes de bouche à cette taille et les colle sur votre image. Tout ce qui est hors du carré n’est jamais passé par le modèle.

  • Repérer avant

    Lisez le verbe qu’un outil emploie sur lui-même

    Applique des formes de bouche sur le visage de votre vidéo. Les fond dans l’image d’origine. Sur, dans — dans les deux cas quelque chose est posé par-dessus un visage déjà là, et la ligne de mâchoire est l’endroit où ça s’arrête.

  • Ce qui se passe ici

    Une nouvelle image, son compris, en une passe

    MiniMax H3 ne trouve jamais votre bouche, parce qu’il ne retouche pas votre image. Pas de découpe, pas de collage, aucun bord à suivre : la bouche porte la résolution des joues parce qu’il n’y a qu’une seule résolution dans l’image. La voix sort de cette même passe, vous n’obtenez donc jamais une bande-son excitée par-dessus un visage éteint.

Le compromis, avant d’envoyer

Votre séquence d’origine ne survit pas. Vous obtenez un nouveau clip construit à partir d’elle, pas votre clip avec une nouvelle bouche. S’il vous faut récupérer vos propres pixels — un cours de quarante minutes qui a besoin d’une bande-son espagnole, par exemple — l’outil qui découpe et recolle vous servira mieux que cette page.

La réplique

Ce que décide la réplique et que la photo ne peut pas

La photo décide si ça marche tout court. La réplique décide ce que vous obtenez, combien de temps ça dure et ce que ça coûte — et ces trois-là sont la même décision.

  1. 01La durée est un budget

    La sortie est un nombre entier de secondes, de 4 à 15. À un débit de parole ordinaire, cela fait à peu près dix à quarante mots. Écrivez la réplique d’abord, comptez-la, puis choisissez la durée — l’ordre inverse est la façon d’obtenir une diction qui court après une horloge qu’elle ne rattrapera pas.

    4 à 15 s, secondes entières

  2. 02Une seule balise porte le poids

    [Language] choisit le jeu de phonèmes d’après lequel la bouche est formée : c’est donc la balise qui change l’image. (S1) ne gagne sa place que lorsque le cadrage contient plus d’un locuteur possible — face à un seul visage, elle ne change rien de visible.

    (S1) … [French] …

  3. 03Le plafond de caractères n’est pas pour la réplique

    7 000 caractères couvrent le prompt entier. Une réplique parlée fait quelques dizaines de caractères ; tout le reste, c’est le plan — qui, où, éclairé comment, cadré comment. Manquer de place est un problème de description, jamais de dialogue.

    7 000 caractères

  4. 04Les secondes sont la facture

    $0.08 par seconde produite en 768P, $0.13 en 2K. La réplique fixe la durée et la durée fixe la facture, une prise de quinze secondes coûte donc près de quatre fois une prise de quatre secondes. La plupart des répliques qui valent d’être entendues sont courtes.

    $0.08 / s · 768P

Rien de tout cela n’est une supposition sur le modèle — les durées et le plafond de caractères sont les limites publiées, et les prix à la seconde sont ceux des tarifs. Vous voulez que le plan soit décrit à votre place ? Le générateur de prompts écrit les 6 900 caractères restants.

Usage responsable

Quel visage vous pouvez utiliser

Le vôtre, un pour lequel vous avez l’autorisation, ou un qui n’appartient à personne parce que vous l’avez généré.

  • VisagesFaire dire à une personne réelle quelque chose qu’elle n’a pas dit est interdit par la licence H3 — ni personnalités publiques, ni photo d’un inconnu.
  • VoixUne piste envoyée qui clone la voix d’une personne précise doit être la vôtre, sous licence, ou synthétique.
  • SignalementLe lien de signalement est sur chaque page et sur chaque résultat. Les comptes qui récidivent sont fermés.
  • MineursN’envoyez jamais une photo ou un clip représentant un mineur.
  • Vos envoisIls ne servent à entraîner quoi que ce soit. Vous pouvez les supprimer, et supprimer votre compte, à tout moment.
  • Droits commerciauxUsage personnel et évaluation sur chaque forfait, payants compris. Les droits commerciaux viennent de MiniMax directement, via Hailuo ou l’API officielle. Un résumé, pas un avis juridique.

Politique complète : usage responsable

Les questions vraiment posées

FAQ synchronisation labiale IA

À savoir avant de lancer votre première réplique

Cet outil de synchronisation labiale IA est-il gratuit ?

Non — en lancer une est payant. Une synchro labiale sans son n’est pas une synchro labiale, donc cette page fait tourner MiniMax H3 et non le moteur muet qui ne produit que l’image, et un passage démarre à 60 crédits : quatre secondes en 768P. Ce qui ne demande aucun compte, c’est la preuve — chaque clip terminé ici, et le prompt entier derrière lui, se lit et se télécharge tel quel.

Comment tester sans dépenser beaucoup ?

Lancez quatre secondes d’abord. La facturation se fait à la seconde produite, la prise la plus courte est donc le regard le moins cher sur la question de savoir si le visage tient et si la bouche tombe juste — 60 crédits contre 225 pour quinze secondes pleines. Réglez la photo et la réplique à quatre secondes, puis choisissez la durée que vous voulez vraiment.

Ai-je besoin d’un fichier audio ?

Non, et c’est la principale différence avec la plupart des outils de cette catégorie. Tapez la réplique, choisissez une langue, et la voix est générée avec la bouche. Si vous avez déjà un enregistrement ou une chanson, envoyez-le et il devient la bande-son finale à la place.

Le clip arrive-t-il avec le son ?

Oui — stéréo 32 kHz, fait dans la même passe que l’image, à l’intérieur d’un seul MP4. Il n’y a pas d’étape audio séparée ni rien à multiplexer.

Puis-je synchroniser une vidéo que j’ai déjà ?

Oui, avec une chose comprise d’abord : H3 régénère le plan au lieu de repeindre la bouche sur vos images. Votre séquence guide le résultat ; elle n’y survit pas. Cette page a donc raison quand vous voulez une nouvelle prise de la même idée, et tort quand ce sont les pixels d’origine qui comptent — un cours de quarante minutes qui a besoin d’une bande-son espagnole, la séquence d’un client que personne n’a le droit de redessiner. Pour ces cas-là, un outil de doublage qui découpe et recolle vous servira mieux que nous.

Quelle longueur le clip peut-il faire ?

N’importe quel nombre entier de secondes de 4 à 15, à 24 images par seconde. Quinze est un plafond du modèle, pas une limite de forfait — aucun palier ne le relève.

Quelles langues fonctionnent ?

Onze vérifiées : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. Les autres fonctionnent généralement et ne sont pas bloquées ; nous ne les avons simplement pas lancées, donc nous ne les affirmons pas.

Pourquoi la bouche était-elle floue dans l’outil que j’utilisais avant ?

Presque certainement parce qu’il découpe une petite zone autour de la bouche, génère à cette taille, et la recolle. Sur une image en 1080p, cette rustine est la seule partie passée par un goulot basse résolution, elle paraît donc molle à côté des joues. Rien dans votre photo n’en est la cause.

Est-ce que ça ressemblera encore à la personne de ma photo ?

Ça tient quand le prompt la décrit autant qu’il décrit ce qu’elle dit, et ça dérive quand il ne décrit que la parole. Les sources de face tiennent nettement mieux. Même règle et même correctif que pour animer une photo, et le verrou d’apparence écrit la phrase à votre place.

Quelle photo utiliser ?

Un seul visage, de face, lumière régulière, rien en travers de la bouche, et des dents visibles si vous avez le choix. Une photo de téléphone bat généralement un portrait retouché — la retouche enlève la texture dont le mouvement a besoin.

Et si mon audio est plus long que le clip ?

Il est coupé à la durée du clip ; il n’est ni compressé ni accéléré. Réglez la durée au moins sur la longueur de votre piste — le champ compare les deux et propose de corriger.

Peut-il chanter au lieu de parler ?

Oui. Réglez le ton sur chanté, ou envoyez la voix et laissez-la mener la bouche. Même plafond de quinze secondes.

Puis-je obtenir du 2K ?

Oui. Le 2K régénère à partir du contexte d’origine au lieu d’agrandir des pixels, le détail de la bouche survit donc à l’étape au lieu d’être interpolé.

Ai-je besoin d’un compte ?

Pas pour lire ou télécharger quoi que ce soit sur cette page. Oui pour lancer le vôtre, et des crédits avec, parce que cette page fait tourner MiniMax H3 en payant. Vos essais sont conservés, le deuxième est donc une correction plutôt qu’un nouvel envoi.

Mon résultat porte-t-il un filigrane ?

Il n’y en a pas. Ce que vous téléchargez est ce que le modèle a produit.

Que se passe-t-il après avoir appuyé sur Générer ?

Cela part au modèle et revient en MP4 terminé dans votre historique, le son déjà dans le fichier. Vous n’avez pas à rester sur la page — un passage dont votre navigateur n’est jamais revenu se termine côté serveur, et tout ce que le fournisseur perd est marqué en échec avec les crédits rendus automatiquement.

Puis-je utiliser les clips commercialement ?

Usage personnel et évaluation, sur chaque forfait. Les conditions commerciales viennent de MiniMax directement, via Hailuo ou l’API officielle. Un résumé, pas un avis juridique.

Quels formats et quelles tailles de photo fonctionnent ?

JPG, JPEG, PNG, WEBP, HEIC et HEIF, jusqu’à 30 Mo par fichier, entre 256 et 5 760 pixels de côté avec un rapport d’image situé entre 2:5 et 5:2. HEIC et HEIF entrent directement, une photo prise sur un iPhone n’a donc besoin d’aucune conversion préalable. Ce sont les limites publiées, et la boîte d’envoi vérifie votre fichier avant que vous dépensiez quoi que ce soit.

Peut-il y avoir plus d’une personne sur la photo ?

Oui, et une seule réplique suffit. Avec deux visages à l’image, le modèle choisit un locuteur si vous n’en nommez pas un, alors balisez-les : (S1) asks, [French] Tu l’as envoyé ? (S2) replies firmly, [French] Il y a deux heures. Face à un seul visage, la balise ne change rien de visible, et c’est pourquoi elle ne vaut la peine d’être connue qu’au moment où vous en avez besoin.

Quelle longueur la réplique peut-elle faire ?

7 000 caractères couvrent le prompt entier, et une réplique parlée fait quelques dizaines de caractères — tout le reste, c’est le plan. Le vrai plafond, c’est l’horloge : quatre à quinze secondes font à peu près dix à quarante mots à un débit de parole ordinaire. Écrivez la réplique, comptez-la, puis choisissez la durée. Manquer de place est un problème de description, jamais de dialogue.

Une photo et une phrase.

C’est toute l’entrée — et tout ce qui précède se lit que vous soyez connecté ou non.

Générer gratuitement · file d’attente

Rédigé et tenu à jour par l’équipe éditoriale de MiniMax H3 AI Video GeneratorPublié le Mis à jour le