Synchronisation labiale IA
Déposez une photo, tapez ce qu’elle doit dire, et récupérez une vidéo qui parle — la voix vient avec, il n’y a donc aucun fichier audio à préparer. De quatre à quinze secondes, jusqu’en 2K, dans onze langues.
Vraie sortie MiniMax H3 · Appuyez sur Essayer pour charger le prompt entier, pas un résumé
8s · 16:9 · 768PUne photo et une phrase
Une seule photo fixe,
et la voix qui vient avec
Rien n’est peint sur votre image. La photo devient la première image d’un plan où cette personne parle, et la voix est générée dans la même passe — il n’y a donc aucun fichier audio à préparer.

Votre photo
Généré — image et son ensemble
De quatre à quinze secondes entières à 24 images par seconde, en 768P ou 2K, dans onze langues que nous avons testées de bout en bout. JPG, PNG, WEBP, HEIC et HEIF entrent directement, ce qui mérite d’être dit parce que la plupart des photos de personnes sont des photos de téléphone et que la plupart des outils vous font discrètement convertir d’abord. Une photo de téléphone s’anime souvent mieux qu’un portrait retouché — la retouche enlève la texture dont le mouvement a besoin. Des dents, si vous avez le choix : une bouche fermée ne porte aucune information sur ce qu’il y a derrière les lèvres, alors le modèle invente un intérieur, et les intérieurs inventés sont ce qui fait qu’un résultat sonne faux.
- Votre photo est l’image 1
- 001
- Toute seconde entière
- 4 à 15 s
- Langues testées de bout en bout
- 11
- Son issu de la même passe
- Stéréo
Votre photo est l’image 1
Toute seconde entière
Langues testées de bout en bout
Son issu de la même passe
- Aucun fichier audio à préparer
- Aucun calage image par image
- Aucune passe de synchro labiale séparée
À quoi ressemble la synchro labiale IA quand elle est réussie
Ce que vous voyez est ce qui est sorti — aucun agrandissement, aucun étalonnage, aucune seconde passe. Le prompt entier qui l’a produit est imprimé à côté, pas un résumé. Appuyez sur Essayer et il tombe directement dans le champ ci-dessus, à la durée et au format où il a été fait, pour que vous changiez une ligne et voyiez ce qui bouge. Montez le son : ce que vous entendez est sorti de la même passe que la bouche qui le dit.
Plus de prompts détaillés ↗
16:9 · 6sLe prompt entier, pas un résumé
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
La photo ci-dessus, et les six secondes qu’elle est devenue
Un passage, un prompt, exactement tel que le modèle l’a rendu
Ce n’est pas forcément
la photo d’une personne
16:9 · 15sUne personnePhotoUne photo de référence tenue sur tous les plans, y compris un gros plan sur la bouche — c’est là qu’une synchro labiale survit à taille réelle, ou pas.
16:9 · 15sDeux personnes, une image165 caractèresLes deux parlent, en alternance, et le prompt entier tenait en une phrase. Les balises de locuteur servent quand il faut dire qui parle en premier ; ce passage ne les a pas utilisées.
16:9 · 15sUn personnage dessinéIllustrationDu 2D peint, et la bouche est dessinée de la même main que le reste de l’image. Rien de photoréaliste nulle part dans le plan.
16:9 · 15sUn personnage animalAnimalUn chat et une souris, une réplique chacun. Les visages ne sont pas humains et les bouches tombent quand même sur les syllabes.
Ces quatre-là sont les passages d’autres personnes, pas les nôtres — c’est pourquoi ils portent la marque Hailuo dans le coin, et pas les clips ailleurs sur cette page. Cette marque est le reçu : chacun a été publié avec son prompt par @SimplyAnnisa, @heydin_ai et @ManuAGI01, et vous pouvez lire chaque mot des quatre à ces adresses.
Ce qui n’est pas ici, parce que nous ne l’avons pas lancé : la photo d’un vrai chien ou d’un vrai chat, et un portrait peint. Ni l’un ni l’autre n’est bloqué et les deux valent l’essai — la même position que cette page tient sur les langues au-delà des onze qu’elle a vérifiées. Nous n’affirmons pas ce que nous n’avons pas vu revenir.
Faire parler une photo en trois étapes
L’étape qui décide du résultat est la première, et il faut environ quatre secondes pour la réussir. Les deux premières cartes montrent le champ en haut de cette page en plein travail — le fichier qu’il a pris, la réplique tapée dedans. La troisième est ce qui est revenu.

Déposez un visage
Une photo convient, et deux à quinze secondes de séquence aussi. Un seul visage, tourné vers la caméra, rien en travers de la bouche. Les fichiers HEIC de l’iPhone entrent directement, et le champ vous relit le fichier — taille, forme, poids — avant que vous ayez dépensé quoi que ce soit.
Un seul visageJPG · PNG · WEBP · HEIC![Le champ de prompt de cette page avec une réplique tapée dedans — (S1) speaks warmly, [English] I have used this every morning for a month — et le compteur affichant 73 / 7000](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
Dites ce qu’ils disent
Tapez la phrase et une balise de langue, et la voix arrive avec — il n’y a aucun fichier audio à préparer. La réplique dans le champ fait soixante-treize caractères sur les 7 000 dont vous disposez ; tout le reste sert à décrire le plan.
73 caractères sur 7 000Aucune voix à caster
Piste audio · 32 kHzLIP-SYNC.MP4Écoutez, puis changez un mot
Le clip arrive avec le son déjà dans le fichier. La plupart des gens gardent le deuxième ou le troisième, pas le premier — chaque essai est conservé, vous corrigez donc au lieu de tout recommencer.
4 à 15s · jusqu’en 2KSon déjà multiplexé
Les deux premières cartes sont des captures du champ en haut de cette page, pas un dessin. La photo que vous envoyez n’est jamais modifiée — ce qui revient est un nouveau fichier. Le clip de la troisième carte est celui de MiniMax, publié avec son prompt dans l’article de lancement de H3 : la photo a fixé le visage, une piste vocale a fixé le chant, un extrait de film a fixé le mouvement de caméra. Ce passage a pris la voie audio ; le champ ci-dessus accepte les deux.
À quoi sert la synchro labiale IA
Quatre points de départ. Chacun dépose dans le champ du haut le prompt entier derrière un clip terminé, à la durée et au format où il a été fait.
16:9 · 8sUne réplique face caméra
Le clip entier tient en une personne et une phrase. Restez sous une douzaine de mots à six secondes — les phrases longues sur des durées courtes sont la raison habituelle d’un premier essai décevant.
9:16 · 9sUne réplique de dialogue pour une scène
Un personnage dit la réplique dans le plan que vous avez déjà en tête. Décrivez la personne autant que les mots — vêtements, cheveux, un trait distinctif — et le visage reste en place sur tout le clip.
9:16 · 15sQuelqu’un qui parle d’un produit
Une photo de la personne plus une photo du produit, et les répliques écrites plan par plan. C’est celui qui va jusqu’aux quinze secondes, donc aussi celui qui vous montre où est le plafond.
16:9 · 15sUn chant, pas une réplique parlée
Réglez le ton sur chanté, ou envoyez la voix et laissez-la mener la bouche. La piste envoyée devient la bande-son finale plutôt qu’une référence pour en fabriquer une, et son envoi n’est pas facturé. Gardez le clip au moins aussi long que la piste.
Vous partez d’une vidéo et les pixels d’origine doivent survivre ? C’est du doublage, et un outil qui découpe et recolle le fait mieux que cette page — ici, tout reconstruit le plan au lieu de le retoucher.
Onze langues, et le format de réplique qui les pilote
Onze que nous avons testées de bout en bout — dans chacune, la bouche est formée à partir des sons propres à cette langue plutôt qu’à partir d’une approximation anglaise. Écrivez la réplique parlée dans sa propre langue et la diction tombe juste ; écrivez-la en anglais avec une balise de langue et elle tombe à côté. Comment s’écrit la réplique donne le format.
Onze vérifiées en synchro labiale
11
- Arabe
- Chinois
- Anglais
- Français
- Allemand
- Italien
- Japonais
- Coréen
- Portugais
- Russe
- Espagnol
Pour situer : la documentation de Google pour Veo 3.1 indique que l’anglais est pleinement pris en charge et que les autres langues n’ont pas été évaluées. Besoin du même visage ou de la même voix sur plusieurs clips ? Passez par image de référence.
Ce que vous pouvez inspecter, ce que coûte un passage, ce que change un forfait
Une chose d’abord : c’est un outil payant. Une synchro labiale sans son n’est pas une synchro labiale, donc cette page fait tourner MiniMax H3 et non le moteur muet qui ne produit que l’image, et il n’y a pas d’essai à vous offrir. Ce que vous pouvez faire sans payer, c’est inspecter le travail : chaque clip ci-dessus se lit et se télécharge sans compte, avec le prompt qui l’a fait. Un passage démarre à 60 crédits — quatre secondes en 768P, la plus courte durée que le modèle produise. Chaque essai est conservé, et c’est le deuxième qui compte, parce que presque personne ne garde le premier clip. Monter d’un forfait achète plus de crédits chaque mois, le 2K sur des clips plus longs sans rationner, et un coût plus bas par seconde terminée.
Comment c’est facturé
- Facturé à
- la seconde produite
- Génération échouée
- remboursée
- Audio que vous envoyez
- non facturé
- Clips de cette page
- lecture · sans compte
Mêmes crédits mensuels dans les deux cas
- GratuitSans CB
Un clip sans compte, sur le moteur gratuit. MiniMax H3 lui-même est payant.
$0pour toujoursAucune carte bancaire à aucun moment
CommencerSimple vérification anti-robot — pas d’e-mail
1 clip, sans compte
Agnes Video V2.0 · 16:9 · 5 s · muet
Connectez-vous gratuitement — 3 clips par jour sur Agnes, muetsN’importe quel pack à partir de $9.9 débloque MiniMax H3 — tous les modes, 768P et 2K
- MiniMax H3 en 2K natifPayant uniquement
- Audio natif avec l’imagePayant uniquement
- Un clip, sans compte
- 1 clip à la fois
- Les clips échoués ne coûtent rien
- Génération privée
- N’importe quel pack débloque MiniMax H3 sur tous les modes
Le gratuit, c’est un autre moteur. Voir les forfaits
Vitesse et file d’attente
- File
- Voie gratuite
- Tâches simultanées
- 1
- Lot
- 1
- Historique gardé
- 24 h · 7 jours une fois connecté
- Support
- Communauté
- Lite−33 %
Débloquez MiniMax H3 en 2K natif. Le plus petit forfait payant — c’est Pro que la plupart des gens prennent.
$9.9/mo$14.9$118.8 facturés à l’année · $60 économisés par an
Remboursement sous 7 jours · annulable à tout moment
1 290 crédits / mois · ~55 vidéos
4 s · 768P · de texte à vidéo
ou ~29 en 4 s 2K
Mêmes crédits en mensuel ou en annuel
- MiniMax H3 en 2K natif — avec l’audio natif
- Dialogues, effets et musique dans le même fichier
- Jusqu’à 15 secondes15 s
- ~55 vidéos par mois en 4 s 768P, de texte à vidéo
- Les clips échoués ne coûtent rien
- Remboursé sous 7 jours si crédits non utilisés
- 1 tâche à la fois
- 2 variantes d’un même prompt en lot
Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax
Vitesse et file d’attente
- File
- Standard
- Tâches simultanées
- 1
- Lot
- 2
- Historique gardé
- 7 jours
- Support
- E-mail · 48 h
- Recommandé pour la plupartPro−33 %
$30 de plus que Lite. ~166 vidéos par mois, le même MiniMax H3, file d’attente plus rapide.
$29.9/mo$44.9$358.8 facturés à l’année · $180 économisés par an
Remboursement sous 7 jours · annulable à tout moment
4 990 crédits / mois · ~166 vidéos
4 s · 768P · de texte à vidéo
ou ~88 en 4 s 2K
Mêmes crédits en mensuel ou en annuel
- Tout le forfait Lite
- ~166 vidéos par mois en 4 s 768P, de texte à vidéo
- 3 tâches simultanées3×
- Extraire le prompt
- 4 variantes d’un même prompt en lot
- Historique gardé 7 jours
- Remboursé sous 7 jours si crédits non utilisés
Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax
Vitesse et file d’attente
- File
- Rapide
- Tâches simultanées
- 3
- Lot
- 4
- Historique gardé
- 7 jours
- Support
- E-mail · 12 h
- Studio−33 %
Un mois entier de volume, la priorité dans la file, et un humain qui répond en 4 heures.
$99.9/mo$149.9$1 198.8 facturés à l’année · $1 200 économisés par an
Remboursement sous 7 jours · annulable à tout moment
12 990 crédits / mois · ~555 vidéos
4 s · 768P · de texte à vidéo
ou ~294 en 4 s 2K
Mêmes crédits en mensuel ou en annuel
- Tout le forfait Pro
- ~555 vidéos par mois en 4 s 768P, de texte à vidéo
- 8 tâches simultanées8×
- 4 variantes d’un même prompt en lot
- Historique gardé 7 jours
- Support prioritaire en 4 heures
- Le coût en crédits le plus bas
- Remboursé sous 7 jours si crédits non utilisés
Utilisation personnelle et d’évaluation — les droits commerciaux viennent de MiniMax
Vitesse et file d’attente
- File
- Prioritaire — en tête de file
- Tâches simultanées
- 8
- Lot
- 4
- Historique gardé
- 7 jours
- Support
- Prioritaire · 4 h
Pourquoi la bouche tient
à pleine résolution
Tous les autres outils de synchro labiale cherchent la bouche dans votre image et la remplacent. Celui-ci ne la cherche jamais — et cette seule différence est toute la raison pour laquelle la bouche ne se lit pas comme une rustine.
Une bouche qui ne colle pas à la peau
Une rustine à une résolution différente du visage autour, et une ligne le long de la mâchoire qui grouille dès que la tête tourne. Une fois que vous l’avez vue vous ne voyez plus qu’elle — et ce n’a jamais été la faute de votre photo.
Un carré de 96 pixels, recollé
La méthode habituelle trouve la bouche, découpe un petit carré autour — souvent 96 sur 96 — génère de nouvelles formes de bouche à cette taille et les colle sur votre image. Tout ce qui est hors du carré n’est jamais passé par le modèle.
Lisez le verbe qu’un outil emploie sur lui-même
Applique des formes de bouche sur le visage de votre vidéo. Les fond dans l’image d’origine. Sur, dans — dans les deux cas quelque chose est posé par-dessus un visage déjà là, et la ligne de mâchoire est l’endroit où ça s’arrête.
Une nouvelle image, son compris, en une passe
MiniMax H3 ne trouve jamais votre bouche, parce qu’il ne retouche pas votre image. Pas de découpe, pas de collage, aucun bord à suivre : la bouche porte la résolution des joues parce qu’il n’y a qu’une seule résolution dans l’image. La voix sort de cette même passe, vous n’obtenez donc jamais une bande-son excitée par-dessus un visage éteint.
Votre séquence d’origine ne survit pas. Vous obtenez un nouveau clip construit à partir d’elle, pas votre clip avec une nouvelle bouche. S’il vous faut récupérer vos propres pixels — un cours de quarante minutes qui a besoin d’une bande-son espagnole, par exemple — l’outil qui découpe et recolle vous servira mieux que cette page.
Ce que décide la réplique
et que la photo ne peut pas
La photo décide si ça marche tout court. La réplique décide ce que vous obtenez, combien de temps ça dure et ce que ça coûte — et ces trois-là sont la même décision.
La durée est un budget
La sortie est un nombre entier de secondes, de 4 à 15. À un débit de parole ordinaire, cela fait à peu près dix à quarante mots. Écrivez la réplique d’abord, comptez-la, puis choisissez la durée — l’ordre inverse est la façon d’obtenir une diction qui court après une horloge qu’elle ne rattrapera pas.
4 à 15 s, secondes entières
Une seule balise porte le poids
[Language] choisit le jeu de phonèmes d’après lequel la bouche est formée : c’est donc la balise qui change l’image. (S1) ne gagne sa place que lorsque le cadrage contient plus d’un locuteur possible — face à un seul visage, elle ne change rien de visible.
(S1) … [French] …
Le plafond de caractères n’est pas pour la réplique
7 000 caractères couvrent le prompt entier. Une réplique parlée fait quelques dizaines de caractères ; tout le reste, c’est le plan — qui, où, éclairé comment, cadré comment. Manquer de place est un problème de description, jamais de dialogue.
7 000 caractères
Les secondes sont la facture
$0.08 par seconde produite en 768P, $0.13 en 2K. La réplique fixe la durée et la durée fixe la facture, une prise de quinze secondes coûte donc près de quatre fois une prise de quatre secondes. La plupart des répliques qui valent d’être entendues sont courtes.
$0.08 / s · 768P
Rien de tout cela n’est une supposition sur le modèle — les durées et le plafond de caractères sont les limites publiées, et les prix à la seconde sont ceux des tarifs. Vous voulez que le plan soit décrit à votre place ? Le générateur de prompts écrit les 6 900 caractères restants.
Quel visage vous pouvez utiliser
Le vôtre, un pour lequel vous avez l’autorisation, ou un qui n’appartient à personne parce que vous l’avez généré.
- VisagesFaire dire à une personne réelle quelque chose qu’elle n’a pas dit est interdit par la licence H3 — ni personnalités publiques, ni photo d’un inconnu.
- VoixUne piste envoyée qui clone la voix d’une personne précise doit être la vôtre, sous licence, ou synthétique.
- SignalementLe lien de signalement est sur chaque page et sur chaque résultat. Les comptes qui récidivent sont fermés.
- MineursN’envoyez jamais une photo ou un clip représentant un mineur.
- Vos envoisIls ne servent à entraîner quoi que ce soit. Vous pouvez les supprimer, et supprimer votre compte, à tout moment.
- Droits commerciauxUsage personnel et évaluation sur chaque forfait, payants compris. Les droits commerciaux viennent de MiniMax directement, via Hailuo ou l’API officielle. Un résumé, pas un avis juridique.
FAQ synchronisation labiale IA
À savoir avant de lancer votre première réplique
Cet outil de synchronisation labiale IA est-il gratuit ?
Comment tester sans dépenser beaucoup ?
Ai-je besoin d’un fichier audio ?
Le clip arrive-t-il avec le son ?
Puis-je synchroniser une vidéo que j’ai déjà ?
Quelle longueur le clip peut-il faire ?
Quelles langues fonctionnent ?
Pourquoi la bouche était-elle floue dans l’outil que j’utilisais avant ?
Est-ce que ça ressemblera encore à la personne de ma photo ?
Quelle photo utiliser ?
Et si mon audio est plus long que le clip ?
Peut-il chanter au lieu de parler ?
Puis-je obtenir du 2K ?
Ai-je besoin d’un compte ?
Mon résultat porte-t-il un filigrane ?
Que se passe-t-il après avoir appuyé sur Générer ?
Puis-je utiliser les clips commercialement ?
Quels formats et quelles tailles de photo fonctionnent ?
Peut-il y avoir plus d’une personne sur la photo ?
Quelle longueur la réplique peut-elle faire ?
Une photo et une phrase.
C’est toute l’entrée — et tout ce qui précède se lit que vous soyez connecté ou non.
Générer gratuitement · file d’attenteRédigé et tenu à jour par l’équipe éditoriale de MiniMax H3 AI Video GeneratorPublié le Mis à jour le
