KI-Lippensynchronisation
Foto rein, eintippen was gesagt werden soll, sprechendes Video zurück — die Stimme kommt mit, du musst also keine Audiodatei vorher bauen. Vier bis fünfzehn Sekunden, bis 2K, in elf Sprachen.
Echte MiniMax-H3-Ausgabe · Klick auf „Diese Lippensynchronisation testen“ lädt den vollständigen Prompt, keine Zusammenfassung
8s · 16:9 · 768PEin Foto und ein Satz
Ein einzelnes Foto,
und die KI-Lippensynchronisation, die dazukommt
Auf dein Bild wird nichts aufgemalt. Das Foto wird zum ersten Frame einer Einstellung, in der diese Person spricht, und die Stimme entsteht im selben Durchgang — du musst also keine Audiodatei vorher bauen.

Dein Foto
Generiert — Bild und Ton zusammen
Vier bis fünfzehn ganze Sekunden bei 24 fps, 768P oder 2K, in elf Sprachen, die wir End-to-End gefahren haben. JPG, PNG, WEBP, HEIC und HEIF gehen direkt hinein, was erwähnenswert ist, weil die meisten Fotos von Menschen Handyfotos sind und die meisten Tools dich stillschweigend zuerst konvertieren lassen. Ein Handyschnappschuss animiert oft besser als ein poliertes Bewerbungsfoto — Retusche nimmt genau die Textur weg, die Bewegung braucht. Zähne, wenn du die Wahl hast: ein geschlossener Mund enthält keine Information darüber, was hinter den Lippen liegt, also erfindet das Modell ein Inneres, und erfundene Innenräume sind es, die ein Ergebnis falsch wirken lassen.
- Dein Foto ist Frame eins
- 001
- Jede ganze Sekunde
- 4–15 s
- Sprachen End-to-End geprüft
- 11
- Ton aus demselben Durchgang
- Stereo
Dein Foto ist Frame eins
Jede ganze Sekunde
Sprachen End-to-End geprüft
Ton aus demselben Durchgang
- Keine Audiodatei vorher bauen
- Kein Timing Frame für Frame
- Kein separater Lip-Sync-Durchgang
Wie KI-Lippensynchronisation aussieht, wenn sie richtig herauskommt
Was du siehst, ist das, was herauskam — kein Hochskalieren, kein Grading, kein zweiter Durchgang. Der ganze Prompt, der es erzeugt hat, steht daneben, keine Zusammenfassung. Klick auf „Diese Lippensynchronisation testen“ und er landet direkt im Feld oben, in der Länge und im Format, in dem er gemacht wurde, damit du eine Zeile ändern und sehen kannst, was sich bewegt. Mach den Ton an: was du hörst, kam aus demselben Durchgang wie der Mund, der es sagt.
Mehr Lip-Sync-Prompts ↗
16:9 · 6sDer vollständige Prompt, keine Zusammenfassung
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
Das Foto oben, und die sechs Sekunden, die daraus wurden
Ein Lauf, ein Prompt, genau so, wie das Modell ihn zurückgegeben hat
Lippensynchronisation braucht nicht
das Foto eines Menschen
16:9 · 15sEine PersonFotoEin Referenzfoto, das über jede Einstellung hinweg gehalten wird, auch durch eine Nahaufnahme des Mundes — und genau dort übersteht eine Lippensynchronisation die volle Größe oder eben nicht.
16:9 · 15sZwei Personen, ein Bild165 ZeichenBeide sprechen, abwechselnd, und der ganze Prompt war einen Satz lang. Sprecher-Tags gibt es, wenn du sagen musst, wer zuerst spricht; dieser Lauf hat sie nicht benutzt.
16:9 · 15sEine gezeichnete FigurIllustrationMalerisches 2D, und der Mund ist in derselben Handschrift gezeichnet wie der Rest des Bildes. Nichts Fotorealistisches irgendwo in der Einstellung.
16:9 · 15sEine TierfigurTierEine Katze und eine Maus, jede mit einem Satz. Die Gesichter sind nicht menschlich, und die Münder treffen die Silben trotzdem.
Diese vier sind Läufe anderer Leute, nicht unsere — deshalb tragen sie das Hailuo-Zeichen in der Ecke und die übrigen Clips auf dieser Seite nicht. Dieses Zeichen ist der Beleg: jeder wurde samt Prompt von @SimplyAnnisa, @heydin_ai und @ManuAGI01 veröffentlicht, und du kannst alle vier dort Wort für Wort nachlesen.
Was hier nicht steht, weil wir es nicht gefahren haben: ein Foto von einem echten Hund oder einer echten Katze, und ein gemaltes Porträt. Beides ist nicht blockiert und beides lohnt einen Versuch — dieselbe Haltung, die diese Seite zu den Sprachen jenseits der elf geprüften einnimmt. Wir behaupten nichts, was wir nicht zurückkommen gesehen haben.
Ein Foto in drei Schritten sprechen lassen
Der Schritt, der das Ergebnis entscheidet, ist der erste, und er dauert etwa vier Sekunden. Die ersten beiden Karten sind der Generator oben auf dieser Seite mitten im Job — die Datei, die er genommen hat, der Satz, der hineingetippt wurde. Die dritte ist das, was zurückkam.

Ein Gesicht hineinlegen
Ein Foto geht, und zwei bis fünfzehn Sekunden Material gehen auch. Ein Gesicht, in die Kamera schauend, nichts vor dem Mund. iPhone-HEIC-Dateien gehen direkt hinein, und das Feld liest dir die Datei zurück — Größe, Format, Gewicht — bevor du irgendetwas ausgegeben hast.
Ein GesichtJPG · PNG · WEBP · HEIC![Das Prompt-Feld des Generators auf dieser Seite mit einem hineingetippten Satz — (S1) speaks warmly, [English] I have used this every morning for a month — und dem Zähler bei 73 / 7000](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
Sagen, was gesagt wird
Tippe den Satz und ein Sprach-Tag, und die Stimme kommt mit — du musst keine Audiodatei vorher bauen. Der Lip-Sync-Satz im Feld ist dreiundsiebzig Zeichen von den 7.000, die du hast; alles andere ist für die Beschreibung der Einstellung da.
73 von 7.000 ZeichenKeine Stimme zu besetzen
Tonspur · 32 kHzLIP-SYNC.MP4Abspielen, dann ein Wort ändern
Der Clip kommt mit dem Ton schon in der Datei an. Die meisten behalten den zweiten oder dritten, nicht den ersten — jeder Versuch wird gespeichert, du bearbeitest also, statt neu anzufangen.
4–15s · bis 2KTon schon gemuxt
Die ersten beiden Karten sind Screenshots des Feldes oben auf dieser Seite, keine Zeichnung davon. Das Foto, das du hochlädst, wird nie verändert — zurück kommt eine neue Datei. Der Clip auf der dritten Karte ist MiniMax’ eigener, samt Prompt veröffentlicht im H3-Launch-Beitrag: das Standbild setzte das Gesicht, eine Gesangsspur setzte den Gesang, ein Filmclip setzte die Kamerafahrt. Dieser Lauf ging über den Audioweg; das Feld oben nimmt beide.
Wofür Leute KI-Lippensynchronisation benutzen
Vier Stellen zum Anfangen. Jede legt den vollständigen Prompt hinter einem fertigen Clip in den Generator ganz oben — in der Länge und im Format, in dem er gemacht wurde.
16:9 · 8sEin Satz direkt in die Kamera
Der ganze Clip ist eine Person und ein Satz. Bleib bei sechs Sekunden unter etwa zwölf Wörtern — lange Sätze bei kurzer Länge sind der übliche Grund, warum ein erster Versuch enttäuscht.
9:16 · 9sEin Satz Dialog für eine Szene
Eine Figur sagt den Satz in der Einstellung, die du dir ohnehin vorgestellt hast. Beschreibe die Person genauso wie die Worte — Kleidung, Haare, ein markantes Merkmal — und das Gesicht bleibt über den Clip hinweg sitzen.
9:16 · 15sJemand spricht über ein Produkt
Standbild der Person plus Standbild des Produkts, und die gesprochenen Sätze Einstellung für Einstellung geschrieben. Das ist der Lauf, der die vollen fünfzehn Sekunden fährt, also auch der, der dir zeigt, wo die Obergrenze liegt.
16:9 · 15sEin Gesang, kein gesprochener Satz
Setz den Ton auf sings, oder lade die Gesangsspur hoch und lass sie den Mund treiben. Die hochgeladene Spur wird zur fertigen Tonspur und nicht zur Referenz für eine, und das Hochladen wird nicht berechnet. Mach den Clip mindestens so lang wie die Spur.
Du startest von einem Video und deine Originalpixel müssen überleben? Das ist Dubbing, und ein Ausschneiden-und-Einsetzen-Tool macht es besser als diese Seite — hier wird alles neu aufgebaut statt bearbeitet.
Elf Sprachen für die Lippensynchronisation, und das Zeilenformat, das sie steuert
Elf haben wir End-to-End gefahren — in jeder davon wird der Mund aus den eigenen Lauten dieser Sprache geformt und nicht aus einer englischen Annäherung daran. Schreib den gesprochenen Satz in seiner eigenen Sprache, und die Betonung sitzt; schreib ihn auf Englisch mit einem Sprach-Tag, und sie sitzt nicht. Wie die Lip-Sync-Zeile geschrieben wird hat das Format.
Elf geprüfte Sprachen
11
- Arabisch
- Chinesisch
- Englisch
- Französisch
- Deutsch
- Italienisch
- Japanisch
- Koreanisch
- Portugiesisch
- Russisch
- Spanisch
Zur Einordnung: Googles eigene Dokumentation zu Veo 3.1 sagt, Englisch werde vollständig unterstützt und andere Sprachen seien nicht evaluiert. Du brauchst dasselbe Gesicht oder dieselbe Stimme über mehrere Clips? Nimm Referenz zu Video.
Was du prüfen kannst, was ein Lauf kostet und was ein Tarif ändert
Eines vorweg: das hier ist ein kostenpflichtiges Werkzeug. Eine Lippensynchronisation ohne Ton ist keine, also fährt diese Seite MiniMax H3 statt der stummen Bild-Engine, und einen Probelauf gibt es nicht. Was du ohne Bezahlen tun kannst, ist die Arbeit prüfen: jeder Clip oben läuft und lädt ohne Konto, samt dem Prompt, der ihn gemacht hat. Ein Lauf beginnt bei 37 Credits — vier Sekunden in 768P, das Kürzeste, was das Modell macht. Jeder Versuch wird gespeichert, und es zählt der zweite, denn fast niemand behält den ersten Clip. Ein Tarif höher kauft mehr Credits pro Monat, 2K auch bei längeren Clips ohne Rationieren und einen niedrigeren Preis je fertiger Sekunde.
Wie hier abgerechnet wird
- Berechnet nach
- Ausgabesekunde
- Fehlgeschlagen
- erstattet
- Audio-Upload
- nicht berechnet
- Clips hier
- läuft · ohne Konto
So oder so dieselben Credits im Monat
- KostenlosOhne Karte
Ein echter MiniMax-H3-Clip, mit Ton. Alles nach 4 s · 768P läuft auf Credits.
$0für immerZu keinem Zeitpunkt eine Kreditkarte
Gratis losNur Bot-Prüfung — keine E-Mail
1 Clip auf MiniMax H3
MiniMax H3 · 4 s · 768P · 16:9 · mit Ton
7 Tage einchecken — 37 Credits, ein Clip mehrJedes Paket ab $9.9 schaltet den MiniMax H3 KI-Videogenerator frei — jeder Modus, 768P und 2K
- MiniMax H3 in nativem 2KNur bezahlt
- Nativer Ton mit dem BildNur bezahlt
- Ein Clip, ohne Karte
- 1 Aufgabe gleichzeitig
- Gescheiterte Clips kosten nichts
- Private Generierung
- Jedes Paket schaltet den MiniMax H3 KI-Videogenerator in jedem Modus frei
Gratis ist eine andere Engine. Tarife ansehen
Tempo & Queue
- Queue
- Gratis-Spur
- Gleichzeitig
- 1
- Batch
- 1
- Historie
- 24 h · 7 Tage angemeldet
- Support
- Community
- Lite30 % sparen
Schalt den MiniMax H3 KI-Videogenerator in nativem 2K frei. Der kleinste bezahlte Tarif — Pro nehmen die meisten.
$16.9/mo$24.9$202.8 jährlich abgerechnet · $96 im Jahr sparen
7 Tage Rückerstattung · jederzeit kündbar
750 Credits / Monat · ~20 Videos
4 s · 768P · Text zu Video
oder ~13 mit 4 s 2K
Gleiche Credits, monatlich wie jährlich
- MiniMax H3 in nativem 2K — mit nativem Ton
- Dialog, Effekte und Musik in derselben Datei
- Bis 15 Sekunden15 s
- ~20 Videos im Monat mit 4 s 768P, Text zu Video
- Gescheiterte Clips kosten nichts
- 7 Tage Rückerstattung bei ungenutzten Credits
- 1 Aufgabe gleichzeitig
- 2 Varianten eines Prompts im Batch
Kommerzielle Nutzung enthalten — was das abdeckt
Tempo & Queue
- Queue
- Standard
- Gleichzeitig
- 1
- Batch
- 2
- Historie
- 7 Tage
- Support
- E-Mail · 48 h
- Für die meisten empfohlenPro30 % sparen
$32 mehr als Lite. ~47 Videos im Monat, derselbe MiniMax H3 KI-Videogenerator, schnellere Warteschlange.
$39.9/mo$56.9$478.8 jährlich abgerechnet · $204 im Jahr sparen
7 Tage Rückerstattung · jederzeit kündbar
1.775 Credits / Monat · ~47 Videos
4 s · 768P · Text zu Video
oder ~31 mit 4 s 2K
Gleiche Credits, monatlich wie jährlich
- Alles aus Lite
- ~47 Videos im Monat mit 4 s 768P, Text zu Video
- 3 gleichzeitig3×
- Video zu Prompt
- 4 Varianten eines Prompts im Batch
- Historie 7 Tage
- 7 Tage Rückerstattung bei ungenutzten Credits
Kommerzielle Nutzung enthalten — was das abdeckt
Tempo & Queue
- Queue
- Schnell
- Gleichzeitig
- 3
- Batch
- 4
- Historie
- 7 Tage
- Support
- E-Mail · 12 h
- Studio30 % sparen
Ein ganzer Monat Volumen, als Erster in der Reihe, und ein Mensch, der in 4 Stunden antwortet.
$99.9/mo$142.9$1 198.8 jährlich abgerechnet · $516 im Jahr sparen
7 Tage Rückerstattung · jederzeit kündbar
4.425 Credits / Monat · ~119 Videos
4 s · 768P · Text zu Video
oder ~77 mit 4 s 2K
Gleiche Credits, monatlich wie jährlich
- Alles aus Pro
- ~119 Videos im Monat mit 4 s 768P, Text zu Video
- 8 gleichzeitig8×
- 4 Varianten eines Prompts im Batch
- Historie 7 Tage
- Priorisierter Support in 4 Stunden
- Niedrigster Verbrauch bei uns
- 7 Tage Rückerstattung bei ungenutzten Credits
Kommerzielle Nutzung enthalten — was das abdeckt
Tempo & Queue
- Queue
- Priorität — als Erster in der Reihe
- Gleichzeitig
- 8
- Batch
- 4
- Historie
- 7 Tage
- Support
- Priorität · 4 h
Warum die Lippensynchronisation
bei voller Auflösung hält
Jede andere Art von Lip-Sync-Werkzeug sucht den Mund in deinem Bild und ersetzt ihn. Dieses sucht ihn nie — und dieser eine Unterschied ist der ganze Grund, warum der Mund nicht wie ein Flicken wirkt.
Ein Mund, der nicht zur Haut passt
Ein Flicken in einer anderen Auflösung als das Gesicht drumherum, und eine Linie entlang des Kiefers, die beim Kopfdrehen kriecht. Hast du es einmal gesehen, siehst du es immer — und es lag nie an deinem Foto.
Ein 96-Pixel-Quadrat, zurückgeklebt
Die übliche Methode findet den Mund, schneidet ein kleines Quadrat darum aus — oft 96 mal 96 — erzeugt neue Mundformen in dieser Größe und klebt sie auf deinen Frame. Alles außerhalb des Quadrats ist nie durch das Modell gelaufen.
Lies das Verb, das ein Werkzeug über sich selbst benutzt
Bildet Mundformen auf das Gesicht in deinem Video ab. Blendet sie in das Originalbild ein. Auf, in — so oder so wird etwas über ein Gesicht gelegt, das schon da ist, und die Kieferlinie ist die Stelle, wo es endet.
Ein neuer Frame, Ton inklusive, in einem Durchgang
MiniMax H3 findet deinen Mund nie, weil es deinen Frame nicht bearbeitet. Kein Ausschnitt, kein Einkleben, keine Kante zum Nachführen: der Mund trägt die Auflösung der Wangen, weil es im Bild nur eine Auflösung gibt. Die Stimme kommt aus demselben Durchgang, du bekommst also nie eine aufgeregte Tonspur über einem flachen Gesicht.
Dein Originalmaterial überlebt nicht. Du bekommst einen neuen Clip, der daraus gebaut ist, nicht deinen Clip mit einem neuen Mund. Wenn du deine eigenen Pixel zurückbrauchst — ein vierzigminütiger Kurs, der eine spanische Tonspur braucht, etwa — dient dir die Ausschneiden-und-Einkleben-Sorte besser als diese Seite.
Was die Lip-Sync-Zeile entscheidet
und das Foto nicht kann
Das Foto entscheidet, ob das überhaupt funktioniert. Die Lip-Sync-Zeile entscheidet, was du bekommst, wie lange es läuft und was es kostet — und das sind drei Namen für dieselbe Entscheidung.
Länge ist ein Budget
Die Ausgabe ist eine ganze Zahl von Sekunden zwischen 4 und 15. Bei normalem Sprechtempo sind das grob zehn bis vierzig Wörter. Schreib den Satz zuerst, zähl ihn, dann wähl die Länge — andersherum bekommst du eine Betonung, die gegen eine Uhr rennt, die sie nicht schlagen kann.
4–15s, ganze Sekunden
Ein Tag ist tragend
[Language] wählt den Lautbestand, aus dem der Mund geformt wird, es ist also der Tag, der das Bild verändert. (S1) verdient seinen Platz erst, wenn im Bild mehr als eine Person als Sprecher infrage kommt — bei einem einzelnen Gesicht ändert es nichts, was du sehen könntest.
(S1) … [German] …
Die Zeichenobergrenze gilt nicht der Zeile
7.000 Zeichen decken den ganzen Prompt ab. Ein gesprochener Satz sind ein paar Dutzend Zeichen; alles andere ist die Einstellung — wer, wo, wie beleuchtet, wie gerahmt. Wenn der Platz ausgeht, ist das ein Beschreibungsproblem, nie ein Dialogproblem.
7.000 Zeichen
Sekunden sind die Rechnung
8 Credits pro Ausgabesekunde in 768P, 13 in 2K. Die Lip-Sync-Zeile setzt die Länge, und die Länge setzt die Rechnung, ein Take von fünfzehn Sekunden kostet also fast das Vierfache eines Takes von vier. Die meisten Sätze, die es zu hören lohnt, sind kurz.
8 Credits / s · 768P
Nichts davon ist geraten — die Längen und die Zeichenobergrenze sind die veröffentlichten Limits, und die Sekundenpreise stehen so auf Preise. Du willst die Einstellung beschrieben bekommen? Prompt-Generator schreibt die anderen 6.900 Zeichen.
Wessen Gesicht du synchronisieren darfst
Dein eigenes, eines, für das du die Erlaubnis hast, oder eines, das niemandem gehört, weil du es generiert hast.
- GesichterEine reale Person so wirken zu lassen, als sage sie etwas, das sie nicht gesagt hat, verbietet die H3-Lizenz — keine Personen des öffentlichen Lebens, kein Foto eines Fremden.
- StimmenEine hochgeladene Spur, die den Klang einer bestimmten Person nachbildet, muss deine eigene, lizenziert oder synthetisch sein.
- MeldenDer Meldelink steht auf jeder Seite und an jedem Ergebnis. Konten, die immer wiederkommen, werden geschlossen.
- JugendschutzLade nie ein Foto oder einen Clip hoch, auf dem eine minderjährige Person zu sehen ist.
- Deine UploadsWerden nicht zum Trainieren von irgendetwas benutzt. Du kannst sie und dein Konto jederzeit löschen.
- Kommerzielle RechteKommerzielle Nutzung ist in jedem Tarif enthalten, auch im kostenlosen — die Clips entstehen über die API von MiniMax, und MiniMax erhebt keine Rechte an den Outputs, die du erzeugst. Eine Zusammenfassung, keine Rechtsberatung.
FAQ zur KI-Lippensynchronisation
Was du wissen solltest, bevor du deinen ersten Satz fährst
Ist dieser Generator für KI-Lippensynchronisation kostenlos?
Wie teste ich KI-Lippensynchronisation, ohne viel auszugeben?
Brauche ich eine Audiodatei für die Lippensynchronisation?
Kommt der Clip mit Ton?
Kann ich ein Video lippensynchronisieren, das ich schon habe?
Wie lang kann ein Lip-Sync-Clip sein?
Welche Sprachen unterstützt die Lippensynchronisation?
Warum war die Lippensynchronisation im Werkzeug davor unscharf?
Sieht es danach noch aus wie die Person auf meinem Foto?
Welches Foto soll ich für die Lippensynchronisation nehmen?
Was, wenn mein Audio länger ist als der Clip?
Kann die Lippensynchronisation singen statt sprechen?
Bekomme ich 2K?
Brauche ich ein Konto?
Hat mein Ergebnis ein Wasserzeichen?
Was passiert, nachdem ich bei einer Lippensynchronisation auf Generieren drücke?
Darf ich die Clips kommerziell nutzen?
Welche Fotoformate und -größen funktionieren?
Darf mehr als eine Person auf dem Foto sein?
Wie lang darf die Lip-Sync-Zeile sein?
Ein Foto, ein Satz, und die Lippensynchronisation steht.
Das ist die ganze Eingabe — und alles oben läuft, ob du dich anmeldest oder nicht.
Gratis registrieren · 1 Clip auf MiniMax H3Geschrieben und gepflegt vom Redaktionsteam von MiniMax H3 AI Video GeneratorVeröffentlicht am Zuletzt aktualisiert am Tool-Version 2026.09.4
