KI-Lippensynchronisation

Foto rein, eintippen was gesagt werden soll, sprechendes Video zurück — die Stimme kommt mit, du musst also keine Audiodatei vorher bauen. Vier bis fünfzehn Sekunden, bis 2K, in elf Sprachen.

Aus einem Foto

Bild erstellen

JPG · PNG · WEBP · HEIC · ≤30MB · ein Gesicht

0 / 7000

Die sprechende Person behält durchgehend dasselbe Gesicht, dieselben Haare, Kleidung und Farben; nur Kamera und beschriebene Bewegung ändern sich.

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

Jeder Clip auf dieser Seite läuft und lädt ohne Konto. Deinen eigenen Satz zu rendern wird pro Ausgabesekunde berechnet — 37 Credits kaufen die Untergrenze von vier Sekunden in 768P.

Echte MiniMax-H3-Ausgabe · Klick auf „Diese Lippensynchronisation testen“ lädt den vollständigen Prompt, keine Zusammenfassung

Eine Podcast-Hostin mit Kopfhörern grinst am Tischmikrofon, während sie ihren Satz spricht, MiniMax H3 Lippensynchronisation8s · 16:9 · 768P

Ein Foto und ein Satz

Was mit deinem Foto passiert

Ein einzelnes Foto, und die KI-Lippensynchronisation, die dazukommt

Auf dein Bild wird nichts aufgemalt. Das Foto wird zum ersten Frame einer Einstellung, in der diese Person spricht, und die Stimme entsteht im selben Durchgang — du musst also keine Audiodatei vorher bauen.

Das Foto, das hineinging: eine Frau an einem Straßencafé-Tisch, den Kopf über einer Espressotasse gesenkt, nicht sprechend

Dein Foto

Generiert — Bild und Ton zusammen

Vier bis fünfzehn ganze Sekunden bei 24 fps, 768P oder 2K, in elf Sprachen, die wir End-to-End gefahren haben. JPG, PNG, WEBP, HEIC und HEIF gehen direkt hinein, was erwähnenswert ist, weil die meisten Fotos von Menschen Handyfotos sind und die meisten Tools dich stillschweigend zuerst konvertieren lassen. Ein Handyschnappschuss animiert oft besser als ein poliertes Bewerbungsfoto — Retusche nimmt genau die Textur weg, die Bewegung braucht. Zähne, wenn du die Wahl hast: ein geschlossener Mund enthält keine Information darüber, was hinter den Lippen liegt, also erfindet das Modell ein Inneres, und erfundene Innenräume sind es, die ein Ergebnis falsch wirken lassen.

Dein Foto ist Frame eins
001

Dein Foto ist Frame eins

Jede ganze Sekunde
4–15 s

Jede ganze Sekunde

Sprachen End-to-End geprüft
11

Sprachen End-to-End geprüft

Ton aus demselben Durchgang
Stereo

Ton aus demselben Durchgang

  • Keine Audiodatei vorher bauen
  • Kein Timing Frame für Frame
  • Kein separater Lip-Sync-Durchgang

Das fertige Ergebnis

Wie KI-Lippensynchronisation aussieht, wenn sie richtig herauskommt

Was du siehst, ist das, was herauskam — kein Hochskalieren, kein Grading, kein zweiter Durchgang. Der ganze Prompt, der es erzeugt hat, steht daneben, keine Zusammenfassung. Klick auf „Diese Lippensynchronisation testen“ und er landet direkt im Feld oben, in der Länge und im Format, in dem er gemacht wurde, damit du eine Zeile ändern und sehen kannst, was sich bewegt. Mach den Ton an: was du hörst, kam aus demselben Durchgang wie der Mund, der es sagt.

Mehr Lip-Sync-Prompts ↗
Die Frau vom Foto oben, jetzt zur Kamera gewandt, den Mund mitten im Ton geöffnet, derselbe Tisch und dieselbe Straße hinter ihr16:9 · 6s

Der vollständige Prompt, keine Zusammenfassung

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6s · 16:9

Das Foto oben, und die sechs Sekunden, die daraus wurden

Ein Lauf, ein Prompt, genau so, wie das Modell ihn zurückgegeben hat

Was den Mund aufmachen kann

Lippensynchronisation braucht nicht das Foto eines Menschen

  • Eine Frau am beleuchteten Schminkspiegel hält ein Lippenöl und spricht in die Kamera, ihr Gesicht bleibt über jeden Schnitt hinweg am Referenzfoto16:9 · 15s
    Eine PersonFotoEin Referenzfoto, das über jede Einstellung hinweg gehalten wird, auch durch eine Nahaufnahme des Mundes — und genau dort übersteht eine Lippensynchronisation die volle Größe oder eben nicht.
  • Ein Mann und eine Frau streiten in einem Wohnzimmer, die Kamera handgehalten, jeder nimmt abwechselnd einen Satz16:9 · 15s
    Zwei Personen, ein Bild165 ZeichenBeide sprechen, abwechselnd, und der ganze Prompt war einen Satz lang. Sprecher-Tags gibt es, wenn du sagen musst, wer zuerst spricht; dieser Lauf hat sie nicht benutzt.
  • Ein Mädchen mit Strohhut spricht in einem Gewächshaus mit einer kleinen Regenwolke, die einen Blumenkranz trägt, beide in malerischem 2D gezeichnet16:9 · 15s
    Eine gezeichnete FigurIllustrationMalerisches 2D, und der Mund ist in derselben Handschrift gezeichnet wie der Rest des Bildes. Nichts Fotorealistisches irgendwo in der Einstellung.
  • Ein schwarzer Kater mit Fedora und eine Maus im Punktekleid unterhalten sich zur goldenen Stunde auf einer Parkbank16:9 · 15s
    Eine TierfigurTierEine Katze und eine Maus, jede mit einem Satz. Die Gesichter sind nicht menschlich, und die Münder treffen die Silben trotzdem.

Diese vier sind Läufe anderer Leute, nicht unsere — deshalb tragen sie das Hailuo-Zeichen in der Ecke und die übrigen Clips auf dieser Seite nicht. Dieses Zeichen ist der Beleg: jeder wurde samt Prompt von @SimplyAnnisa, @heydin_ai und @ManuAGI01 veröffentlicht, und du kannst alle vier dort Wort für Wort nachlesen.

Was hier nicht steht, weil wir es nicht gefahren haben: ein Foto von einem echten Hund oder einer echten Katze, und ein gemaltes Porträt. Beides ist nicht blockiert und beides lohnt einen Versuch — dieselbe Haltung, die diese Seite zu den Sprachen jenseits der elf geprüften einnimmt. Wir behaupten nichts, was wir nicht zurückkommen gesehen haben.

Der ganze Ablauf

Ein Foto in drei Schritten sprechen lassen

Der Schritt, der das Ergebnis entscheidet, ist der erste, und er dauert etwa vier Sekunden. Die ersten beiden Karten sind der Generator oben auf dieser Seite mitten im Job — die Datei, die er genommen hat, der Satz, der hineingetippt wurde. Die dritte ist das, was zurückkam.

  1. Die Upload-Zeile des Generators auf dieser Seite mit einem akzeptierten Foto: ein Vorschaubild der Frau am Cafétisch, der Dateiname ref-espresso.webp und ein grüner Haken mit 1280×724 · 1.77:1 · 62 KB

    Ein Gesicht hineinlegen

    Ein Foto geht, und zwei bis fünfzehn Sekunden Material gehen auch. Ein Gesicht, in die Kamera schauend, nichts vor dem Mund. iPhone-HEIC-Dateien gehen direkt hinein, und das Feld liest dir die Datei zurück — Größe, Format, Gewicht — bevor du irgendetwas ausgegeben hast.

    Ein GesichtJPG · PNG · WEBP · HEIC
  2. Das Prompt-Feld des Generators auf dieser Seite mit einem hineingetippten Satz — (S1) speaks warmly, [English] I have used this every morning for a month — und dem Zähler bei 73 / 7000

    Sagen, was gesagt wird

    Tippe den Satz und ein Sprach-Tag, und die Stimme kommt mit — du musst keine Audiodatei vorher bauen. Der Lip-Sync-Satz im Feld ist dreiundsiebzig Zeichen von den 7.000, die du hast; alles andere ist für die Beschreibung der Einstellung da.

    73 von 7.000 ZeichenKeine Stimme zu besetzen
  3. Die fertige Lippensynchronisation, mit dem Ton bereits in der Datei
    Tonspur · 32 kHzLIP-SYNC.MP4

    Abspielen, dann ein Wort ändern

    Der Clip kommt mit dem Ton schon in der Datei an. Die meisten behalten den zweiten oder dritten, nicht den ersten — jeder Versuch wird gespeichert, du bearbeitest also, statt neu anzufangen.

    4–15s · bis 2KTon schon gemuxt

Die ersten beiden Karten sind Screenshots des Feldes oben auf dieser Seite, keine Zeichnung davon. Das Foto, das du hochlädst, wird nie verändert — zurück kommt eine neue Datei. Der Clip auf der dritten Karte ist MiniMax’ eigener, samt Prompt veröffentlicht im H3-Launch-Beitrag: das Standbild setzte das Gesicht, eine Gesangsspur setzte den Gesang, ein Filmclip setzte die Kamerafahrt. Dieser Lauf ging über den Audioweg; das Feld oben nimmt beide.

Anwendungsfälle

Wofür Leute KI-Lippensynchronisation benutzen

Vier Stellen zum Anfangen. Jede legt den vollständigen Prompt hinter einem fertigen Clip in den Generator ganz oben — in der Länge und im Format, in dem er gemacht wurde.

  • Eine Podcast-Hostin grinst am Tischmikrofon, während sie einen einzelnen Satz spricht, MiniMax H3 Lippensynchronisation
    16:9 · 8s

    Ein Satz direkt in die Kamera

    Der ganze Clip ist eine Person und ein Satz. Bleib bei sechs Sekunden unter etwa zwölf Wörtern — lange Sätze bei kurzer Länge sind der übliche Grund, warum ein erster Versuch enttäuscht.

  • Zwei Figuren in einem angespannten Wortwechsel in einem dunklen Schlossinneren, beide Identitäten bleiben durch die Szene erhalten
    9:16 · 9s

    Ein Satz Dialog für eine Szene

    Eine Figur sagt den Satz in der Einstellung, die du dir ohnehin vorgestellt hast. Beschreibe die Person genauso wie die Worte — Kleidung, Haare, ein markantes Merkmal — und das Gesicht bleibt über den Clip hinweg sitzen.

  • Eine Frau vor einer Bäckerei spricht in die Kamera über das riesige Croissant in ihrer Hand, die Lippensynchronisation hält über fünf Einstellungen
    9:16 · 15s

    Jemand spricht über ein Produkt

    Standbild der Person plus Standbild des Produkts, und die gesprochenen Sätze Einstellung für Einstellung geschrieben. Das ist der Lauf, der die vollen fünfzehn Sekunden fährt, also auch der, der dir zeigt, wo die Obergrenze liegt.

  • Eine Frau in einem blauen Studio synchronisiert die Lippen zu einem Rap-Track, ihr Gesicht ist am Referenzfoto fixiert
    16:9 · 15s

    Ein Gesang, kein gesprochener Satz

    Setz den Ton auf sings, oder lade die Gesangsspur hoch und lass sie den Mund treiben. Die hochgeladene Spur wird zur fertigen Tonspur und nicht zur Referenz für eine, und das Hochladen wird nicht berechnet. Mach den Clip mindestens so lang wie die Spur.

Du startest von einem Video und deine Originalpixel müssen überleben? Das ist Dubbing, und ein Ausschneiden-und-Einsetzen-Tool macht es besser als diese Seite — hier wird alles neu aufgebaut statt bearbeitet.

Sprachen

Elf Sprachen für die Lippensynchronisation, und das Zeilenformat, das sie steuert

Elf haben wir End-to-End gefahren — in jeder davon wird der Mund aus den eigenen Lauten dieser Sprache geformt und nicht aus einer englischen Annäherung daran. Schreib den gesprochenen Satz in seiner eigenen Sprache, und die Betonung sitzt; schreib ihn auf Englisch mit einem Sprach-Tag, und sie sitzt nicht. Wie die Lip-Sync-Zeile geschrieben wird hat das Format.

Elf geprüfte Sprachen

11

  • Arabisch
  • Chinesisch
  • Englisch
  • Französisch
  • Deutsch
  • Italienisch
  • Japanisch
  • Koreanisch
  • Portugiesisch
  • Russisch
  • Spanisch

Zur Einordnung: Googles eigene Dokumentation zu Veo 3.1 sagt, Englisch werde vollständig unterstützt und andere Sprachen seien nicht evaluiert. Du brauchst dasselbe Gesicht oder dieselbe Stimme über mehrere Clips? Nimm Referenz zu Video.

Was ein Lauf kostet

Was du prüfen kannst, was ein Lauf kostet und was ein Tarif ändert

Eines vorweg: das hier ist ein kostenpflichtiges Werkzeug. Eine Lippensynchronisation ohne Ton ist keine, also fährt diese Seite MiniMax H3 statt der stummen Bild-Engine, und einen Probelauf gibt es nicht. Was du ohne Bezahlen tun kannst, ist die Arbeit prüfen: jeder Clip oben läuft und lädt ohne Konto, samt dem Prompt, der ihn gemacht hat. Ein Lauf beginnt bei 37 Credits — vier Sekunden in 768P, das Kürzeste, was das Modell macht. Jeder Versuch wird gespeichert, und es zählt der zweite, denn fast niemand behält den ersten Clip. Ein Tarif höher kauft mehr Credits pro Monat, 2K auch bei längeren Clips ohne Rationieren und einen niedrigeren Preis je fertiger Sekunde.

Wie hier abgerechnet wird

Berechnet nach
Ausgabesekunde
Fehlgeschlagen
erstattet
Audio-Upload
nicht berechnet
Clips hier
läuft · ohne Konto

Alle Preise zur Lippensynchronisation.

So oder so dieselben Credits im Monat

  • KostenlosOhne Karte

    Ein echter MiniMax-H3-Clip, mit Ton. Alles nach 4 s · 768P läuft auf Credits.

    $0für immer

    Zu keinem Zeitpunkt eine Kreditkarte

    Gratis los

    Nur Bot-Prüfung — keine E-Mail

    1 Clip auf MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · mit Ton
    7 Tage einchecken — 37 Credits, ein Clip mehr

    Jedes Paket ab $9.9 schaltet den MiniMax H3 KI-Videogenerator frei — jeder Modus, 768P und 2K

    • MiniMax H3 in nativem 2KNur bezahlt
    • Nativer Ton mit dem BildNur bezahlt
    • Ein Clip, ohne Karte
    • 1 Aufgabe gleichzeitig
    • Gescheiterte Clips kosten nichts
    • Private Generierung
    • Jedes Paket schaltet den MiniMax H3 KI-Videogenerator in jedem Modus frei

    Gratis ist eine andere Engine. Tarife ansehen

    Tempo & Queue

    Queue
    Gratis-Spur
    Gleichzeitig
    1
    Batch
    1
    Historie
    24 h · 7 Tage angemeldet
    Support
    Community
  • Lite30 % sparen

    Schalt den MiniMax H3 KI-Videogenerator in nativem 2K frei. Der kleinste bezahlte Tarif — Pro nehmen die meisten.

    $16.9/mo$24.9

    $202.8 jährlich abgerechnet · $96 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    750 Credits / Monat · ~20 Videos

    4 s · 768P · Text zu Video

    oder ~13 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • MiniMax H3 in nativem 2K — mit nativem Ton
    • Dialog, Effekte und Musik in derselben Datei
    • Bis 15 Sekunden15 s
    • ~20 Videos im Monat mit 4 s 768P, Text zu Video
    • Gescheiterte Clips kosten nichts
    • 7 Tage Rückerstattung bei ungenutzten Credits
    • 1 Aufgabe gleichzeitig
    • 2 Varianten eines Prompts im Batch

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Standard
    Gleichzeitig
    1
    Batch
    2
    Historie
    7 Tage
    Support
    E-Mail · 48 h
  • Für die meisten empfohlen
    Pro30 % sparen

    $32 mehr als Lite. ~47 Videos im Monat, derselbe MiniMax H3 KI-Videogenerator, schnellere Warteschlange.

    $39.9/mo$56.9

    $478.8 jährlich abgerechnet · $204 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    1.775 Credits / Monat · ~47 Videos

    4 s · 768P · Text zu Video

    oder ~31 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • Alles aus Lite
    • ~47 Videos im Monat mit 4 s 768P, Text zu Video
    • 3 gleichzeitig
    • Video zu Prompt
    • 4 Varianten eines Prompts im Batch
    • Historie 7 Tage
    • 7 Tage Rückerstattung bei ungenutzten Credits

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Schnell
    Gleichzeitig
    3
    Batch
    4
    Historie
    7 Tage
    Support
    E-Mail · 12 h
  • Studio30 % sparen

    Ein ganzer Monat Volumen, als Erster in der Reihe, und ein Mensch, der in 4 Stunden antwortet.

    $99.9/mo$142.9

    $1 198.8 jährlich abgerechnet · $516 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    4.425 Credits / Monat · ~119 Videos

    4 s · 768P · Text zu Video

    oder ~77 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • Alles aus Pro
    • ~119 Videos im Monat mit 4 s 768P, Text zu Video
    • 8 gleichzeitig
    • 4 Varianten eines Prompts im Batch
    • Historie 7 Tage
    • Priorisierter Support in 4 Stunden
    • Niedrigster Verbrauch bei uns
    • 7 Tage Rückerstattung bei ungenutzten Credits

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Priorität — als Erster in der Reihe
    Gleichzeitig
    8
    Batch
    4
    Historie
    7 Tage
    Support
    Priorität · 4 h

Wie es gemacht wird

Warum die Lippensynchronisation bei voller Auflösung hält

Jede andere Art von Lip-Sync-Werkzeug sucht den Mund in deinem Bild und ersetzt ihn. Dieses sucht ihn nie — und dieser eine Unterschied ist der ganze Grund, warum der Mund nicht wie ein Flicken wirkt.

  • Das Zeichen

    Ein Mund, der nicht zur Haut passt

    Ein Flicken in einer anderen Auflösung als das Gesicht drumherum, und eine Linie entlang des Kiefers, die beim Kopfdrehen kriecht. Hast du es einmal gesehen, siehst du es immer — und es lag nie an deinem Foto.

  • Die Ursache

    Ein 96-Pixel-Quadrat, zurückgeklebt

    Die übliche Methode findet den Mund, schneidet ein kleines Quadrat darum aus — oft 96 mal 96 — erzeugt neue Mundformen in dieser Größe und klebt sie auf deinen Frame. Alles außerhalb des Quadrats ist nie durch das Modell gelaufen.

  • Vorher erkennen

    Lies das Verb, das ein Werkzeug über sich selbst benutzt

    Bildet Mundformen auf das Gesicht in deinem Video ab. Blendet sie in das Originalbild ein. Auf, in — so oder so wird etwas über ein Gesicht gelegt, das schon da ist, und die Kieferlinie ist die Stelle, wo es endet.

  • Was hier passiert

    Ein neuer Frame, Ton inklusive, in einem Durchgang

    MiniMax H3 findet deinen Mund nie, weil es deinen Frame nicht bearbeitet. Kein Ausschnitt, kein Einkleben, keine Kante zum Nachführen: der Mund trägt die Auflösung der Wangen, weil es im Bild nur eine Auflösung gibt. Die Stimme kommt aus demselben Durchgang, du bekommst also nie eine aufgeregte Tonspur über einem flachen Gesicht.

Der Handel, vor dem Hochladen

Dein Originalmaterial überlebt nicht. Du bekommst einen neuen Clip, der daraus gebaut ist, nicht deinen Clip mit einem neuen Mund. Wenn du deine eigenen Pixel zurückbrauchst — ein vierzigminütiger Kurs, der eine spanische Tonspur braucht, etwa — dient dir die Ausschneiden-und-Einkleben-Sorte besser als diese Seite.

Die Lip-Sync-Zeile

Was die Lip-Sync-Zeile entscheidet und das Foto nicht kann

Das Foto entscheidet, ob das überhaupt funktioniert. Die Lip-Sync-Zeile entscheidet, was du bekommst, wie lange es läuft und was es kostet — und das sind drei Namen für dieselbe Entscheidung.

  1. 01Länge ist ein Budget

    Die Ausgabe ist eine ganze Zahl von Sekunden zwischen 4 und 15. Bei normalem Sprechtempo sind das grob zehn bis vierzig Wörter. Schreib den Satz zuerst, zähl ihn, dann wähl die Länge — andersherum bekommst du eine Betonung, die gegen eine Uhr rennt, die sie nicht schlagen kann.

    4–15s, ganze Sekunden

  2. 02Ein Tag ist tragend

    [Language] wählt den Lautbestand, aus dem der Mund geformt wird, es ist also der Tag, der das Bild verändert. (S1) verdient seinen Platz erst, wenn im Bild mehr als eine Person als Sprecher infrage kommt — bei einem einzelnen Gesicht ändert es nichts, was du sehen könntest.

    (S1) … [German] …

  3. 03Die Zeichenobergrenze gilt nicht der Zeile

    7.000 Zeichen decken den ganzen Prompt ab. Ein gesprochener Satz sind ein paar Dutzend Zeichen; alles andere ist die Einstellung — wer, wo, wie beleuchtet, wie gerahmt. Wenn der Platz ausgeht, ist das ein Beschreibungsproblem, nie ein Dialogproblem.

    7.000 Zeichen

  4. 04Sekunden sind die Rechnung

    8 Credits pro Ausgabesekunde in 768P, 13 in 2K. Die Lip-Sync-Zeile setzt die Länge, und die Länge setzt die Rechnung, ein Take von fünfzehn Sekunden kostet also fast das Vierfache eines Takes von vier. Die meisten Sätze, die es zu hören lohnt, sind kurz.

    8 Credits / s · 768P

Nichts davon ist geraten — die Längen und die Zeichenobergrenze sind die veröffentlichten Limits, und die Sekundenpreise stehen so auf Preise. Du willst die Einstellung beschrieben bekommen? Prompt-Generator schreibt die anderen 6.900 Zeichen.

Verantwortungsvolle Nutzung

Wessen Gesicht du synchronisieren darfst

Dein eigenes, eines, für das du die Erlaubnis hast, oder eines, das niemandem gehört, weil du es generiert hast.

  • GesichterEine reale Person so wirken zu lassen, als sage sie etwas, das sie nicht gesagt hat, verbietet die H3-Lizenz — keine Personen des öffentlichen Lebens, kein Foto eines Fremden.
  • StimmenEine hochgeladene Spur, die den Klang einer bestimmten Person nachbildet, muss deine eigene, lizenziert oder synthetisch sein.
  • MeldenDer Meldelink steht auf jeder Seite und an jedem Ergebnis. Konten, die immer wiederkommen, werden geschlossen.
  • JugendschutzLade nie ein Foto oder einen Clip hoch, auf dem eine minderjährige Person zu sehen ist.
  • Deine UploadsWerden nicht zum Trainieren von irgendetwas benutzt. Du kannst sie und dein Konto jederzeit löschen.
  • Kommerzielle RechteKommerzielle Nutzung ist in jedem Tarif enthalten, auch im kostenlosen — die Clips entstehen über die API von MiniMax, und MiniMax erhebt keine Rechte an den Outputs, die du erzeugst. Eine Zusammenfassung, keine Rechtsberatung.

Vollständige Regeln: Verantwortungsvolle Nutzung

Fragen, die wirklich gestellt werden

FAQ zur KI-Lippensynchronisation

Was du wissen solltest, bevor du deinen ersten Satz fährst

Ist dieser Generator für KI-Lippensynchronisation kostenlos?

Nein — einen Lauf zu fahren kostet. Eine Lippensynchronisation ohne Ton ist keine, also fährt diese Seite MiniMax H3 statt der stummen Bild-Engine, und ein Lauf beginnt bei 37 Credits: vier Sekunden in 768P. Kein Konto braucht der Beleg — jeder fertige Clip hier und der vollständige Prompt dahinter laufen und laden, wie sie sind.

Wie teste ich KI-Lippensynchronisation, ohne viel auszugeben?

Fahr zuerst vier Sekunden. Abgerechnet wird pro Ausgabesekunde, der kürzeste Take ist also der billigste Blick darauf, ob das Gesicht hält und der Mund trifft — 37 Credits gegen 125 für volle fünfzehn. Bring Foto und Satz bei vier Sekunden in Ordnung, dann wähl die Länge, die du wirklich willst.

Brauche ich eine Audiodatei für die Lippensynchronisation?

Nein, und das ist der Hauptunterschied zu den meisten Werkzeugen in dieser Kategorie. Tippe den Satz, wähl eine Sprache, und die Stimme entsteht mit dem Mund. Wenn du schon eine Aufnahme oder einen Song hast, lade ihn hoch, und er wird stattdessen zur fertigen Tonspur.

Kommt der Clip mit Ton?

Ja — 32 kHz Stereo, im selben Durchgang wie das Bild gemacht, in einer MP4. Es gibt keinen separaten Audioschritt und nichts zu muxen.

Kann ich ein Video lippensynchronisieren, das ich schon habe?

Ja, wenn eines vorher klar ist: H3 rendert die Einstellung neu, statt den Mund auf deinen Frames zu übermalen. Dein Material führt das Ergebnis; es überlebt nicht darin. Diese Seite ist also richtig, wenn du einen frischen Take derselben Idee willst, und falsch, wenn es gerade auf die Originalpixel ankommt — ein vierzigminütiger Kurs, der eine spanische Tonspur braucht, Kundenmaterial, das niemand neu zeichnen darf. Dafür dient dir ein Ausschneiden-und-Einkleben-Dubbing-Tool besser als wir.

Wie lang kann ein Lip-Sync-Clip sein?

Jede ganze Zahl von Sekunden zwischen 4 und 15, bei 24 fps. Fünfzehn ist eine Grenze des Modells, keine des Tarifs — keine Stufe hebt sie an.

Welche Sprachen unterstützt die Lippensynchronisation?

Elf geprüfte: Arabisch, Chinesisch, Deutsch, Englisch, Französisch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch. Andere funktionieren meist und sind nicht blockiert; wir haben sie nur nicht gefahren, also behaupten wir sie nicht.

Warum war die Lippensynchronisation im Werkzeug davor unscharf?

Fast sicher, weil es einen kleinen Bereich um den Mund ausschneidet, in dieser Größe generiert und ihn zurückklebt. Auf einem 1080p-Frame ist dieser Flicken der einzige Teil, der durch einen Flaschenhals mit niedriger Auflösung ging, also wirkt er neben den Wangen weich. An deinem Foto lag es nicht.

Sieht es danach noch aus wie die Person auf meinem Foto?

Es hält, wenn der Prompt die Person genauso beschreibt wie das Gesagte, und driftet, wenn er nur das Sprechen beschreibt. Frontale Vorlagen halten deutlich besser. Dieselbe Regel und dieselbe Abhilfe wie bei Bild zu Video, und „Aussehen fixieren“ schreibt dir den Satz dazu.

Welches Foto soll ich für die Lippensynchronisation nehmen?

Ein Gesicht, frontal, gleichmäßiges Licht, nichts vor dem Mund, und sichtbare Zähne, wenn du die Wahl hast. Ein Handyschnappschuss schlägt meist ein retuschiertes Bewerbungsfoto — Retusche nimmt die Textur weg, die Bewegung braucht.

Was, wenn mein Audio länger ist als der Clip?

Es wird auf die Cliplänge geschnitten; es wird nicht komprimiert und nicht beschleunigt. Setz die Länge mindestens auf die Länge deiner Spur — der Generator vergleicht beide und bietet an, es zu richten.

Kann die Lippensynchronisation singen statt sprechen?

Ja. Setz den Ton auf sings, oder lade den Gesang hoch und lass ihn den Mund treiben. Dieselbe Grenze von fünfzehn Sekunden.

Bekomme ich 2K?

Ja. 2K wird aus dem ursprünglichen Kontext neu gerendert statt Pixel hochzuskalieren, die Details am Mund überstehen den Schritt also, statt interpoliert zu werden.

Brauche ich ein Konto?

Nicht, um auf dieser Seite etwas abzuspielen oder herunterzuladen. Ja, um einen eigenen Lauf zu fahren, und Credits dazu, denn diese Seite fährt das kostenpflichtige MiniMax H3. Deine Versuche werden gespeichert, der zweite ist also eine Bearbeitung und kein erneutes Hochladen.

Hat mein Ergebnis ein Wasserzeichen?

Bezahlte Ausgabe nicht. Was du herunterlädst, ist das, was das Modell erzeugt hat.

Was passiert, nachdem ich bei einer Lippensynchronisation auf Generieren drücke?

Es geht ans Modell und kommt als fertige MP4 in deinem Verlauf zurück, der Ton schon in der Datei. Du musst nicht auf der Seite sitzen bleiben — ein Lauf, zu dem dein Browser nie zurückkam, wird serverseitig fertig, und alles, was der Anbieter verliert, wird als fehlgeschlagen gebucht und die Credits automatisch zurückgegeben.

Darf ich die Clips kommerziell nutzen?

Kommerzielle Nutzung ist in jedem Tarif enthalten, auch im kostenlosen — die Clips entstehen über die API von MiniMax, und MiniMax erhebt keine Rechte an den Outputs, die du erzeugst. Eine Zusammenfassung, keine Rechtsberatung.

Welche Fotoformate und -größen funktionieren?

JPG, JPEG, PNG, WEBP, HEIC und HEIF, bis 30 MB je Datei, zwischen 256 und 5.760 Pixeln je Seite mit einem Seitenverhältnis irgendwo zwischen 2:5 und 5:2. HEIC und HEIF gehen direkt hinein, ein mit dem iPhone aufgenommenes Foto braucht also keine Umwandlung vorher. Das sind die veröffentlichten Limits, und das Upload-Feld prüft deine Datei dagegen, bevor du etwas ausgibst.

Darf mehr als eine Person auf dem Foto sein?

Ja, und eine Zeile erledigt das. Bei zwei Gesichtern im Bild wählt das Modell eine sprechende Person, wenn du keine benennst, also tagge sie: (S1) asks, [English] Did you send it? (S2) replies firmly, [English] Two hours ago. Bei einem einzelnen Gesicht ändert der Tag nichts Sichtbares, weshalb man ihn erst kennen muss, wenn man ihn braucht.

Wie lang darf die Lip-Sync-Zeile sein?

7.000 Zeichen decken den ganzen Prompt ab, und ein gesprochener Satz sind ein paar Dutzend Zeichen — alles andere ist die Einstellung. Die echte Grenze ist die Uhr: vier bis fünfzehn Sekunden sind bei normalem Sprechtempo grob zehn bis vierzig Wörter. Schreib den Satz, zähl ihn, dann wähl die Länge. Wenn der Platz ausgeht, ist das ein Beschreibungsproblem, nie ein Dialogproblem.

Ein Foto, ein Satz, und die Lippensynchronisation steht.

Das ist die ganze Eingabe — und alles oben läuft, ob du dich anmeldest oder nicht.

Gratis registrieren · 1 Clip auf MiniMax H3

Geschrieben und gepflegt vom Redaktionsteam von MiniMax H3 AI Video GeneratorVeröffentlicht am Zuletzt aktualisiert am Tool-Version 2026.09.4