Generator für konsistente Figuren

Kein Videomodell merkt sich deine Figur zwischen zwei Anfragen, und die, die das behaupten, speichern die Datei und geben sie dir zurück. Spar dir also die Identität, die erst trainiert werden muss: häng die Standbilder, den Clip und die Stimme an genau die Einstellung, nach der du fragst, bis zu zwölf Dateien in einer Anfrage.
Deine erste ist gratis. Ohne Karte.

Die nächste Einstellung schreiben

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • Gib der Figur eine Datei, kein Adjektiv — ein sauberes frontales Standbild schlägt jedes Mal einen Absatz Beschreibung
  • Sag, wofür jede Datei da ist: diese ist das Gesicht, diese ist die Bewegung, diese ist die Stimme
  • Benenn die Merkmale, die sich nicht bewegen dürfen — die Haare, die Jacke, die Narbe. Was du nicht nennst, ist Freiwild
  • Eine Szene ist eine Anfrage je Einstellung, und dieselben Referenzen gehen jedes Mal wieder mit

Ohne Karte: jeder Clip auf dieser Seite läuft ohne Konto, und ein Gratis-Konto fährt einen eigenen — 4 s, 768P, mit Ton, ohne Wasserzeichen, zum Herunterladen und kommerziell nutzbar.

Vier Arten, eine Figur zu halten, aus den eigenen veröffentlichten Beispielen von MiniMax. Jede Karte öffnet den vollständigen Prompt.

Konsistente Figur im KI-Video: ein Paar am Spülbecken schnippt sich Spülschaum zu, ihr Gesicht aus einem Standbild und ihr Timing aus einem separaten Referenzclip

Das Gesicht ist ein Standbild, die Performance ein Clip

Prompt rein, Besetzung raus

Links der Prompt. Rechts das, was er zurückgab.

Das Gesicht ist ein Standbild, die Performance ein Clip16:9 · 15 s · 1 Referenzbild + 1 Referenzclip

Zwei Dateien, zwei Aufgaben. Das Standbild sagt, wer das ist; der Clip sagt, wie sie sich bewegt, in welchem Tempo, mit welchem Timing. Keines macht die Arbeit des anderen — und der Prompt benennt, welche Datei welche Frage beantwortet, bevor er eine einzige Handlung beschreibt.

The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.

Konsistente Figur im KI-Video: ein Paar am Spülbecken schnippt sich Spülschaum zu, ihr Gesicht aus einem Standbild und ihr Timing aus einem separaten Referenzclip
Eine Figur, fünfzehn Sekunden gehalten16:9 · 15 s · 2 Referenzbilder

Lies den ersten Satzteil: nimm Bild 2 als feste Figurreferenz, dann vier Merkmale, eins nach dem anderen — das halb zusammengebundene schwarze Haar, die silberne hohle Krone, die Robe, die Palette. Diese Liste ist der ganze Trick. Merkmale, die du nicht nennst, darf das Modell neu zeichnen.

Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.

Konsistente Figur im KI-Video: eine Xianxia-Heldin in weißen Roben mit silberner Haarkrone bewegt sich durch eine Schneesequenz, ihr Kostüm von Einstellung zu Einstellung unverändert
Zwei Hauptrollen, ein Teaser9:16 · 15 s · 2 Referenzbilder

Eine Besetzung, keine Figur. Der Prompt fixiert beide Hauptrollen auf ihre Referenzbilder, bevor er einen einzigen Beat schreibt, denn eine Szene mit zwei Menschen sind zwei Identitäten, die unabhängig driften können — und die, die du nicht festgenagelt hast, ist die, die sich bewegt.

Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.

Konsistente Figur im KI-Video: ein hochkanter Vampir-Romance-Teaser hält dieselben zwei Hauptrollen über eine Tür, einen Korridor und eine nahe Zweieraufnahme
Neue Besetzung, gleiche Choreografie16:9 · 6 s · 1 Referenzclip

Was hier gehalten wird, ist kein Gesicht — es ist eine Kür. Drei Männer in Anzügen werden zu drei Wasserschweinen, und jeder Beat einer neunteiligen Bodensequenz übersteht den Tausch, weil der Clip das Timing trägt und nicht der Satz.

Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.

Konsistente Figur im KI-Video: drei Wasserschweine in Anzügen zeigen eine komplexe Bodenkür und folgen der Bewegung der drei Männer im Referenzclip exakt

Was das ist und was nicht

Nichts hier merkt sich deine Figur. Das ist das ganze Problem und die ganze Methode.

Dieser Teil kommt zuerst, weil er entscheidet, ob du hier überhaupt richtig bist. Jedes Produkt, das Figurenkonstanz verkauft, verkauft dir eine gespeicherte Identität — Higgsfield trainiert eine Soul ID, Vidu hält ein Multi-Referenz-Set, Runway verankert eine Sitzung. Gespeichert wird eine Datei, und was zur Generierungszeit passiert, ist, dass diese Datei an deine Anfrage gehängt wird.
Die Frage ist also nicht, ob ein Werkzeug sich etwas merkt. Sie lautet, wie viele Dateien es auf einmal nimmt und wofür du bezahlst, sie irgendwo zu lagern.

Die Messwerte sind zu allen unfreundlich, und das sollte man vor der Budgetplanung wissen. Im Face Consistency Benchmark driftet ein Gesicht innerhalb eines einzigen Text-zu-Video-Clips 2,1- bis 5,7-mal weiter als dieselbe Messung an echtem Material — 0,0843 ArcFace-Kosinusdistanz bei echtem Video gegen 0,1734 beim besten gemessenen Modell und 0,4843 beim schlechtesten. Über zwei verschiedene Clips hinweg wird es nicht leichter, sondern schwerer: die referenzgestützten Verfahren im ContextAnyone-Vergleich erreichen zwischen zwei Videos nur 0,54 bis 0,59 ArcFace-Ähnlichkeit.
Ein Referenz-Standbild ist der größte Hebel, den es gibt, und es ist keine Garantie. Was es dir kauft, ist ein Gesicht, das ein Zuschauer bei den meisten Takes als dieselbe Person liest, zum Preis eines Takes.

Im Monat, für eine gespeicherte Identität
$15–$129

Im Monat, für eine gespeicherte Identität

Je Versuch anderswo, nach Länge
$0.45–$2.00

Je Versuch anderswo, nach Länge

Bilder, Clips, Audio in einer Anfrage
9 · 3 · 3

Bilder, Clips, Audio in einer Anfrage

Eine 8-Sekunden-Einstellung hier, mit Ton
~$1.52

Eine 8-Sekunden-Einstellung hier, mit Ton

  • Keine Identität, die vor der ersten Einstellung trainiert werden muss
  • Keine Figurenbibliothek, für die weiter Miete fällig wird
  • Kein getrennter Durchgang für die Lippensynchronität zu kaufen
  • Kein Wasserzeichen zu erklären, in keinem Tarif

Was du hineingibst

Vier Arten zu sagen, wer das ist

Das eine, worauf es ankommt: das Modell rendert jeden Pixel neu, auch das Gesicht. Es fügt deine Referenz nie ein. Die Aufgabe jeder Datei unten ist also, ein Neuzeichnen einzuschränken, nicht ein Asset zu liefern.

  • Standbilder der Figur

    Bis zu neun. Ein sauberes frontales ist mehr wert als drei schlechte Winkel — gemessen an nicht-frontaler Referenzeingabe fallen die Identitätswerte um mehr als die Hälfte. Nimm das Kostüm und das Requisit als eigene Bilder dazu.

    Stärkstes Signal · bis zu 9 Bilder
  • Ein Clip, in dem sie schon vorkommt

    Bis zu drei. Ein Video trägt, was ein Standbild nicht kann — Gang, Timing, die Art, eine Pause zu halten, einen Kamerapfad. Zwei der vier Beispiele auf dieser Seite holen ihre Performance aus einem.

    Bewegung und Rhythmus · bis zu 3 Clips
  • Ihre Stimme

    Bis zu drei Audiodateien, und Identität ist so sehr eine Stimme wie ein Gesicht. H3 referenziert die Klangfarbe und spricht deine neue Zeile darin, im selben Durchgang wie das Bild. Audio muss zusammen mit einem Bild oder einem Clip reisen.

    Klangfarbe, kein Klon · bis zu 3 Audio
  • Nichts als eine Beschreibung

    Es funktioniert innerhalb einer Einstellung und hört zwischen zweien auf zu funktionieren. Schreib es einmal, generier die Figur, behalt dann den Frame, der dir gefällt, und nimm ihn als Referenz für alles danach.

    Nur eine Einstellung · Text zu Video

Alle vier laufen auf demselben Modell zu einem Satz — 8 Credits je 768P-Sekunde, 13 bei 2K, dazu 5 für den Clip. Referenzen kosten nichts extra. Jede Grenze und jeder Satz, mit dem Datum der letzten Änderung.

Von Anfang bis Ende

So hältst du eine Figur, in vier Schritten

Die Reihenfolge zählt hier mehr als auf jeder anderen Seite, denn eine Besetzung, die du in Einstellung eins nicht festgelegt hast, ist eine Besetzung, die du in Einstellung sechs nicht mehr retten kannst.

  1. Eine Xianxia-Figur in weißen Roben, der Frame, der zum Referenz-Standbild wird

    Besetzen, bevor du schreibst

    Wähl die Frames, die die Figur sein werden, und wähl sie, als würdest du besetzen: ein sauberes frontales, ein Dreiviertelprofil, das Kostüm, das Requisit. Allein bei nicht-frontaler Eingabe fallen gemessene Identitätswerte um mehr als die Hälfte — das frontale ist also keine Vorliebe, es ist die tragende Datei.

    Bis zu 9 BilderEin sauberes frontales
  2. Eine Kücheneinstellung zu zweit, deren Gesichter aus einem Standbild und deren Timing aus einem Clip kam

    Gib jeder Datei im Satz eine Aufgabe

    H3 liest den Prompt mit einem Sprachmodell, man kann ihm also sagen, welche Datei welche Frage beantwortet. Bild 1 ist die Figur; Video 1 ist die Handlung und der Rhythmus ist ein funktionierender Satz. Vier Dateien anzuhängen und eine Szene zu beschreiben ist keiner.

    Benenn die DateiBenenn ihre Aufgabe
  3. Zwei Hauptrollen in einem hochkanten Teaser, über einen Schnitt gehalten

    Das Aussehen der männlichen und der weiblichen Hauptrolle folgt streng den Referenzbildern… ihre Stimmen folgen der Klangfarbe des Referenztons.

    BildTon

    Nimm die Besetzung in die nächste Einstellung mit

    Zwischen zwei Anfragen wird nichts gemerkt. Einstellung zwei bekommt dieselben Referenzen wie Einstellung eins, plus — und das ist der Teil, den Leute überspringen — einen Frame, den du aus Einstellung eins behalten hast. Die Ausgabe der letzten Einstellung ist die beste Referenz, die du je für die nächste haben wirst.

    Jedes Mal neu anhängenEinen Frame behalten
  4. Eine gezeichnete männliche Hauptrolle in Nahaufnahme, der fertige Take
    Tonspur · 32 kHzSHOT-01.MP4

    In 768P entwerfen, den Treffer in 2K mastern

    Eine 768P-Sekunde sind 8 Credits gegen 13 bei 2K, und einen fertigen 768P-Clip hinterher hochzustufen kostet genau so viel, wie ihn gleich in 2K zu rendern — die sechs Takes, die ein Gesicht braucht, kosten dich also weniger. Eine gescheiterte Generierung wird automatisch erstattet.

    768P · 8 Credits je Sekunde2K · 13 Credits je Sekunde

Vier Schritte, keine Installation, keine Karte. Generator öffnen.

Was dir sonst niemand sagt

Es driftet zwischen Einstellungen, nicht in ihnen. Das hier kostet es dich.

Jede Seite, die Figurenkonstanz verkauft, zeigt dir einen Clip, und innerhalb eines Clips ist das Problem fast gelöst. Die Aufgabe, die du wirklich hast, sind sechs Clips, die zusammengeschnitten werden, und das ist eine andere Messung — die unten, zwischen Videos statt innerhalb eines Videos genommen.

  1. 01Die Zahl zwischen den Einstellungen ist die echte

    Referenzgestützte Verfahren erreichen zwischen zwei Videos derselben Person 0,54–0,59 ArcFace-Ähnlichkeit. Innerhalb eines Clips liegen sie höher. Kalkulier mit dem Schnitt, nicht mit dem Take.

    0,54–0,59 zwischen Clips

  2. 02Ein frontales Standbild ist drei schrägen wert

    Ist das Referenzbild nicht frontal, fallen die Identitätswerte auf der stärksten veröffentlichten Grundlinie um mehr als 50 %. Wenn du einen guten Frame deiner Figur hast, ist das der, den du schickst — und du schickst ihn jedes Mal.

    >50 % Abfall bei nicht-frontaler Eingabe

  3. 03Die Grenzen sind 9 Bilder, 3 Clips, 3 Audio

    Zwölf Dateien insgesamt in einer Anfrage, und Audio muss mit einem Bild oder einem Video reisen statt allein. Diese Grenze ist die Zahl, die sich zu vergleichen lohnt: die meisten gehosteten Türen zu diesem Modell veröffentlichen ihre nicht.

    12 Dateien, eine Anfrage

  4. 04Benenn, was sich nicht ändern darf

    Die veröffentlichten Beispiele, die halten, zählen Merkmale einzeln auf — das halb gebundene Haar, die silberne Krone, die Jackenfarbe. Ein Merkmal, das du nicht genannt hast, ist ein Merkmal, das das Neuzeichnen frei auslegen darf, und meist tut es das bis Einstellung vier.

    Merkmale, einzeln aufgezählt

  5. 05Eine Szene ist eine Anfrage je Einstellung

    H3 rendert eine durchgehende Einstellung von 4–15 Sekunden. Eine Szene mit sechs Einstellungen sind sechs Anfragen zu je etwa $1.52 und ein Durchgang in deinem Schnittprogramm — grob $9 für die Szene, und das ist die Zahl, die du gegen ein Monatsabo für eine Identität halten solltest.

    6 Einstellungen ≈ $9

Quellen, damit du sie prüfen kannst: die Driftwerte innerhalb eines Clips sind die ArcFace-Spalte des Face Consistency Benchmark (echtes Video 0,0843, bestes gemessenes Modell 0,1734, schlechtestes 0,4843 — niedriger ist besser); die Werte zwischen Clips und der Abfall bei nicht-frontaler Eingabe stammen aus ContextAnyone und FaithfulFaces. Keine davon hat MiniMax H3 getestet, und wir haben den Benchmark nicht selbst gefahren — sie stehen hier, um das Problem zu bemessen, nicht um dieses Modell einzuordnen.

Warum das und keine Figurenbibliothek

Eine Figur ist ebenso sehr eine Stimme wie ein Gesicht

Frag irgendwen, der Kurzdramen schneidet. Die Hälfte der verworfenen Takes wird verworfen, weil das Gesicht hielt und der Vortrag nicht — und bei den meisten Werkzeugen ist die Stimme ein zweites Produkt, getrennt gekauft und von Hand synchronisiert.

  • Eine Anfrage, ein Durchgang

    Die Stimme kommt mit dem Gesicht zurück

    32 kHz Stereo entsteht neben dem Bild, und Audio darf eine deiner Referenzen sein — die Klangfarbe, die du anhängst, ist also die Klangfarbe, die die neue Zeile spricht. Kein Schritt für Lippensynchronität, kein getrenntes Abo für Stimmen.

  • Zwölf Dateien auf einmal

    Die ganze Besetzung passt in eine Anfrage

    Neun Bilder, drei Clips, drei Audiodateien, zwölf insgesamt. Ein Zweipersonenstück mit Kostümen und einer Location-Platte liegt gut darin, und deshalb hält der Vampir-Teaser oben zwei Menschen statt einem.

  • Nichts gespeichert

    Keine Identität zu trainieren und keine Miete dafür

    Hier gibt es keine Soul ID, keinen Figurenplatz und keine Gebühr je Identität — die Dateien liegen auf deiner Platte und gehen mit der Anfrage hoch. Das ist schlechter, wenn du eine ganze Riege willst; es ist besser, wenn du eine Figur und sechs Einstellungen hast.

  • Ein Satz, sechs Formate

    Das Hochformat kostet, was das Breitformat kostet

    21:9, 16:9, 4:3, 1:1, 3:4 und 9:16 werden alle zum selben Sekundensatz abgerechnet, weil die Vorstufe je Sekunde abrechnet und die Form ignoriert. Kurzdrama ist hochkant und kostet dafür nicht mehr.

Was du aufgibst

Eine Garantie. Das ist die ehrliche Grenze der ganzen Kategorie: eine Referenz lässt das Gesicht bei den meisten Takes als dieselbe Person lesen, und zwischen Einstellungen liegen die veröffentlichten Zahlen bei etwa 0,55 Ähnlichkeit, nicht bei 1. Wenn dein Ergebnis ein Gesicht braucht, das frame-genau stimmt — ein benannter Schauspieler, ein Markenbotschafter, ein rechtlich relevantes Abbild — besetz die Person und dreh sie. Generier die Einstellungen drumherum.

Aufgaben, die halten

Vier Figuraufgaben, die fünfzehn Sekunden überstehen

Vier verschiedene Aufgaben, vier Clips, die wirklich so gemacht wurden, und hinter jedem Knopf der Prompt, der sie gemacht hat. Jeder will eine eigene Datei von dir — das Abzeichen auf dem Clip sagt welche, und der Knopf öffnet die richtige Tür.

  • Konsistente Figur im KI-Video: Kinder rennen durch ein Sommerfeld, eines von ihnen durch einen Golden Retriever ersetzt und eine Jacke umgefärbt, alle anderen unberührt
    16:9 · 6 s · 2 Referenzbilder + 1 Referenzclip

    Eine ändern, den Rest behalten

    Zwei Änderungen in einem Satz: das Kind hinten wird zum Hund aus Bild 1, die linke Jacke bekommt eine andere Farbe. Sonst wird niemand im Bild erwähnt, und sonst ändert sich niemand. Das ist die Form einer Notiz, die du einem Cutter geben würdest, und es ist die Form, die H3 liest.

  • Konsistente Figur im KI-Video: eine Gestalt im passenden Anzug wird links neben eine Zweieraufnahme gesetzt und bewegt sich im Gleichschritt mit den anderen
    16:9 · 6 s · 1 Referenzclip

    Jemanden hinzufügen, der dorthin gehört

    Eine Zeile, und der Neuankömmling erbt die Uniform, den Gang und das Licht. Das Modell montiert keinen Ausschnitt hinein — es zeichnet die Einstellung mit einer Person mehr neu, deshalb landet der Schatten richtig und deshalb bekommst du die ursprünglichen Pixel nicht zurück.

  • Konsistente Figur im KI-Video: die männliche Hauptrolle eines Otome-Spiels in Lederjacke bewegt sich durch ein nächtliches Stadt-PV, ihr Design über jeden Schnitt unverändert
    16:9 · 15 s · 2 Referenzbilder

    Eine gezeichnete Figur, modelltreu gehalten

    Bei Illustration fällt Drift am stärksten auf, denn ein gezeichnetes Gesicht hat keinen fotografischen Spielraum zum Verstecken: der Augenabstand passt zum Modelsheet oder er passt nicht. Bild 2 ist eine strenge Referenz für die Identität, und der Rest des Prompts ist Kamera und Stimmung.

  • Konsistente Figur im KI-Video: ein hochkanter Kurzdrama-Streit in einem kleinen Restaurant, dieselben zwei Darsteller über den ganzen Wortwechsel gehalten
    9:16 · 15 s · 2 Referenzbilder

    Eine hochkante Szene mit fester Besetzung

    Kurzdrama ist die Aufgabe, für die es diese Seite gibt: Dutzende Einstellungen, dieselben zwei Gesichter, hochkant. Fünfzehn Sekunden sind eine Einstellung — die Besetzung ist das, was du an die nächste Anfrage neu anhängst, und geschnitten wird in deinem Schnittprogramm, nicht hier.

Alle vier sind die eigenen veröffentlichten Beispiele von MiniMax, gesammelt unter CC BY 4.0 — deshalb kann jeder Knopf den Prompt genau so laden, wie er gefahren wurde.

Was es wirklich kostet

Eine Szene mit sechs Einstellungen und einer Figur sind 414 Credits. Etwa $9.

Ein Clip sind pauschal 5 Credits für den Durchgang, der den Prompt versteht, dazu 8 Credits je 768P-Sekunde oder 13 je 2K-Sekunde. Referenzen sind gratis — neun Bilder anzuhängen kostet so viel wie keines. Ein Credit ist ein Cent des von MiniMax selbst veröffentlichten Listenpreises, das Ganze lässt sich also gegen eine Seite prüfen, die diese Website nicht kontrolliert. Eine Generierung, die scheitert, wird automatisch erstattet, und das zählt hier mehr als irgendwo sonst: ein Gesicht zu halten ist eine Aufgabe, die man wiederholt.

Was eine Figureinstellung kostet, nach Länge

Ein 4-s-Shot, 768P
37 Credits
Ein 8-s-Shot, 768P
69 Credits
Ein 15-s-Shot, 768P
125 Credits
Sechs 8-s-Shots, 768P
414 Credits
Ein 8-s-Shot, 2K
109 Credits
Sechs 8-s-Shots, 2K
654 Credits

Alle Preise · jede Grenze und jeder Satz, datiert · was eine 2K-Sekunde wirklich kostet

So oder so dieselben Credits im Monat

  • KostenlosOhne Karte

    Ein echter MiniMax-H3-Clip, mit Ton. Alles nach 4 s · 768P läuft auf Credits.

    $0für immer

    Zu keinem Zeitpunkt eine Kreditkarte

    Gratis los

    Nur Bot-Prüfung — keine E-Mail

    1 Clip auf MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · mit Ton
    7 Tage einchecken — 37 Credits, ein Clip mehr

    Jedes Paket ab $9.9 schaltet den MiniMax H3 KI-Videogenerator frei — jeder Modus, 768P und 2K

    • MiniMax H3 in nativem 2KNur bezahlt
    • Nativer Ton mit dem BildNur bezahlt
    • Ein Clip, ohne Karte
    • 1 Aufgabe gleichzeitig
    • Gescheiterte Clips kosten nichts
    • Private Generierung
    • Jedes Paket schaltet den MiniMax H3 KI-Videogenerator in jedem Modus frei

    Gratis ist eine andere Engine. Tarife ansehen

    Tempo & Queue

    Queue
    Gratis-Spur
    Gleichzeitig
    1
    Batch
    1
    Historie
    24 h · 7 Tage angemeldet
    Support
    Community
  • Lite30 % sparen

    Schalt den MiniMax H3 KI-Videogenerator in nativem 2K frei. Der kleinste bezahlte Tarif — Pro nehmen die meisten.

    $16.9/mo$24.9

    $202.8 jährlich abgerechnet · $96 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    750 Credits / Monat · ~20 Videos

    4 s · 768P · Text zu Video

    oder ~13 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • MiniMax H3 in nativem 2K — mit nativem Ton
    • Dialog, Effekte und Musik in derselben Datei
    • Bis 15 Sekunden15 s
    • ~20 Videos im Monat mit 4 s 768P, Text zu Video
    • Gescheiterte Clips kosten nichts
    • 7 Tage Rückerstattung bei ungenutzten Credits
    • 1 Aufgabe gleichzeitig
    • 2 Varianten eines Prompts im Batch

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Standard
    Gleichzeitig
    1
    Batch
    2
    Historie
    7 Tage
    Support
    E-Mail · 48 h
  • Für die meisten empfohlen
    Pro30 % sparen

    $32 mehr als Lite. ~47 Videos im Monat, derselbe MiniMax H3 KI-Videogenerator, schnellere Warteschlange.

    $39.9/mo$56.9

    $478.8 jährlich abgerechnet · $204 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    1.775 Credits / Monat · ~47 Videos

    4 s · 768P · Text zu Video

    oder ~31 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • Alles aus Lite
    • ~47 Videos im Monat mit 4 s 768P, Text zu Video
    • 3 gleichzeitig
    • Video zu Prompt
    • 4 Varianten eines Prompts im Batch
    • Historie 7 Tage
    • 7 Tage Rückerstattung bei ungenutzten Credits

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Schnell
    Gleichzeitig
    3
    Batch
    4
    Historie
    7 Tage
    Support
    E-Mail · 12 h
  • Studio30 % sparen

    Ein ganzer Monat Volumen, als Erster in der Reihe, und ein Mensch, der in 4 Stunden antwortet.

    $99.9/mo$142.9

    $1 198.8 jährlich abgerechnet · $516 im Jahr sparen

    7 Tage Rückerstattung · jederzeit kündbar

    4.425 Credits / Monat · ~119 Videos

    4 s · 768P · Text zu Video

    oder ~77 mit 4 s 2K

    Gleiche Credits, monatlich wie jährlich

    • Alles aus Pro
    • ~119 Videos im Monat mit 4 s 768P, Text zu Video
    • 8 gleichzeitig
    • 4 Varianten eines Prompts im Batch
    • Historie 7 Tage
    • Priorisierter Support in 4 Stunden
    • Niedrigster Verbrauch bei uns
    • 7 Tage Rückerstattung bei ungenutzten Credits

    Kommerzielle Nutzung enthalten — was das abdeckt

    Tempo & Queue

    Queue
    Priorität — als Erster in der Reihe
    Gleichzeitig
    8
    Batch
    4
    Historie
    7 Tage
    Support
    Priorität · 4 h

Darfst du es wirklich nutzen

Ja, kommerziell — und die Frage nach dem Abbild ist deine

Das ist die eine Seite dieser Website, auf der die entscheidenden Rechte nicht unsere sind. Ein Gesicht hochzuladen ist etwas anderes, als ein Logo hochzuladen, hier steht also die Position, bevor du etwas ausgibst.

  • KommerziellAuch der kostenlose. Kein Wasserzeichen in irgendeinem Tarif, keine Gebühr je Clip, keine gesondert zu kaufende Lizenz. MiniMax beansprucht keine Rechte an den Outputs, die du generierst, und diese Website fügt keine eigenen hinzu.
  • Ein fremdes GesichtDas ist der Punkt, auf den es hier ankommt. Nichts auf dieser Seite gibt dir Rechte am Abbild einer Person, und das Gesicht eines realen Menschen gehört nicht deshalb in deine Anzeige, weil du ein Foto davon hattest. Hol dieselbe Freigabe, die du für einen Dreh holen würdest.
  • Deine eigenen LeuteEin Referenz-Standbild von jemandem, der zugestimmt hat, bleibt deins. Der Upload wird benutzt, um deine Anfrage zu fahren; was zurückkommt, darfst du senden, und dieselbe Rechteklärung wie bei echtem Material gilt.
  • Was abgelehnt wirdDrastische Gewalt und sexuelle Inhalte werden am Eingang abgelehnt, bevor eine Sekunde berechnet wird, und ebenso Material, das eine generierte Person als reale Person des öffentlichen Lebens ausgeben soll. Diese Prüfung läuft auf dem Prompt und auf dem, was du anhängst.

Verantwortungsvolle Nutzung

Bevor du etwas ausgibst

FAQ zur konsistenten Figur im KI-Video

Die acht Fragen, die Leute stellen, bevor sie eine Figur in eine Szene stecken, beantwortet mit den Zahlen dahinter.

Ist dieser Generator für konsistente Figuren kostenlos?

Der erste Clip ist es, und es ist das echte Modell — 4 Sekunden, 768P, mit Ton, ohne Wasserzeichen, ohne Karte, und er verfällt nie. Alles auf dieser Seite läuft ganz ohne Konto. Danach kostet eine 8-Sekunden-Einstellung in 768P 69 Credits und eine mit 15 Sekunden 125; Credits beginnen bei $9.9, was eine Szene mit sechs Einstellungen bei etwa $9 landen lässt. Eine Generierung, die scheitert, kostet dich nichts.

Sieht die Figur in jeder Einstellung wirklich gleich aus?

Sie wird als dieselbe Person gelesen, ja, bei den meisten Takes. Frame-identisch nein — und kein Werkzeug dieser Kategorie liefert das. Veröffentlichte Messungen setzen die referenzgestützte Identitätsähnlichkeit zwischen zwei Clips bei rund 0,54–0,59 an, gegen eine weit engere Grundlinie bei echtem Material. Rechne damit, vier von sechs Takes zu behalten, und damit, dieselben Referenzen bei jeder Anfrage neu anzuhängen.

Wie viele Referenzdateien kann ich anhängen?

Bis zu 9 Bilder, 3 Videoclips und 3 Audiodateien, 12 Dateien insgesamt in einer Anfrage. Audio muss mit einem Bild oder einem Clip reisen statt allein. Referenzen anzuhängen kostet nichts extra — bezahlt werden die Sekunden, die du renderst.

Fotos oder ein Videoclip — was hält eine Figur besser?

Sie halten Verschiedenes. Ein Standbild ist das stärkste Signal für Gesicht und Kostüm; ein Clip trägt Gang, Timing und Kamera. Nimm beides und sag im Prompt, was was ist. Hast du nur eine Datei, mach sie zu einem sauberen frontalen Standbild: bei nicht-frontaler Eingabe fallen gemessene Identitätswerte um mehr als die Hälfte.

Kann die Figur dieselbe Stimme behalten?

Ja — häng Audio als Referenz an, und H3 spricht deine neue Zeile in dieser Klangfarbe, im selben Durchgang wie das Bild generiert statt hinterher darübergelegt. Es ist eine Klangfarbenreferenz und keine geklonte Stimme, die du einlagern kannst, und sie braucht ein Bild oder einen Clip daneben.

Wie unterscheidet sich das von einer Soul ID oder einer Figurenbibliothek?

Die speichern eine Identität für dich und verlangen ein Abo für die Riege — bei Higgsfield zum Beispiel $15 bis $129 im Monat. Hier wird nichts gespeichert: deine Dateien gehen mit jeder Anfrage hoch, und du bezahlst Sekunden. Schlechter, wenn du zwanzig Figuren verwaltest, besser, wenn du eine hast und sechs Einstellungen machen musst.

Kann ich eine ganze Szene in einem Durchgang machen?

Nein. H3 rendert eine durchgehende Einstellung von 4 bis 15 ganzen Sekunden bei 24 fps, eine Szene ist also eine Anfrage je Einstellung, und geschnitten wird in deinem Schnittprogramm. Längen landen auf einem Raster von 17n+5 Frames, und das macht 192 Frames — genau 8,000 Sekunden — zur einzigen ganzen Sekunde im Bereich und zu der, die du nimmst, wenn deine Einstellungen auf Musik schneiden müssen.

Darf ich das Gesicht einer Person als Referenz nehmen?

Nur wenn du das Recht dazu hast. Nichts hier gibt dir Rechte am Abbild einer Person, und eine reale Person des öffentlichen Lebens zu generieren wird am Eingang abgelehnt. Für deine eigenen Darsteller hol dieselbe Freigabe, die du für einen Dreh holen würdest; was zurückkommt, darfst du dann kommerziell nutzen, in jedem Tarif, den kostenlosen eingeschlossen.

Hör auf, deine Figur zu beschreiben. Besetz sie.

Ein Standbild, ein Satz darüber, wofür jede Datei da ist, und in etwa neunzig Sekunden eine Einstellung zurück. Deine erste ist gratis — ohne Karte, ohne Wasserzeichen, und sie gehört dir, auch kommerziell.

Gratis registrieren · 1 Clip auf MiniMax H3

Geschrieben und gepflegt vom Redaktionsteam von MiniMax H3 AI Video GeneratorVeröffentlicht am Zuletzt aktualisiert am Tool-Version 2026.09.4