Vídeo com personagem consistente

Nenhum modelo de vídeo lembra do seu personagem entre uma requisição e outra, e os que dizem que lembram estão guardando o arquivo e devolvendo ele. Então pule a identidade que você teria de treinar antes: anexe as imagens, o clipe e a voz ao plano que você está pedindo, até doze arquivos numa requisição.
O seu primeiro é grátis. Sem cartão.

Escreva o próximo plano

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • Dê um arquivo ao personagem, não um adjetivo — uma imagem frontal limpa ganha de um parágrafo de descrição sempre
  • Diga para que serve cada arquivo: este é o rosto, este é o movimento, este é a voz
  • Nomeie os traços que não podem mudar — o cabelo, a jaqueta, a cicatriz. O que não for nomeado está liberado
  • Uma cena é uma requisição por plano, e as mesmas referências voltam a cada vez

Sem cartão: todo clipe desta página toca sem conta, e uma conta grátis roda um seu — 4 s, 768P, com som, sem marca d'água, seu para baixar e para usar comercialmente.

Quatro jeitos de segurar um personagem, dos exemplos publicados pela própria MiniMax. Cada card abre o prompt completo.

Vídeo com personagem consistente feito com IA: um casal na pia da cozinha joga espuma de detergente um no outro, o rosto dela vindo de uma imagem e o tempo dela de um clipe de referência separado

O rosto é uma imagem, a atuação é um clipe

Prompt entra, elenco sai

O prompt à esquerda. O que ele devolveu à direita.

O rosto é uma imagem, a atuação é um clipe16:9 · 15s · 1 imagem de referência + 1 clipe de referência

Dois arquivos, dois trabalhos. A imagem diz quem é esta pessoa; o clipe diz como ela se move, em que velocidade, com que tempo. Nenhum dos dois faz o trabalho do outro — e o prompt nomeia qual arquivo responde a qual pergunta antes de descrever uma única ação.

The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.

Vídeo com personagem consistente feito com IA: um casal na pia da cozinha joga espuma de detergente um no outro, o rosto dela vindo de uma imagem e o tempo dela de um clipe de referência separado
Um personagem segurado por quinze segundos16:9 · 15s · 2 imagens de referência

Leia a primeira oração: use a Imagem 2 como referência fixa de personagem, e depois quatro traços nomeados um a um — o cabelo preto meio preso, a coroa prateada vazada, a veste, a paleta. Essa lista é o truque inteiro. Traços que você não nomeia são traços que o modelo pode redesenhar à vontade.

Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.

Vídeo com personagem consistente feito com IA: uma heroína xianxia de vestes brancas com uma coroa prateada atravessa uma sequência na neve, o figurino inalterado de um plano para o outro
Dois protagonistas9:16 · 15s · 2 imagens de referência

Um elenco, não um personagem. O prompt fixa os dois protagonistas às imagens de referência deles antes de escrever uma única batida, porque uma cena com duas pessoas são duas identidades que podem derivar de forma independente — e a que você não fixou é a que se mexe.

Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.

Vídeo com personagem consistente feito com IA: um teaser vertical de romance de vampiros segurando os mesmos dois protagonistas numa porta, num corredor e num plano fechado de dois
Elenco novo, mesma coreografia16:9 · 6s · 1 clipe de referência

A identidade que está sendo segurada aqui não é um rosto — é uma coreografia. Três homens de terno viram três capivaras, e cada batida de uma sequência de solo de nove movimentos sobrevive à troca porque quem carrega o tempo é o clipe, não a frase.

Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.

Vídeo com personagem consistente feito com IA: três capivaras de terno executam uma coreografia de solo complexa, seguindo o movimento dos três homens do clipe de referência com exatidão

O que isto é, e o que não é

Nada aqui lembra do seu personagem. É esse o problema inteiro, e o método inteiro.

Esta parte vem primeiro, porque ela decide se você deveria estar aqui. Todo produto que vende consistência de personagem te vende uma identidade guardada — a Higgsfield treina um Soul ID, a Vidu guarda um conjunto de referências, a Runway ancora uma sessão. O que fica guardado é um arquivo, e o que acontece na hora de gerar é que o arquivo é anexado à sua requisição.
Então a pergunta não é se uma ferramenta lembra. É quantos arquivos ela aceita de uma vez, e quanto você está pagando para guardar eles em algum lugar.

As medições são duras com todo mundo, o que vale saber antes de orçar. No Face Consistency Benchmark, um rosto dentro de um único clipe de texto para vídeo deriva de 2,1× a 5,7× mais que a mesma medição em filmagem real — 0,0843 de distância de cosseno ArcFace para vídeo real contra 0,1734 para o melhor modelo medido e 0,4843 para o pior. Entre dois clipes diferentes fica mais difícil, não mais fácil: os métodos condicionados por referência na comparação do ContextAnyone chegam só a 0,54–0,59 de similaridade ArcFace entre vídeos.
Uma imagem de referência é a maior alavanca que existe, e não é uma trava. O que ela te compra é um rosto que o espectador lê como a mesma pessoa, na maior parte das tomadas, pelo preço de uma tomada.

Um mês, por uma identidade guardada
$15–$129

Um mês, por uma identidade guardada

Por tentativa em outro lugar, por duração
$0.45–$2.00

Por tentativa em outro lugar, por duração

Imagens, clipes e áudio numa requisição
9 · 3 · 3

Imagens, clipes e áudio numa requisição

Um plano de 8 s aqui, com som
~$1.52

Um plano de 8 s aqui, com som

  • Sem identidade para treinar antes do primeiro plano
  • Sem biblioteca de personagens para continuar pagando aluguel
  • Sem passagem separada de sincronização labial para comprar
  • Sem marca d'água para explicar, em nenhum plano

O que você põe

Quatro jeitos de dizer quem é esta pessoa

A única coisa que importa: o modelo re-renderiza cada pixel, inclusive o rosto. Ele nunca cola a sua referência dentro. Então o trabalho de cada arquivo abaixo é restringir um redesenho, não fornecer um ativo.

  • Imagens do personagem

    Até nove. Uma frontal limpa vale mais que três ângulos ruins — medido em entrada de referência não frontal, as notas de identidade caem mais da metade. Acrescente o figurino e o adereço como imagens próprias.

    Sinal mais forte · até 9 imagens
  • Um clipe em que ela já está

    Até três. Um vídeo carrega o que uma imagem não consegue — o andar, o tempo, o jeito de segurar uma pausa, um trajeto de câmera. Dois dos quatro exemplos desta página tiram a atuação de um.

    Movimento e ritmo · até 3 clipes
  • A voz dela

    Até três arquivos de áudio, e identidade é uma voz tanto quanto é um rosto. O H3 referencia o timbre e fala a sua nova fala nele, na mesma passagem que a imagem. O áudio tem de viajar junto com uma imagem ou um clipe.

    Timbre, não um clone · até 3 áudios
  • Nada além de uma descrição

    Funciona dentro de um plano e para de funcionar entre eles. Escreva uma vez, gere o personagem, aí guarde o quadro de que você gostou e use ele como referência para tudo o que vier depois.

    Um plano só · texto para vídeo

Os quatro rodam o mesmo modelo por uma taxa só — 8 créditos por segundo em 768P, 13 em 2K, mais 5 pelo clipe. As referências não custam nada a mais. Todo limite e toda taxa, com a data em que cada um mudou.

Do início ao fim

Como segurar um personagem em quatro passos

A ordem importa mais aqui que em qualquer outra página deste site, porque um elenco que você não fixou no plano um é um elenco que você não recupera no plano seis.

  1. Um personagem xianxia de vestes brancas, o quadro que vira a imagem de referência

    Escale antes de escrever

    Escolha os quadros que vão ser o personagem, e escolha como quem faz um casting: uma frontal limpa, uma de três quartos, o figurino, o adereço. Só com entrada não frontal, as notas de identidade medidas caem mais da metade — então a frontal não é uma preferência, é o arquivo que sustenta a carga.

    Até 9 imagensUma frontal limpa
  2. Um plano de dois na cozinha cujos rostos vieram de uma imagem e cujo tempo veio de um clipe

    Dê um trabalho a cada arquivo na frase

    O H3 lê o prompt com um modelo de linguagem, então dá para dizer a ele qual arquivo responde a qual pergunta. Image 1 is the character; Video 1 is the action and the rhythm é uma frase que funciona. Anexar quatro arquivos e descrever uma cena não é.

    Nomeie o arquivoNomeie o trabalho dele
  3. Dois protagonistas num teaser vertical, segurados por cima de um corte

    A aparência do protagonista e da protagonista segue estritamente as imagens de referência… as vozes deles seguem o timbre do áudio de referência.

    ImagemSom

    Leve o elenco para o próximo plano

    Nada é lembrado entre requisições. O plano dois leva as mesmas referências do plano um, mais — e é essa a parte que as pessoas pulam — um quadro que você guardou do plano um. A saída do último plano é a melhor referência que você vai ter para o próximo.

    Reanexe toda vezGuarde um quadro
  4. Um protagonista desenhado em close, a tomada pronta
    Faixa de áudio · 32 kHzSHOT-01.MP4

    Rascunhe em 768P, masterize o escolhido em 2K

    Um segundo em 768P são 8 créditos contra 13 em 2K, e subir um clipe 768P pronto depois custa exatamente o que custaria renderizar em 2K — então as seis tomadas que levam para acertar um rosto te custam menos. Uma geração que falha é reembolsada automaticamente.

    768P · 8 créditos por segundo2K · 13 créditos por segundo

Quatro passos, nada para instalar, sem cartão. Abrir o gerador.

O que ninguém te conta

Ele deriva entre os planos, não dentro deles. E aqui está quanto isso te custa.

Toda página que vende consistência de personagem te mostra um clipe, e dentro de um clipe o problema está quase resolvido. O trabalho que você de fato tem são seis clipes que cortam juntos, e isso é outra medição — a de baixo, feita entre vídeos e não dentro deles.

  1. 01O número entre planos é o que vale

    Métodos condicionados por referência marcam 0,54–0,59 de similaridade ArcFace entre dois vídeos da mesma pessoa. Dentro de um clipe eles marcam mais. Faça o orçamento pelo corte, não pela tomada.

    0,54–0,59 entre clipes

  2. 02Uma frontal vale por três anguladas

    Quando a imagem de referência não é frontal, as notas de identidade na linha de base publicada mais forte caem mais de 50%. Se você tem um bom quadro do seu personagem, é esse que você manda — e manda toda vez.

    queda >50% com entrada não frontal

  3. 03Os tetos são 9 imagens, 3 clipes, 3 áudios

    Doze arquivos no total numa requisição, e o áudio tem de viajar com uma imagem ou um vídeo em vez de sozinho. Esse teto é o número que vale comparar: a maior parte das portas hospedadas para este modelo não publica o delas.

    12 arquivos, uma requisição

  4. 04Nomeie o que não pode mudar

    Os exemplos publicados que se seguram listam os traços um a um — o cabelo meio preso, a coroa prateada, a cor da jaqueta. Um traço que você não nomeou é um traço que o redesenho pode reinterpretar, e normalmente reinterpreta lá pelo quarto plano.

    traços, item a item

  5. 05Uma cena é uma requisição por plano

    O H3 renderiza um plano contínuo de 4–15 segundos. Uma cena de seis planos são seis requisições a uns $1.52 cada e uma passada no seu editor — uns $9 pela cena, que é o número para pesar contra uma assinatura mensal de identidade.

    6 planos ≈ $9

Fontes, para você conferir: os números de deriva dentro do clipe são a coluna ArcFace do Face Consistency Benchmark (vídeo real 0,0843, melhor modelo medido 0,1734, pior 0,4843 — menor é melhor); os números entre clipes e a queda com entrada não frontal vêm do ContextAnyone e do FaithfulFaces. Nenhum deles testou o MiniMax H3, e nós não rodamos o benchmark — eles estão aqui para dimensionar o problema, não para ranquear este modelo.

Por que isto e não uma biblioteca

Um personagem é uma voz tanto quanto é um rosto

Pergunte a qualquer um que monta drama curto. Metade das tomadas que são jogadas fora vão embora porque o rosto se segurou e a entrega não — e na maior parte das ferramentas a voz é um segundo produto, comprado à parte e sincronizado na mão.

  • Uma requisição, uma passagem

    A voz volta junto com o rosto

    32 kHz estéreo é gerado junto com a imagem, e o áudio pode ser uma das suas referências — então o timbre que você anexa é o timbre que fala a nova fala. Sem etapa de sincronização labial, sem assinatura de voz separada.

  • Doze arquivos de uma vez

    O elenco inteiro cabe numa requisição

    Nove imagens, três clipes, três arquivos de áudio, doze no total. Uma cena de duas pessoas com figurinos e uma imagem de locação cabe bem dentro disso, e é por isso que o teaser de vampiros acima segura duas pessoas em vez de uma.

  • Nada guardado

    Sem identidade para treinar e sem aluguel sobre ela

    Aqui não tem Soul ID, não tem vaga de personagem e não tem taxa por identidade — os arquivos moram no seu disco e sobem junto com a requisição. É pior se você quer um elenco inteiro; é melhor se você tem um personagem e seis planos.

  • Uma taxa, seis formatos

    O vertical custa o que o largo custa

    21:9, 16:9, 4:3, 1:1, 3:4 e 9:16 são todos cobrados pela mesma taxa por segundo, porque o fornecedor cobra por segundo e ignora o formato. Drama curto é vertical e não custa mais por isso.

O que você abre mão

De uma garantia. Este é o limite honesto da categoria inteira: uma referência faz o rosto se ler como a mesma pessoa na maior parte das tomadas, e entre planos os números publicados ficam perto de 0,55 de similaridade, não perto de 1. Se a sua entrega precisa de um rosto exato quadro a quadro — um ator conhecido, um porta-voz de marca, uma imagem com valor jurídico — escale a pessoa e filme. Gere os planos em volta dela.

Trabalhos que voltam bem

Quatro trabalhos de personagem que sobrevivem a quinze segundos

Quatro trabalhos diferentes, quatro clipes que foram feitos assim de verdade, e atrás de cada botão o prompt que fez cada um. Todos querem um arquivo seu — o selo do clipe diz qual, e o botão abre a porta certa.

  • Vídeo com personagem consistente feito com IA: crianças correm por um campo de verão, uma delas substituída por um golden retriever e uma jaqueta recolorida, todo o resto intocado
    16:9 · 6s · 2 imagens de referência + 1 clipe de referência

    Troque um deles, mantenha o resto

    Duas edições numa frase: a criança do fundo vira o cachorro da Imagem 1, a jaqueta mais à esquerda muda de cor. Ninguém mais no quadro é mencionado, e ninguém mais muda. É esse o formato de um recado que você daria a um editor, e é esse o formato que o H3 lê.

  • Vídeo com personagem consistente feito com IA: uma figura num terno igual é acrescentada à esquerda de um plano de duas pessoas, andando no mesmo passo
    16:9 · 6s · 1 clipe de referência

    Acrescente alguém que pertence ali

    Uma linha, e quem chega herda o uniforme, o andar e a luz. O modelo não está compondo um recorte por cima — ele está redesenhando o plano com mais uma pessoa dentro, e é por isso que a sombra cai certo e por isso que você não recupera os pixels originais.

  • Vídeo com personagem consistente feito com IA: um protagonista de jogo otome de jaqueta de couro atravessa um PV de cidade à noite, o design dele inalterado em todo corte
    16:9 · 15s · 2 imagens de referência

    Um personagem desenhado, fiel ao model sheet

    A ilustração é onde a deriva mais aparece, porque um rosto desenhado não tem a folga fotográfica para se esconder: o espaçamento dos olhos ou bate com o model sheet ou não bate. A Imagem 2 é referência estrita de identidade, e o resto do prompt é câmera e clima.

  • Vídeo com personagem consistente feito com IA: uma discussão de drama curto vertical dentro de um restaurante pequeno, os mesmos dois intérpretes segurados durante a troca
    9:16 · 15s · 2 imagens de referência

    Uma cena vertical com elenco fixo

    Drama curto é o trabalho para o qual esta página existe: dezenas de planos, os mesmos dois rostos, vertical. Quinze segundos são um plano — o elenco é o que você reanexa na próxima requisição, e a montagem acontece no seu editor, não aqui.

Os quatro são exemplos publicados pela própria MiniMax, reunidos sob CC BY 4.0 — e é por isso que cada botão consegue carregar o prompt exatamente como ele foi rodado.

Quanto custa de verdade

Uma cena de seis planos com um personagem são 414 créditos. Uns $9.

Um clipe são 5 créditos fixos pela passagem que entende o prompt, mais 8 créditos por segundo em 768P ou 13 por segundo em 2K. As referências são de graça — anexar nove imagens custa o mesmo que não anexar nenhuma. Um crédito é um centavo do preço de tabela publicado pela própria MiniMax, então dá para conferir a coisa inteira contra uma página que este site não controla. Uma geração que falha é reembolsada automaticamente, o que importa mais aqui que em qualquer lugar: segurar um rosto é um trabalho que se repete.

Quanto custa um plano de personagem, por duração

Um plano de 4 s, 768P
37 créditos
Um plano de 8 s, 768P
69 créditos
Um plano de 15 s, 768P
125 créditos
Seis planos de 8 s, 768P
414 créditos
Um plano de 8 s, 2K
109 créditos
Seis de 8 s, 2K
654 créditos

Preços completos · todo limite e toda taxa, com data · quanto custa de verdade um segundo em 2K

Os mesmos créditos mensais dos dois jeitos

  • GrátisSem cartão

    Um clipe real do MiniMax H3, com som. Tudo acima de 4 s · 768P roda com créditos.

    $0para sempre

    Nenhum cartão de crédito em momento nenhum

    Começar

    Só a verificação antibô — sem e-mail

    1 clipe no MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · com som
    Faça check-in por 7 dias — 37 créditos, mais um clipe

    Qualquer pacote a partir de US$ 9,90 libera o gerador de vídeo com IA MiniMax H3 — todos os modos, 768P e 2K

    • MiniMax H3 em 2K nativoSó pago
    • Áudio nativo junto com a imagemSó pago
    • Um clipe, sem cartão
    • 1 clipe por vez
    • Clipes que falham não custam nada
    • Geração privada
    • Qualquer pacote libera o gerador de vídeo com IA MiniMax H3 em todos os modos

    O grátis roda em outro motor. Ver planos

    Velocidade e fila

    Fila
    Via grátis
    Simultâneas
    1
    Lote
    1
    Histórico
    24 h · 7 dias com conta
    Suporte
    Comunidade
  • Lite-30%

    Libere o gerador de vídeo com IA MiniMax H3 em 2K nativo. O menor plano pago — o Pro é o que a maioria escolhe.

    $16.9/mo$24.9

    US$ 202,80 cobrados por ano · Economize US$ 96 por ano

    Reembolso em 7 dias · cancele quando quiser

    750 créditos / mês · ~20 vídeos

    4 s · 768P · texto para vídeo

    ou ~13 a 4 s em 2K

    Os mesmos créditos no mensal ou no anual

    • MiniMax H3 em 2K nativo — com áudio nativo
    • Diálogo, efeitos e música no mesmo arquivo
    • Até 15 segundos15 s
    • ~20 vídeos por mês a 4 s em 768P, texto para vídeo
    • Clipes que falham não custam nada
    • Reembolso em 7 dias, créditos sem uso
    • 1 tarefa por vez
    • Lote de 2 variações de um prompt

    Uso comercial incluído — o que isso cobre

    Velocidade e fila

    Fila
    Padrão
    Simultâneas
    1
    Lote
    2
    Histórico
    7 dias
    Suporte
    E-mail · 48 h
  • Recomendado para a maioria
    Pro-30%

    US$ 32 a mais que o Lite. ~47 vídeos por mês, o mesmo gerador de vídeo com IA MiniMax H3, fila mais rápida.

    $39.9/mo$56.9

    US$ 478,80 cobrados por ano · Economize US$ 204 por ano

    Reembolso em 7 dias · cancele quando quiser

    1.775 créditos / mês · ~47 vídeos

    4 s · 768P · texto para vídeo

    ou ~31 a 4 s em 2K

    Os mesmos créditos no mensal ou no anual

    • Tudo do Lite
    • ~47 vídeos por mês a 4 s em 768P, texto para vídeo
    • 3 tarefas por vez
    • Vídeo para prompt
    • Lote de 4 variações de um prompt
    • Histórico guardado por 7 dias
    • Reembolso em 7 dias, créditos sem uso

    Uso comercial incluído — o que isso cobre

    Velocidade e fila

    Fila
    Rápida
    Simultâneas
    3
    Lote
    4
    Histórico
    7 dias
    Suporte
    E-mail · 12 h
  • Studio-30%

    Um mês inteiro de volume, primeiro da fila, e uma pessoa que responde em 4 horas.

    $99.9/mo$142.9

    US$ 1.198,80 cobrados por ano · Economize US$ 516 por ano

    Reembolso em 7 dias · cancele quando quiser

    4.425 créditos / mês · ~119 vídeos

    4 s · 768P · texto para vídeo

    ou ~77 a 4 s em 2K

    Os mesmos créditos no mensal ou no anual

    • Tudo do Pro
    • ~119 vídeos por mês a 4 s em 768P, texto para vídeo
    • 8 tarefas por vez
    • Lote de 4 variações de um prompt
    • Histórico guardado por 7 dias
    • Suporte prioritário em 4 horas
    • O menor consumo de crédito daqui
    • Reembolso em 7 dias, créditos sem uso

    Uso comercial incluído — o que isso cobre

    Velocidade e fila

    Fila
    Prioritária — primeiro da fila
    Simultâneas
    8
    Lote
    4
    Histórico
    7 dias
    Suporte
    Prioritário · 4 h

Dá para rodar de verdade?

Dá, comercialmente — e a questão da imagem é sua

Esta é a única página deste site em que os direitos que importam não são os nossos. Enviar um rosto é diferente de enviar um logo, então aqui está a posição antes de você gastar qualquer coisa.

  • Uso comercialO grátis também. Sem marca d'água em nenhum plano, sem royalty por clipe, sem licença separada para comprar. A MiniMax não reivindica direito nenhum sobre as saídas que você gera, e este site não acrescenta nenhum dele próprio.
  • Um rosto que não é seuA que importa aqui. Nada nesta página te dá direitos sobre a imagem de alguém, e o rosto de uma pessoa real não é seu para pôr num anúncio só porque você tinha uma foto dele. Consiga a autorização que você conseguiria para uma filmagem.
  • Os seus próprios intérpretesUma imagem de referência de alguém que concordou continua sendo sua. O envio é usado para rodar a sua requisição; o que volta é seu para veicular, e vale a mesma liberação que você faria com filmagem.
  • O que é recusadoViolência gráfica e conteúdo sexual são recusados na porta de entrada antes de um segundo ser cobrado, e material feito para passar uma pessoa gerada por uma figura pública real também. Essa checagem roda no prompt e no que você anexa.

Uso responsável, completo

Antes de gastar qualquer coisa

Perguntas frequentes sobre personagem consistente em vídeo com IA

As oito perguntas que as pessoas fazem antes de comprometer um personagem com uma cena, respondidas com os números por trás.

Este gerador de vídeo com personagem consistente é grátis?

O primeiro clipe é, e é o modelo de verdade — 4 segundos, 768P, com som, sem marca d'água, sem cartão, e ele nunca expira. Tudo nesta página toca sem conta nenhuma. Depois disso um plano de 8 segundos em 768P são 69 créditos e um de 15 segundos são 125; os créditos começam em $9.9, o que põe uma cena de seis planos em uns $9. Uma geração que falha não te custa nada.

O personagem vai ficar mesmo igual em todo plano?

Vai se ler como a mesma pessoa, sim, na maior parte das tomadas. Idêntico quadro a quadro, não — e nenhuma ferramenta desta categoria entrega isso. Medições publicadas põem a similaridade de identidade condicionada por referência entre dois clipes em algo como 0,54–0,59, contra uma linha de base de filmagem real bem mais apertada. Conte em guardar quatro tomadas de seis, e em reanexar as mesmas referências a cada requisição.

Quantos arquivos de referência eu posso anexar?

Até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio, 12 arquivos no total numa requisição. O áudio tem de viajar com uma imagem ou um clipe em vez de sozinho. Anexar referências não custa nada a mais — o preço são os segundos que você renderiza.

Fotos ou um clipe de vídeo — o que segura melhor um personagem?

Eles seguram coisas diferentes. Uma imagem é o sinal mais forte para o rosto e o figurino; um clipe carrega andar, tempo e câmera. Use os dois e diga qual é qual no prompt. Se você só tem um arquivo, que seja uma frontal limpa: com entrada não frontal, as notas de identidade medidas caem mais da metade.

O personagem consegue manter a mesma voz?

Consegue — anexe áudio como referência e o H3 fala a sua nova fala naquele timbre, gerado na mesma passagem que a imagem em vez de dublado depois. É uma referência de timbre, não uma voz clonada que você guarda, e ela precisa de uma imagem ou um clipe do lado.

Qual a diferença disto para um Soul ID ou uma biblioteca de personagens?

Aqueles guardam uma identidade para você e cobram uma assinatura pelo elenco — de $15 a $129 por mês na Higgsfield, por exemplo. Aqui não tem nada guardado: os seus arquivos sobem a cada requisição e você paga por segundos. Pior se você está gerenciando vinte personagens, melhor se você tem um e seis planos para fazer.

Dá para fazer uma cena inteira de uma vez?

Não. O H3 renderiza um plano contínuo de 4 a 15 segundos inteiros a 24 fps, então uma cena é uma requisição por plano e a montagem acontece no seu editor. As durações caem numa grade de 17n+5 quadros, o que faz de 192 quadros — exatamente 8,000 segundos — o único segundo inteiro da faixa e o que usar se os seus planos precisam cortar na música.

Dá para usar o rosto de alguém como referência?

Só se você tiver o direito. Nada aqui te dá direitos sobre a imagem de uma pessoa, e gerar uma figura pública real é recusado na porta de entrada. Para os seus próprios intérpretes, consiga a mesma autorização que você conseguiria para uma filmagem; o que volta é então seu para usar comercialmente, em todo plano inclusive o grátis.

Pare de descrever o seu personagem. Escale ele.

Uma imagem, uma frase sobre para que serve cada arquivo, e um plano de volta em uns noventa segundos. O seu primeiro é grátis — sem cartão, sem marca d'água, e ele é seu para usar comercialmente.

Crie a conta de graça · 1 clipe no MiniMax H3

Escrito e mantido pela equipe editorial do MiniMax H3 AI Video GeneratorPublicado em Atualizado em Versão da ferramenta 2026.09.4