Nenhum modelo de vídeo lembra do seu personagem entre uma requisição e outra, e os que dizem que lembram estão guardando o arquivo e devolvendo ele. Então pule a identidade que você teria de treinar antes: anexe as imagens, o clipe e a voz ao plano que você está pedindo, até doze arquivos numa requisição. O seu primeiro é grátis. Sem cartão.
Quatro jeitos de segurar um personagem, dos exemplos publicados pela própria MiniMax. Cada card abre o prompt completo.
O rosto é uma imagem, a atuação é um clipe
Prompt entra, elenco sai
O prompt à esquerda. O que ele devolveu à direita.
O rosto é uma imagem, a atuação é um clipe16:9 · 15s · 1 imagem de referência + 1 clipe de referência
Dois arquivos, dois trabalhos. A imagem diz quem é esta pessoa; o clipe diz como ela se move, em que velocidade, com que tempo. Nenhum dos dois faz o trabalho do outro — e o prompt nomeia qual arquivo responde a qual pergunta antes de descrever uma única ação.
The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.
Um personagem segurado por quinze segundos16:9 · 15s · 2 imagens de referência
Leia a primeira oração: use a Imagem 2 como referência fixa de personagem, e depois quatro traços nomeados um a um — o cabelo preto meio preso, a coroa prateada vazada, a veste, a paleta. Essa lista é o truque inteiro. Traços que você não nomeia são traços que o modelo pode redesenhar à vontade.
Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.
Dois protagonistas9:16 · 15s · 2 imagens de referência
Um elenco, não um personagem. O prompt fixa os dois protagonistas às imagens de referência deles antes de escrever uma única batida, porque uma cena com duas pessoas são duas identidades que podem derivar de forma independente — e a que você não fixou é a que se mexe.
Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.
Elenco novo, mesma coreografia16:9 · 6s · 1 clipe de referência
A identidade que está sendo segurada aqui não é um rosto — é uma coreografia. Três homens de terno viram três capivaras, e cada batida de uma sequência de solo de nove movimentos sobrevive à troca porque quem carrega o tempo é o clipe, não a frase.
Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.
O que isto é, e o que não é
Nada aqui lembra do seu personagem. É esse o problema inteiro, e o método inteiro.
Esta parte vem primeiro, porque ela decide se você deveria estar aqui. Todo produto que vende consistência de personagem te vende uma identidade guardada — a Higgsfield treina um Soul ID, a Vidu guarda um conjunto de referências, a Runway ancora uma sessão. O que fica guardado é um arquivo, e o que acontece na hora de gerar é que o arquivo é anexado à sua requisição. Então a pergunta não é se uma ferramenta lembra. É quantos arquivos ela aceita de uma vez, e quanto você está pagando para guardar eles em algum lugar.
As medições são duras com todo mundo, o que vale saber antes de orçar. No Face Consistency Benchmark, um rosto dentro de um único clipe de texto para vídeo deriva de 2,1× a 5,7× mais que a mesma medição em filmagem real — 0,0843 de distância de cosseno ArcFace para vídeo real contra 0,1734 para o melhor modelo medido e 0,4843 para o pior. Entre dois clipes diferentes fica mais difícil, não mais fácil: os métodos condicionados por referência na comparação do ContextAnyone chegam só a 0,54–0,59 de similaridade ArcFace entre vídeos. Uma imagem de referência é a maior alavanca que existe, e não é uma trava. O que ela te compra é um rosto que o espectador lê como a mesma pessoa, na maior parte das tomadas, pelo preço de uma tomada.
Um mês, por uma identidade guardada
$15–$129
Um mês, por uma identidade guardada
Por tentativa em outro lugar, por duração
$0.45–$2.00
Por tentativa em outro lugar, por duração
Imagens, clipes e áudio numa requisição
9 · 3 · 3
Imagens, clipes e áudio numa requisição
Um plano de 8 s aqui, com som
~$1.52
Um plano de 8 s aqui, com som
Sem identidade para treinar antes do primeiro plano
Sem biblioteca de personagens para continuar pagando aluguel
Sem passagem separada de sincronização labial para comprar
Sem marca d'água para explicar, em nenhum plano
O que você põe
Quatro jeitos de dizer quem é esta pessoa
A única coisa que importa: o modelo re-renderiza cada pixel, inclusive o rosto. Ele nunca cola a sua referência dentro. Então o trabalho de cada arquivo abaixo é restringir um redesenho, não fornecer um ativo.
01
Imagens do personagem
Até nove. Uma frontal limpa vale mais que três ângulos ruins — medido em entrada de referência não frontal, as notas de identidade caem mais da metade. Acrescente o figurino e o adereço como imagens próprias.
Sinal mais forte · até 9 imagens
02
Um clipe em que ela já está
Até três. Um vídeo carrega o que uma imagem não consegue — o andar, o tempo, o jeito de segurar uma pausa, um trajeto de câmera. Dois dos quatro exemplos desta página tiram a atuação de um.
Movimento e ritmo · até 3 clipes
03
A voz dela
Até três arquivos de áudio, e identidade é uma voz tanto quanto é um rosto. O H3 referencia o timbre e fala a sua nova fala nele, na mesma passagem que a imagem. O áudio tem de viajar junto com uma imagem ou um clipe.
Timbre, não um clone · até 3 áudios
04
Nada além de uma descrição
Funciona dentro de um plano e para de funcionar entre eles. Escreva uma vez, gere o personagem, aí guarde o quadro de que você gostou e use ele como referência para tudo o que vier depois.
A ordem importa mais aqui que em qualquer outra página deste site, porque um elenco que você não fixou no plano um é um elenco que você não recupera no plano seis.
01
Escale antes de escrever
Escolha os quadros que vão ser o personagem, e escolha como quem faz um casting: uma frontal limpa, uma de três quartos, o figurino, o adereço. Só com entrada não frontal, as notas de identidade medidas caem mais da metade — então a frontal não é uma preferência, é o arquivo que sustenta a carga.
Até 9 imagensUma frontal limpa
02
Dê um trabalho a cada arquivo na frase
O H3 lê o prompt com um modelo de linguagem, então dá para dizer a ele qual arquivo responde a qual pergunta. Image 1 is the character; Video 1 is the action and the rhythm é uma frase que funciona. Anexar quatro arquivos e descrever uma cena não é.
Nomeie o arquivoNomeie o trabalho dele
A aparência do protagonista e da protagonista segue estritamente as imagens de referência… as vozes deles seguem o timbre do áudio de referência.
ImagemSom
03
Leve o elenco para o próximo plano
Nada é lembrado entre requisições. O plano dois leva as mesmas referências do plano um, mais — e é essa a parte que as pessoas pulam — um quadro que você guardou do plano um. A saída do último plano é a melhor referência que você vai ter para o próximo.
Reanexe toda vezGuarde um quadro
Faixa de áudio · 32 kHzSHOT-01.MP4
04
Rascunhe em 768P, masterize o escolhido em 2K
Um segundo em 768P são 8 créditos contra 13 em 2K, e subir um clipe 768P pronto depois custa exatamente o que custaria renderizar em 2K — então as seis tomadas que levam para acertar um rosto te custam menos. Uma geração que falha é reembolsada automaticamente.
768P · 8 créditos por segundo2K · 13 créditos por segundo
Quatro passos, nada para instalar, sem cartão. Abrir o gerador.
O que ninguém te conta
Ele deriva entre os planos, não dentro deles. E aqui está quanto isso te custa.
Toda página que vende consistência de personagem te mostra um clipe, e dentro de um clipe o problema está quase resolvido. O trabalho que você de fato tem são seis clipes que cortam juntos, e isso é outra medição — a de baixo, feita entre vídeos e não dentro deles.
01O número entre planos é o que vale
Métodos condicionados por referência marcam 0,54–0,59 de similaridade ArcFace entre dois vídeos da mesma pessoa. Dentro de um clipe eles marcam mais. Faça o orçamento pelo corte, não pela tomada.
0,54–0,59 entre clipes
02Uma frontal vale por três anguladas
Quando a imagem de referência não é frontal, as notas de identidade na linha de base publicada mais forte caem mais de 50%. Se você tem um bom quadro do seu personagem, é esse que você manda — e manda toda vez.
queda >50% com entrada não frontal
03Os tetos são 9 imagens, 3 clipes, 3 áudios
Doze arquivos no total numa requisição, e o áudio tem de viajar com uma imagem ou um vídeo em vez de sozinho. Esse teto é o número que vale comparar: a maior parte das portas hospedadas para este modelo não publica o delas.
12 arquivos, uma requisição
04Nomeie o que não pode mudar
Os exemplos publicados que se seguram listam os traços um a um — o cabelo meio preso, a coroa prateada, a cor da jaqueta. Um traço que você não nomeou é um traço que o redesenho pode reinterpretar, e normalmente reinterpreta lá pelo quarto plano.
traços, item a item
05Uma cena é uma requisição por plano
O H3 renderiza um plano contínuo de 4–15 segundos. Uma cena de seis planos são seis requisições a uns $1.52 cada e uma passada no seu editor — uns $9 pela cena, que é o número para pesar contra uma assinatura mensal de identidade.
6 planos ≈ $9
Fontes, para você conferir: os números de deriva dentro do clipe são a coluna ArcFace do Face Consistency Benchmark (vídeo real 0,0843, melhor modelo medido 0,1734, pior 0,4843 — menor é melhor); os números entre clipes e a queda com entrada não frontal vêm do ContextAnyone e do FaithfulFaces. Nenhum deles testou o MiniMax H3, e nós não rodamos o benchmark — eles estão aqui para dimensionar o problema, não para ranquear este modelo.
Por que isto e não uma biblioteca
Um personagem é uma voz tanto quanto é um rosto
Pergunte a qualquer um que monta drama curto. Metade das tomadas que são jogadas fora vão embora porque o rosto se segurou e a entrega não — e na maior parte das ferramentas a voz é um segundo produto, comprado à parte e sincronizado na mão.
Uma requisição, uma passagem
A voz volta junto com o rosto
32 kHz estéreo é gerado junto com a imagem, e o áudio pode ser uma das suas referências — então o timbre que você anexa é o timbre que fala a nova fala. Sem etapa de sincronização labial, sem assinatura de voz separada.
Doze arquivos de uma vez
O elenco inteiro cabe numa requisição
Nove imagens, três clipes, três arquivos de áudio, doze no total. Uma cena de duas pessoas com figurinos e uma imagem de locação cabe bem dentro disso, e é por isso que o teaser de vampiros acima segura duas pessoas em vez de uma.
Nada guardado
Sem identidade para treinar e sem aluguel sobre ela
Aqui não tem Soul ID, não tem vaga de personagem e não tem taxa por identidade — os arquivos moram no seu disco e sobem junto com a requisição. É pior se você quer um elenco inteiro; é melhor se você tem um personagem e seis planos.
Uma taxa, seis formatos
O vertical custa o que o largo custa
21:9, 16:9, 4:3, 1:1, 3:4 e 9:16 são todos cobrados pela mesma taxa por segundo, porque o fornecedor cobra por segundo e ignora o formato. Drama curto é vertical e não custa mais por isso.
O que você abre mão
De uma garantia. Este é o limite honesto da categoria inteira: uma referência faz o rosto se ler como a mesma pessoa na maior parte das tomadas, e entre planos os números publicados ficam perto de 0,55 de similaridade, não perto de 1. Se a sua entrega precisa de um rosto exato quadro a quadro — um ator conhecido, um porta-voz de marca, uma imagem com valor jurídico — escale a pessoa e filme. Gere os planos em volta dela.
Trabalhos que voltam bem
Quatro trabalhos de personagem que sobrevivem a quinze segundos
Quatro trabalhos diferentes, quatro clipes que foram feitos assim de verdade, e atrás de cada botão o prompt que fez cada um. Todos querem um arquivo seu — o selo do clipe diz qual, e o botão abre a porta certa.
16:9 · 6s · 2 imagens de referência + 1 clipe de referência
Troque um deles, mantenha o resto
Duas edições numa frase: a criança do fundo vira o cachorro da Imagem 1, a jaqueta mais à esquerda muda de cor. Ninguém mais no quadro é mencionado, e ninguém mais muda. É esse o formato de um recado que você daria a um editor, e é esse o formato que o H3 lê.
16:9 · 6s · 1 clipe de referência
Acrescente alguém que pertence ali
Uma linha, e quem chega herda o uniforme, o andar e a luz. O modelo não está compondo um recorte por cima — ele está redesenhando o plano com mais uma pessoa dentro, e é por isso que a sombra cai certo e por isso que você não recupera os pixels originais.
16:9 · 15s · 2 imagens de referência
Um personagem desenhado, fiel ao model sheet
A ilustração é onde a deriva mais aparece, porque um rosto desenhado não tem a folga fotográfica para se esconder: o espaçamento dos olhos ou bate com o model sheet ou não bate. A Imagem 2 é referência estrita de identidade, e o resto do prompt é câmera e clima.
9:16 · 15s · 2 imagens de referência
Uma cena vertical com elenco fixo
Drama curto é o trabalho para o qual esta página existe: dezenas de planos, os mesmos dois rostos, vertical. Quinze segundos são um plano — o elenco é o que você reanexa na próxima requisição, e a montagem acontece no seu editor, não aqui.
Os quatro são exemplos publicados pela própria MiniMax, reunidos sob CC BY 4.0 — e é por isso que cada botão consegue carregar o prompt exatamente como ele foi rodado.
Quanto custa de verdade
Uma cena de seis planos com um personagem são 414 créditos. Uns $9.
Um clipe são 5 créditos fixos pela passagem que entende o prompt, mais 8 créditos por segundo em 768P ou 13 por segundo em 2K. As referências são de graça — anexar nove imagens custa o mesmo que não anexar nenhuma. Um crédito é um centavo do preço de tabela publicado pela própria MiniMax, então dá para conferir a coisa inteira contra uma página que este site não controla. Uma geração que falha é reembolsada automaticamente, o que importa mais aqui que em qualquer lugar: segurar um rosto é um trabalho que se repete.
Esta é a única página deste site em que os direitos que importam não são os nossos. Enviar um rosto é diferente de enviar um logo, então aqui está a posição antes de você gastar qualquer coisa.
Uso comercialO grátis também. Sem marca d'água em nenhum plano, sem royalty por clipe, sem licença separada para comprar. A MiniMax não reivindica direito nenhum sobre as saídas que você gera, e este site não acrescenta nenhum dele próprio.
Um rosto que não é seuA que importa aqui. Nada nesta página te dá direitos sobre a imagem de alguém, e o rosto de uma pessoa real não é seu para pôr num anúncio só porque você tinha uma foto dele. Consiga a autorização que você conseguiria para uma filmagem.
Os seus próprios intérpretesUma imagem de referência de alguém que concordou continua sendo sua. O envio é usado para rodar a sua requisição; o que volta é seu para veicular, e vale a mesma liberação que você faria com filmagem.
O que é recusadoViolência gráfica e conteúdo sexual são recusados na porta de entrada antes de um segundo ser cobrado, e material feito para passar uma pessoa gerada por uma figura pública real também. Essa checagem roda no prompt e no que você anexa.
O que aprendemos segurando personagens com o MiniMax H3
Medido em gerações de verdade e não lido num model card — os tetos de referência, a grade de quadros em que um corte tem de cair, e como o som é escrito.
Perguntas frequentes sobre personagem consistente em vídeo com IA
As oito perguntas que as pessoas fazem antes de comprometer um personagem com uma cena, respondidas com os números por trás.
01
Este gerador de vídeo com personagem consistente é grátis?
O primeiro clipe é, e é o modelo de verdade — 4 segundos, 768P, com som, sem marca d'água, sem cartão, e ele nunca expira. Tudo nesta página toca sem conta nenhuma. Depois disso um plano de 8 segundos em 768P são 69 créditos e um de 15 segundos são 125; os créditos começam em $9.9, o que põe uma cena de seis planos em uns $9. Uma geração que falha não te custa nada.
02
O personagem vai ficar mesmo igual em todo plano?
Vai se ler como a mesma pessoa, sim, na maior parte das tomadas. Idêntico quadro a quadro, não — e nenhuma ferramenta desta categoria entrega isso. Medições publicadas põem a similaridade de identidade condicionada por referência entre dois clipes em algo como 0,54–0,59, contra uma linha de base de filmagem real bem mais apertada. Conte em guardar quatro tomadas de seis, e em reanexar as mesmas referências a cada requisição.
03
Quantos arquivos de referência eu posso anexar?
Até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio, 12 arquivos no total numa requisição. O áudio tem de viajar com uma imagem ou um clipe em vez de sozinho. Anexar referências não custa nada a mais — o preço são os segundos que você renderiza.
04
Fotos ou um clipe de vídeo — o que segura melhor um personagem?
Eles seguram coisas diferentes. Uma imagem é o sinal mais forte para o rosto e o figurino; um clipe carrega andar, tempo e câmera. Use os dois e diga qual é qual no prompt. Se você só tem um arquivo, que seja uma frontal limpa: com entrada não frontal, as notas de identidade medidas caem mais da metade.
05
O personagem consegue manter a mesma voz?
Consegue — anexe áudio como referência e o H3 fala a sua nova fala naquele timbre, gerado na mesma passagem que a imagem em vez de dublado depois. É uma referência de timbre, não uma voz clonada que você guarda, e ela precisa de uma imagem ou um clipe do lado.
06
Qual a diferença disto para um Soul ID ou uma biblioteca de personagens?
Aqueles guardam uma identidade para você e cobram uma assinatura pelo elenco — de $15 a $129 por mês na Higgsfield, por exemplo. Aqui não tem nada guardado: os seus arquivos sobem a cada requisição e você paga por segundos. Pior se você está gerenciando vinte personagens, melhor se você tem um e seis planos para fazer.
07
Dá para fazer uma cena inteira de uma vez?
Não. O H3 renderiza um plano contínuo de 4 a 15 segundos inteiros a 24 fps, então uma cena é uma requisição por plano e a montagem acontece no seu editor. As durações caem numa grade de 17n+5 quadros, o que faz de 192 quadros — exatamente 8,000 segundos — o único segundo inteiro da faixa e o que usar se os seus planos precisam cortar na música.
08
Dá para usar o rosto de alguém como referência?
Só se você tiver o direito. Nada aqui te dá direitos sobre a imagem de uma pessoa, e gerar uma figura pública real é recusado na porta de entrada. Para os seus próprios intérpretes, consiga a mesma autorização que você conseguiria para uma filmagem; o que volta é então seu para usar comercialmente, em todo plano inclusive o grátis.
Pare de descrever o seu personagem. Escale ele.
Uma imagem, uma frase sobre para que serve cada arquivo, e um plano de volta em uns noventa segundos. O seu primeiro é grátis — sem cartão, sem marca d'água, e ele é seu para usar comercialmente.