Prompt craft

O texto do seu vídeo com IA provavelmente não está escrito errado — você tirou print no meio da animação

Toda frase que mandaram o MiniMax H3 escrever saiu certa. Quem decide a tomada é o texto que você nunca nomeou — textura, ou uma marca inventada.

13 min de leituraRedaçãoRedação
O texto do seu vídeo com IA provavelmente não está escrito errado — você tirou print no meio da animação

O conselho padrão sobre texto em vídeo com IA é não gerar. Renderize mudo, leve o clipe para um editor, componha a letra você mesmo. Todo guia da primeira página do Google diz alguma versão disso, e todos dão o mesmo motivo: modelos de vídeo pintam letras como textura em vez de soletrar, então a letra deriva e sai escrita errada de um quadro para o outro.

Fui conferir isso contra o MiniMax H3 e achei algo que o conselho não vê.

Puxei seis clipes de exemplo publicados e passei quadro a quadro. Entre eles carregam 22 pedaços de texto na tela que o prompt pediu pelo nome. Assim que cada um para de se mexer, os 22 estão escritos corretamente — inclusive um menu de jogo, uma lista de equipamento e um letreiro de duas linhas com subtítulo.

Os mesmos clipes também contêm um bocado de texto que é rabisco puro — e, em dois deles, texto que ninguém pediu, que o modelo escreveu sozinho, e que ele soletrou perfeitamente toda vez que apareceu. Entender por quê vale mais que a manchete, porque isso te diz quais das suas próprias tomadas estão seguras.

Como é de fato um quadro embaralhado do MiniMax H3

Aqui está um painel de menu do mesmo clipe, com meio segundo de diferença. Quadro de cima em 2,458 s, quadro de baixo em 2,958 s:

O mesmo painel de equipamento duas vezes: em 2,458 segundos a segunda linha é uma duplicata borrada de PHANTOM GRIP, em 2,958 segundos ela lê CHRONOS CLAW limpo

O quadro de cima é a captura de tela que é postada com uma legenda sobre a IA não saber escrever. A segunda linha é uma duplicata borrada e meio formada da linha acima dela. Parece quebrada porque está quebrada — por cerca de quatro décimos de segundo, enquanto o painel escreve a segunda linha dele.

Depois ela resolve para CHRONOS CLAW e fica assim.

Contei os quadros. O painel chega no quadro 56 e sai no 103. A segunda linha é ilegível do quadro 56 ao 65 e está limpa do quadro 68 em diante. A 24 fps isso é uma janela de 0,4 segundo dentro de dois segundos de painel — cerca de um quinto do tempo dele em tela parece uma falha de escrita e não é uma.

Isso importa mais do que parece, porque um quinto não é a chance real de cair num desses. Quando você arrasta a agulha você para onde algo está acontecendo, e os quadros em que algo está acontecendo são exatamente os quadros em que a letra ainda não assentou. Arrastar é enviesado a favor do artefato.

Então a primeira regra é de procedimento, não de criação. Julgue a letra num quadro em que nada está se movendo. E quando você tirar uma miniatura, tire depois de o letreiro travar, ou você mesmo vai entregar o artefato e alguém vai tirar print de você.

Nomeie uma frase e o MiniMax H3 vai escrever ela

Agora a descoberta que muda como você escreve o prompt.

As duas metades da imagem abaixo vêm de um clipe, uma geração, com dez segundos de diferença:

Em cima: uma interface de jogo lendo MINIMAX, RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW, tudo nítido e correto. Embaixo: uma rua cyberpunk em que todo letreiro de neon é rabisco ilegível

A metade de cima está nítida. MINIMAX, RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW — corretos, em painéis que estão deslizando, sob uma câmera que está se movendo.

A metade de baixo é uma rua cheia de letreiros de neon, e nenhum deles é uma palavra. Mesmo modelo, mesmo clipe, mesma seed, dez segundos depois.

O prompt explica isso por completo. Ele nomeia dez frases, e foi isto que voltou:

Frase nomeada no promptRenderizada
START NEW GAMEcorreta
CONTINUEcorreta
SETTINGScorreta
EXIT GAMEcorreta
MINIMAXcorreta
RIGHT ARM EQUIPMENTcorreta
PHANTOM GRIPcorreta
CHRONOS CLAWcorreta
ARMAMENT CUSTOMIZATIONcorreta
CONFIRM CONFIGcorreta

Dez de dez. Para a rua, o prompt pediu uma cidade cyberpunk e não disse nada sobre o que qualquer letreiro deveria dizer — então o modelo fez a única coisa disponível e pintou textura em formato de letreiro.

Este é o mesmo comportamento que os guias concorrentes mediram. Eles só nunca separaram os dois casos. «O texto é renderizado como textura, não como símbolos» é uma descrição justa de um fundo para o qual o prompt nunca escreveu texto. Não é uma descrição de uma frase que você entregou.

Existe um terceiro caso no mesmo clipe. O prompt pede uma grade «displaying hand, forearm, elbow, upper arm components». Ele descreve os componentes, nunca uma frase de rótulo — e a grade volta como ícones sem texto nenhum embaixo. Não embaralhado. Ausente.

Até aqui a regra parece «texto nomeado é escrito, texto não nomeado não é». Eu acreditei nisso até conferir um clipe de produto, e está errado.

O texto não nomeado que saiu perfeito

Aqui estão mais dois clipes. Nenhum deles nomeia o texto que você está prestes a ler:

Em cima: quatro garrafas de limonada num engradado, cada rótulo lendo BRIGHTSIP com clareza. Embaixo: um diagrama fotorrealista de cadeira ergonômica cujos painéis de HUD laterais são borrões ilegíveis

O quadro de cima é um comercial de bebida de verão. O prompt inteiro dele é uma frase — um ciclista atravessa uma cidade de montanha, «opens a sparkling lemon drink», arte de quadrinhos. Sem marca. Sem texto de rótulo. Nada entre aspas.

O modelo inventou BRIGHTSIP, pôs na garrafa, e depois escreveu certo em quatro rótulos num quadro só, em quatro ângulos diferentes, de novo na garrafa de destaque nove segundos depois, e de novo no cartão final — onde ele também inventou e escreveu corretamente o slogan TASTE THE SUN. Vidro curvo, escala mudando, câmera se movendo, e a palavra nunca quebra.

O quadro de baixo é um anúncio fotorrealista de cadeira. As anotações de HUD dele são borrões ilegíveis, no mesmo clipe cujo cartão final carrega oito caracteres corretos.

As duas metades são texto não nomeado. Uma é perfeita e a outra é ruído — então nomear uma frase basta para ela ser escrita, mas não é isso que decide se uma frase é escrita. O que decide é se uma frase específica tem um trabalho na tomada. Uma revelação de produto não é uma revelação de produto sem uma marca na garrafa, então o modelo fornece uma e se compromete com ela. Um painel técnico é cenário, e nenhuma palavra dele significa coisa alguma, então o modelo pinta a textura de um painel. Quarenta letreiros de neon ao fundo são o mesmo caso do HUD.

Nomear não é a chave que liga a escrita. É como você tira a escolha do modelo. Deixado sozinho, o H3 vai batizar o seu produto por você — e BRIGHTSIP é uma invenção perfeitamente boa que você não escolheu, não consegue briefar e não vai receber de novo na próxima tomada.

A mesma coisa de novo, em fotorrealismo, com o roteiro inteiro inventado

BRIGHTSIP é uma palavra num clipe de arte de quadrinhos, o que é fácil de descartar. Então aqui está o caso difícil de descartar — um filme de produto de pato assado, e toda palavra nele é do modelo:

Em cima: uma tomada de produto com fundo preto de um pato assado com a manchete Bebek Panggang. e a linha Beli Sekarang embaixo, as duas nítidas. Embaixo: um macro do mesmo pato com a legenda pequena Rasa Pro. à direita, também nítida

Isto não é desenhado. É um comercial de comida fotorrealista — luz de estúdio, brilhos especulares úmidos, um prato de ardósia com reflexo. E o prompt dele tem 655 caracteres que não nomeiam frase nenhuma. O que ele nomeia, em vez disso, é um idioma:

Use clean, lightweight sans-serif typography throughout, with generous negative space and a consistent visual system. All Bahasa Indonesia text must be spelled and rendered correctly.

O modelo escreveu o próprio anúncio. Cinco linhas, todas em indonésio, todas corretas: Memperkenalkan (apresentando), Kulit Sempurna (pele perfeita), Rasa Pro., Bebek Panggang. (pato assado) e Beli Sekarang (compre agora). Ele também traduziu o briefing — o prompt diz «Peking duck» em inglês, e o cartão final diz Bebek Panggang.

Duas coisas saem disso, e elas importam mais que o clipe.

Fotorrealismo não é a variável. Eu tinha presumido que os rótulos corretos que eu estava medindo eram corretos por serem desenhados — letra chapada que o modelo pinta em vez de uma superfície que ele tem de iluminar. Este clipe é tão fotorrealista quanto o anúncio da cadeira cujos painéis de HUD são borrões, e a letra dele é perfeita. O estilo de renderização não é o que separa os dois.

Você pode especificar o idioma sem especificar as palavras. Isso acaba importando, porque o alfabeto que você recebe não é automaticamente o que você escreveu. O clipe da cadeira nomeou o cartão final em inglês — «Inspiration and Comfort Online Simultaneously» — e o modelo renderizou 灵感与舒适同时在线, o equivalente em chinês, corretamente. Correto, e não o que foi pedido. Uma linha nomeando o idioma é a correção inteira.

O tamanho não é o limiar que as pessoas pensam

O número mais repetido neste canto da internet é que texto abaixo de uns 40 px de altura embaralha porque o modelo fica sem pixels para escrever.

Medido nestes clipes, isso não se sustenta. Os letreiros intermediários do exemplo de trailer da MiniMax têm 29 a 30 px de altura de caixa alta num quadro de 1280×720 — abaixo do limiar — e THE MISSION WAS A LIE está escrito corretamente. START NEW GAME mede 42 px e também está correto.

A menor frase correta que eu achei é menor ainda, e está no clipe fotorrealista: Rasa Pro. tem 22 px de caixa alta num quadro de 1698×720, três por cento da altura do quadro, e está limpa. Ninguém nomeou ela também.

Texto pequeno fica mais difícil, sim. Mas neste modelo a altura não é o que prevê se uma frase sai escrita.

Como nomear uma frase para ela renderizar

Concretamente, quatro coisas, todas tiradas de prompts que funcionaram:

  1. Ponha entre aspas, em maiúsculas, exatamente como você quer. Cursor clicks "CONTINUE" é a forma que funciona. Descrever um botão como «um botão de continuar» dá ao modelo uma forma para pintar, não uma palavra para escrever.
  2. Diga onde ela fica. «Right side displays game menu UI», «Top left displays player profile». Texto com posição é um objeto na cena; texto sem posição é decoração.
  3. Dirija a tipografia, separadamente das palavras. O prompt de trailer da MiniMax gasta 90 palavras só com tratamento — entreletra, brilho, «font not pure white», como ela entra. Nada disso nomeia uma frase, e tudo isso faz as frases que são nomeadas parecerem dirigidas em vez de digitadas.
  4. Nomeie o idioma, mesmo quando você não está nomeando as palavras. «All Bahasa Indonesia text must be spelled and rendered correctly» é tudo o que o filme do pato diz sobre texto, e toda linha voltou em indonésio. Sem isso você recebe o que a cena sugerir, que é como um briefing em inglês termina com um cartão final em chinês.

E o corolário, que é o que de fato economiza dinheiro: um letreiro não nomeado nunca é neutro. O que quer que esteja escrito nele foi decidido por alguma coisa, e se não foi você foi o modelo — ou como textura que você vai ter de cortar em volta, ou como um nome de marca com o qual você agora tem de conviver.

Onde a renderização de texto do MiniMax H3 ainda quebra

Três limites honestos, todos visíveis nos clipes acima.

Diagramação não é escrita. Olhe de novo a metade de cima da imagem de comparação: CHRONOS CLAW aparece duas vezes, em duas linhas empilhadas. Toda letra está certa e a lista está errada. O modelo é um tipógrafo confiável e um designer de interface pouco confiável, e esses são problemas separados.

A ambientação continua rabisco, e existe um limite para nomear tudo. Você pode nomear os três letreiros que importam. Você não pode nomear quarenta, e uma rua urbana densa precisa de quarenta.

Existe exatamente uma célula que eu não consigo preencher: letra fotorrealista numa superfície curva. Duas variáveis estão em jogo, e vale separar elas, porque a maioria dos conselhos sobre isso funde as duas numa só.

Letra num plano chapadoLetra envolvendo uma superfície curva
Desenhado / quadrinhoscorreta — letreiros de trailer, interface de jogocorreta — BRIGHTSIP, quatro ângulos em vidro
Fotorrealistacorreta — o filme do patosem evidência em nenhuma direção

O filme do pato descarta «o fotorrealismo é o problema». O BRIGHTSIP descarta «a curvatura é o problema». Nenhum dos dois descarta os dois juntos, e existe uma razão física para esperar que a combinação seja a difícil: um rótulo desenhado é uma forma que o modelo pinta sobre o vidro, enquanto um fotorrealista tem de ser reprojetado e reiluminado a cada novo ângulo.

Fui procurar esse caso e a biblioteca não tem. De 102 entradas, o único clipe fotorrealista cujo prompt de fato pede «ultra-slow rotating close-ups» é o pato, e um pato não tem rótulo. Quem cria trabalhando em tomadas fotorrealistas de garrafa relata o rótulo quebrando desde o primeiro quadro e não sobrevivendo nem a imagem para vídeo nem a referência para vídeo. Eu não reproduzi isso e não vou afirmar com base na captura de tela de outra pessoa — mas é o lugar óbvio para esta regra parar, e é a primeira coisa que eu testaria se a tomada fosse minha.

Estes são exemplos curados. Quatro dos seis clipes são da vitrine da própria MiniMax e dois são entradas da comunidade na mesma biblioteca, então eles representam um dia bom e não um dia médio, e 22 de 22 não é um número que você deva esperar reproduzir. O que sobrevive ao viés de seleção é o padrão, não o placar — e ele sobrevive em parte porque o rabisco está ali mesmo, nos mesmos clipes curados. Quem estivesse escolhendo a dedo não teria publicado aquela rua.

Para a única frase que tem de estar certa toda vez

Frases nomeadas renderizam corretamente, e ainda assim são uma geração. Certo nesta tomada não quer dizer certo na próxima, e se a frase é a sua marca, o nome do seu produto ou o seu título de verdade, «quase sempre certo» não é uma especificação.

Existe um caminho que tira o dado da mesa: ponha as palavras numa imagem de referência. O modelo então tem um logotipo para casar em vez de letras para desenhar, ou seja, ele nunca está renderizando letra nenhuma e não há nada que possa variar. No exemplo de trailer da MiniMax, o único letreiro desenhado de duas linhas da peça é exatamente isto — é o quadro parado de entrada, na tela no começo e de novo no fim.

O passo a passo completo está em como fazer um trailer de cinema com IA no MiniMax H3, que é também onde está a marcação das batidas.

Então a divisão de trabalho é:

Nomear no promptPôr numa imagem de referência
Melhor pararótulos de menu, letreiros intermediários, placas que importammarca, nome de produto, o título de verdade
Correto agorasim, 22 de 22 nestes clipessim, para letra que fica num plano chapado
Correto na próxima tomadaé uma geração, então é sorteada de novoidêntico
Alfabeto e idiomafixe o idioma à parte, ou aceite o que a cena sugeriro que a imagem disser
Te custanadauma vaga de referência

A coluna da direita tem uma fronteira, e é a mesma de antes. Um letreiro é um plano que o modelo consegue segurar. Um rótulo enrolado numa garrafa que gira é uma superfície que ele tem de redesenhar a cada novo ângulo, e entregar uma referência não elimina o redesenho. Trate o caminho da imagem de referência como resolvido para sobreposições e não comprovado para qualquer coisa curva.

Como conferir o seu próprio clipe em cerca de um minuto

Não julgue pelo player. Espalhe o clipe inteiro de uma vez, e depois volte em resolução cheia em qualquer coisa que pareça errada:

# every other frame-ish, as one contact sheet
ffmpeg -i clip.mp4 -vf "fps=2,scale=320:-1,tile=5x7" -frames:v 1 sheet.png

# then the suspect moment, full size, exact frame
ffmpeg -i clip.mp4 -vf "select='eq(n,59)'" -fps_mode passthrough frame.png

Se uma frase lê errado na folha de contato, puxe os quadros dos dois lados antes de concluir qualquer coisa. Nestes seis clipes, toda frase que parecia quebrada na primeira passada estava no meio da animação — e embora texto não nomeado não esteja automaticamente quebrado, tudo o que estava quebrado não tinha sido nomeado.

Experimente

A versão mais rápida do teste: escreva uma linha de texto entre aspas num prompt, gere com 8 segundos, e percorra o resultado quadro a quadro.

Texto para vídeo faz isso a partir de uma frase. Se as palavras têm de estar exatamente certas toda vez, traga o seu próprio quadro parado para referência para vídeo e deixe a imagem carregar elas.

Os clipes, prompts e imagens de referência citados aqui vêm do awesome-minimax-h3-prompts, CC BY 4.0. Quatro são creditados à MiniMax; o comercial de limonada e o filme do pato são entradas da comunidade na mesma biblioteca, creditadas a Hemanth e a Feyber respectivamente. O prompt do filme do pato está citado por inteiro do post original do autor, porque a biblioteca carrega só um trecho. Os números de quadro, os tempos, as alturas de caixa alta e toda frase acima foram lidos dos arquivos.

Redação

Escrito por

Redação

minimax-h3ai.video

Publicado no gerador de vídeo com IA MiniMax H3, uma interface independente, de terceiros, construída sobre o MiniMax H3.

Todos os artigos