Tu texto en un video con IA seguramente no está mal escrito — lo capturaste a medio animar
Todas las cadenas que MiniMax H3 tenía orden de escribir salieron bien. Lo que decide el plano es el texto que no nombraste: textura, o una marca inventada.

El consejo estándar sobre el texto en el video con IA es no generarlo. Renderiza mudo, llévate el clip a un editor y compón tú las letras. Todas las guías de la primera página de Google dicen alguna versión de esto, y todas dan el mismo motivo: los modelos de video pintan las letras como textura en lugar de deletrearlas, así que la tipografía se desplaza y sale mal escrita de un fotograma a otro.
Fui a comprobar eso contra MiniMax H3 y encontré algo que el consejo se deja fuera.
Cogí seis clips de ejemplo publicados y los recorrí fotograma a fotograma. Entre ellos llevan 22 piezas de texto en pantalla que el prompt pidió por su nombre. En cuanto cada una deja de moverse, las 22 están bien escritas — incluidos un menú de videojuego, una lista de equipo y un rótulo de título de dos líneas con subtítulo.
Esos mismos clips contienen además una buena cantidad de texto que es puro galimatías — y, en dos de ellos, textos que nadie pidió, que el modelo escribió por su cuenta, y que deletreó a la perfección cada vez que aparecieron. Averiguar por qué vale más que el titular, porque te dice cuáles de tus propios planos están a salvo.
Qué aspecto tiene de verdad un fotograma ilegible de MiniMax H3
Aquí hay un panel de menú del mismo clip, con medio segundo de diferencia. El fotograma de arriba a los 2,458 s, el de abajo a los 2,958 s:

El fotograma de arriba es la captura que se publica con un pie sobre que la IA no sabe escribir. La segunda fila es un duplicado emborronado y a medio formar de la fila que tiene encima. Parece rota porque está rota — durante unas cuatro décimas de segundo, mientras el panel escribe su segunda fila.
Después se resuelve en CHRONOS CLAW y se queda así.
Conté los fotogramas. El panel llega en el fotograma 56 y se va en el 103. La segunda fila es ilegible del fotograma 56 al 65 y está limpia desde el 68 en adelante. A 24 fps eso es una ventana de 0,4 segundos dentro de dos segundos de panel — alrededor de una quinta parte de su tiempo en pantalla parece un fallo de ortografía y no lo es.
Eso importa más de lo que suena, porque una quinta parte no es la probabilidad real de caer en uno. Cuando arrastras el cabezal, paras donde está pasando algo, y los fotogramas donde está pasando algo son exactamente aquellos en los que las letras no se han asentado. Arrastrar tiene sesgo hacia el artefacto.
Así que la primera regla es de procedimiento, no creativa. Juzga las letras en un fotograma en el que no se mueva nada. Y cuando saques una miniatura, sácala después de que el rótulo se fije, o publicarás tú mismo el artefacto y alguien te hará la captura.
Nombra una cadena y MiniMax H3 la escribirá bien
Ahora el hallazgo que cambia cómo escribes el prompt.
Las dos mitades de la imagen de abajo salen de un mismo clip, de una misma generación, con diez segundos de diferencia:

La mitad de arriba está nítida. MINIMAX, RIGHT ARM EQUIPMENT, PHANTOM GRIP,
CHRONOS CLAW — correctos, en paneles que se deslizan y bajo una cámara que se
mueve.
La mitad de abajo es una calle llena de rótulos de neón, y ni uno solo de ellos es una palabra. Mismo modelo, mismo clip, misma semilla, diez segundos después.
El prompt lo explica del todo. Nombra diez cadenas, y esto es lo que volvió:
| Cadena nombrada en el prompt | Renderizada |
|---|---|
START NEW GAME | correcta |
CONTINUE | correcta |
SETTINGS | correcta |
EXIT GAME | correcta |
MINIMAX | correcta |
RIGHT ARM EQUIPMENT | correcta |
PHANTOM GRIP | correcta |
CHRONOS CLAW | correcta |
ARMAMENT CUSTOMIZATION | correcta |
CONFIRM CONFIG | correcta |
Diez de diez. Para la calle, el prompt pedía una ciudad ciberpunk y no decía nada de lo que debía poner en ningún cartel — así que el modelo hizo lo único que tenía disponible y pintó textura con forma de cartel.
Éste es el mismo comportamiento que midieron las guías rivales. Lo que no hicieron nunca fue separar los dos casos. “El texto se renderiza como textura, no como símbolos” es una descripción justa de un fondo para el que el prompt no escribió nunca ningún texto. No es una descripción de una cadena que tú entregaste.
En ese mismo clip hay un tercer caso. El prompt pide una rejilla que muestre “hand, forearm, elbow, upper arm components”. Describe los componentes, nunca una cadena de etiqueta — y la rejilla vuelve como iconos sin ningún texto debajo. No ilegible. Ausente.
Hasta aquí la regla parece “el texto nombrado se escribe bien y el no nombrado no”. Yo me lo creía hasta que miré un clip de producto, y es falsa.
El texto sin nombrar que salió perfecto
Aquí van dos clips más. Ninguno de los dos nombra el texto que estás a punto de leer:

El fotograma de arriba es un anuncio de bebida de verano. Su prompt entero es una frase — un ciclista cruza un pueblo en una colina, “opens a sparkling lemon drink”, arte de cómic. Ninguna marca. Ningún texto de etiqueta. Nada entre comillas.
El modelo se inventó BRIGHTSIP, lo puso en la botella, y después lo escribió bien
en cuatro etiquetas dentro de un mismo fotograma y en cuatro ángulos distintos,
otra vez en la botella protagonista nueve segundos después, y otra vez en el rótulo
final — donde además se inventó y escribió bien el eslogan TASTE THE SUN. Cristal
curvo, escala cambiante, cámara en movimiento, y la palabra no se rompe nunca.
El fotograma de abajo es un anuncio fotorrealista de una silla. Sus anotaciones de HUD son borrones ilegibles, en el mismo clip cuyo rótulo final lleva ocho caracteres correctos.
Las dos mitades son texto sin nombrar. Una es perfecta y la otra es ruido — así que nombrar una cadena basta para que se escriba bien, pero no es lo que decide si una cadena se escribe bien. Lo que lo decide es si una cadena concreta tiene un trabajo en el plano. Un plano de producto no es un plano de producto sin una marca en la botella, así que el modelo pone una y se compromete con ella. Una lectura técnica es decorado, y ninguna palabra concreta de ella significa nada, así que el modelo pinta la textura de una lectura. Cuarenta neones de fondo son el mismo caso que el HUD.
Nombrar no es el interruptor que enciende la ortografía. Es cómo le quitas la
elección al modelo. Si lo dejas solo, H3 le pondrá nombre a tu producto por ti — y
BRIGHTSIP es una invención perfectamente buena que tú no elegiste, que no puedes
briefear y que no vas a volver a tener en la siguiente toma.
Lo mismo otra vez, en fotorrealista y con el guion entero inventado
BRIGHTSIP es una palabra en un clip de arte de cómic, y eso es fácil de despachar.
Así que aquí va el caso difícil de despachar — una película de producto de pato
asado, y todas y cada una de sus palabras son del modelo:

Esto no está dibujado. Es un anuncio de comida fotorrealista — luz de estudio, brillos especulares húmedos, un plato de pizarra con su reflejo. Y su prompt son 655 caracteres que no nombran ninguna cadena. Lo que nombran, en su lugar, es un idioma:
Use clean, lightweight sans-serif typography throughout, with generous negative space and a consistent visual system. All Bahasa Indonesia text must be spelled and rendered correctly.
El modelo escribió su propio anuncio. Cinco líneas, todas en indonesio, todas
correctas: Memperkenalkan (presentamos), Kulit Sempurna (piel perfecta), Rasa Pro., Bebek Panggang. (pato asado) y Beli Sekarang (compra ahora). También
tradujo el encargo — el prompt dice “Peking duck” en inglés, y el rótulo final pone
Bebek Panggang.
De ahí salen dos cosas, y importan más que el clip.
El fotorrealismo no es la variable. Yo había dado por hecho que las etiquetas correctas que estaba midiendo eran correctas porque estaban dibujadas — letras planas que el modelo pinta y no una superficie que tiene que iluminar. Este clip es tan fotorrealista como el anuncio de la silla cuyos paneles de HUD son borrones, y sus letras son perfectas. El estilo de renderizado no es lo que los separa.
Puedes especificar el idioma sin especificar las palabras. Y esto resulta que
importa, porque el guion que te llega no es automáticamente el guion que escribiste.
El clip de la silla nombró su rótulo final en inglés — “Inspiration and Comfort
Online Simultaneously” — y el modelo renderizó 灵感与舒适同时在线, el equivalente
en chino, correctamente. Correcto, y no lo que se pidió. Una línea que nombre el
idioma es todo el arreglo.
El tamaño no es el umbral que la gente se cree
El número más repetido en este rincón de internet es que el texto por debajo de unos 40 px de alto sale ilegible porque el modelo se queda sin píxeles con los que escribir.
Medido sobre estos clips, no se sostiene. Los rótulos intermedios del ejemplo de
tráiler de MiniMax tienen de 29 a 30 px de altura de mayúscula en un fotograma de
1280×720 — por debajo del umbral — y THE MISSION WAS A LIE está bien escrito.
START NEW GAME mide 42 px y también es correcto.
La cadena correcta más pequeña que encontré es aún menor, y está en el clip
fotorrealista: Rasa Pro. es una mayúscula de 22 px en un fotograma de 1698×720,
un tres por ciento de la altura del cuadro, y está limpia. Tampoco la nombró nadie.
El texto pequeño sí se pone más difícil. Pero en este modelo, la altura no es lo que predice si una cadena sale bien escrita.
Cómo nombrar una cadena para que se renderice
En concreto, cuatro cosas, todas sacadas de prompts que funcionaron:
- Ponla entre comillas, en mayúsculas, exactamente como la quieres.
Cursor clicks "CONTINUE"es la forma que funciona. Describir un botón como “un botón de continuar” le da al modelo una forma que pintar, no una palabra que escribir. - Di dónde va. “Right side displays game menu UI”, “Top left displays player profile”. Un texto con posición es un objeto de la escena; un texto sin ella es decoración.
- Dirige la tipografía, aparte de las palabras. El prompt del tráiler de MiniMax gasta 90 palabras sólo en el tratamiento — interletrado, brillo, “font not pure white”, cómo entra. Nada de eso nombra ninguna cadena, y todo eso hace que las cadenas que sí están nombradas parezcan dirigidas por un director de arte en lugar de tecleadas.
- Nombra el idioma, incluso cuando no nombres las palabras. “All Bahasa Indonesia text must be spelled and rendered correctly” es todo lo que la película del pato dice sobre las letras, y todas las líneas volvieron en indonesio. Sin ella te llevas lo que implique la escena, que es como un encargo en inglés acaba con un rótulo final en chino.
Y el corolario, que es lo que de verdad ahorra dinero: un cartel sin nombrar nunca es neutro. Lo que ponga en él lo decidió algo, y si no fuiste tú fue el modelo — o como textura que tendrás que recortar, o como un nombre de marca con el que ahora tienes que vivir.
Dónde sigue rompiéndose el texto de MiniMax H3
Tres límites honestos, todos visibles en los clips de arriba.
La maquetación no es la ortografía. Mira otra vez la mitad de arriba de la imagen
comparativa: CHRONOS CLAW aparece dos veces, en dos filas apiladas. Todas las
letras están bien y la lista está mal. El modelo es un tipógrafo fiable y un
diseñador de interfaces poco fiable, y ésos son problemas distintos.
El decorado sigue siendo galimatías, y hay un límite a lo que puedes nombrar para salir de ahí. Puedes nombrar los tres carteles que importan. No puedes nombrar cuarenta, y una calle urbana densa necesita cuarenta.
Hay exactamente una casilla que no puedo rellenar: letras fotorrealistas sobre una superficie curva. Hay dos variables en juego, y conviene separarlas, porque casi todos los consejos sobre este tema las funden en una.
| Letras sobre un plano recto | Letras envueltas en una superficie curva | |
|---|---|---|
| Dibujado / cómic | correcto — rótulos de tráiler, interfaz de videojuego | correcto — BRIGHTSIP, en cuatro ángulos sobre cristal |
| Fotorrealista | correcto — la película del pato | sin evidencia en ninguna dirección |
La película del pato descarta “el problema es el fotorrealismo”. BRIGHTSIP descarta
“el problema es la curvatura”. Ninguna de las dos descarta las dos cosas juntas, y
hay un motivo físico para esperar que la combinación sea la difícil: una etiqueta
dibujada es una forma que el modelo pinta sobre el cristal, mientras que una
fotorrealista tiene que reproyectarse y reiluminarse en cada ángulo nuevo.
Fui a buscar ese caso y la biblioteca no lo contiene. De 102 entradas, el único clip fotorrealista cuyo prompt pide de verdad “ultra-slow rotating close-ups” es el del pato, y un pato no tiene etiqueta. Creadores que trabajan en planos fotorrealistas de botellas cuentan que la etiqueta se rompe desde el primer fotograma y que no sobrevive ni a foto a video ni a referencia a video. Yo no lo he reproducido y no lo voy a afirmar desde la captura de otra persona — pero es el sitio evidente donde esta regla se detiene, y es lo primero que probaría si el plano fuera mío.
Éstos son ejemplos seleccionados. Cuatro de los seis clips son del escaparate de la propia MiniMax y dos son entradas de la comunidad en la misma biblioteca, así que representan un buen día y no uno medio, y 22 de 22 no es un número que debas esperar reproducir. Lo que sobrevive al sesgo de selección es el patrón, no el marcador — y sobrevive en parte porque el galimatías está ahí mismo, dentro de esos mismos clips seleccionados. Un proveedor haciendo trampas con la selección no habría publicado esa calle.
Para la única cadena que tiene que estar bien siempre
Las cadenas nombradas se renderizan bien, y siguen siendo una generación. Que esté bien en esta toma no significa que lo esté en la siguiente, y si la cadena es tu marca, el nombre de tu producto o tu título de verdad, “casi siempre bien” no es una especificación.
Hay una vía que quita el dado: pon las palabras en una imagen de referencia. El modelo tiene entonces un logotipo que igualar en lugar de letras que dibujar, así que no está renderizando letras en ningún momento y no hay nada que pueda variar. En el ejemplo de tráiler de MiniMax, el único rótulo de título diseñado y de dos líneas de toda la pieza es exactamente esto — es la imagen fija de entrada, en pantalla al principio y otra vez al final.
El recorrido completo está en cómo hacer un tráiler de cine con IA con MiniMax H3, que es además donde vive el cuadre de tiempos de la escaleta.
Así que el reparto del trabajo es:
| Nombrarla en el prompt | Ponerla en una imagen de referencia | |
|---|---|---|
| Mejor para | etiquetas de menú, intertítulos, rotulación que importa | marca, nombre de producto, el título de verdad |
| Correcta ahora | sí, 22 de 22 en estos clips | sí, para letras que se quedan en un plano recto |
| Correcta en la siguiente toma | es una generación, así que se vuelve a tirar el dado | idéntica |
| Guion e idioma | fija el idioma aparte, o toma lo que implique la escena | lo que diga la imagen |
| Te cuesta | nada | una plaza de referencia |
La columna de la derecha tiene una frontera, y es la misma de antes. Un rótulo de título es un plano que el modelo puede sostener. Una etiqueta envuelta en una botella que gira es una superficie que tiene que redibujar en cada ángulo nuevo, y darle una referencia no elimina el redibujado. Trata la vía de la imagen de referencia como resuelta para las sobreimpresiones y como no probada para cualquier cosa curva.
Cómo comprobar tu propio clip en un minuto
No lo juzgues desde el reproductor. Despliega el clip entero de una vez, y luego vuelve a resolución completa a por cualquier cosa que se vea mal:
# más o menos uno de cada dos fotogramas, en una sola hoja de contactos
ffmpeg -i clip.mp4 -vf "fps=2,scale=320:-1,tile=5x7" -frames:v 1 sheet.png
# después el momento sospechoso, a tamaño completo y en el fotograma exacto
ffmpeg -i clip.mp4 -vf "select='eq(n,59)'" -fps_mode passthrough frame.pngSi una cadena se lee mal en la hoja, saca los fotogramas de un lado y de otro antes de concluir nada. En estos seis clips, cada cadena que parecía rota en la primera pasada resultó estar a medio animar — y aunque el texto sin nombrar no está roto automáticamente, todo lo que sí estaba roto no estaba nombrado.
Pruébalo
La versión más rápida de la prueba: escribe una línea de texto entrecomillado en un prompt, genera a 8 segundos y recorre el resultado fotograma a fotograma.
Texto a video lo hace desde una frase. Si las palabras tienen que estar exactas siempre, trae tu propia imagen fija a referencia a video y deja que sea la imagen la que las lleve.
Los clips, los prompts y las imágenes de referencia citados aquí vienen de awesome-minimax-h3-prompts, CC BY 4.0. Cuatro están acreditados a MiniMax; el anuncio de limonada y la película del pato son entradas de la comunidad en la misma biblioteca, acreditadas a Hemanth y a Feyber respectivamente. El prompt de la película del pato está citado entero de la publicación original de su autor, porque la biblioteca sólo lleva un extracto. Los números de fotograma, los tiempos, las alturas de mayúscula y todas las cadenas de arriba se leyeron de los archivos.
Escrito por
Redacción
minimax-h3ai.video
Publicado en el generador de video con IA MiniMax H3, una interfaz independiente de terceros construida sobre MiniMax H3.


