Ningún modelo de video recuerda a tu personaje de una petición a la siguiente, y los que dicen que sí lo hacen guardan el archivo y te lo devuelven. Así que sáltate la identidad que hay que entrenar primero: adjunta las imágenes fijas, el clip y la voz al plano que estás pidiendo, hasta doce archivos en una sola petición. El primero es gratis. Sin tarjeta.
Cuatro maneras de sostener a un personaje, sacadas de los ejemplos que publica la propia MiniMax. Cada tarjeta abre el prompt completo.
La cara sale de una fija, la interpretación de un clip
Entra el prompt, sale el reparto
El prompt a la izquierda. Lo que devolvió, a la derecha.
La cara sale de una fija, la interpretación de un clip16:9 · 15 s · 1 imagen de referencia + 1 clip
Dos archivos, dos encargos. La imagen fija dice quién es esta persona; el clip dice cómo se mueve, a qué velocidad y con qué ritmo. Ninguno hace el trabajo del otro — y el prompt nombra qué archivo responde a qué pregunta antes de describir una sola acción.
The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.
Un personaje sostenido quince segundos16:9 · 15 s · 2 imágenes de referencia
Lee la primera cláusula: usa la Imagen 2 como referencia fija del personaje, y después cuatro rasgos nombrados uno por uno — el pelo negro medio recogido, la corona plateada hueca, la túnica, la paleta de color. Esa lista es todo el truco. Los rasgos que no nombras son rasgos que el modelo puede redibujar a su aire.
Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.
Dos protagonistas, un teaser9:16 · 15 s · 2 imágenes de referencia
Un reparto, no un personaje. El prompt fija a los dos protagonistas a sus imágenes de referencia antes de escribir un solo tiempo, porque una escena con dos personas son dos identidades que pueden irse cada una por su lado — y la que no anclaste es la que se mueve.
Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.
Reparto nuevo, misma coreografía16:9 · 6 s · 1 clip como referencia
La identidad que se sostiene aquí no es una cara — es una rutina. Tres hombres de traje se convierten en tres capibaras, y cada tiempo de una secuencia de suelo de nueve movimientos sobrevive al cambio porque quien lleva el ritmo es el clip, no la frase.
Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.
Qué es esto, y qué no es
Aquí nada recuerda a tu personaje. Ese es el problema entero, y el método entero.
Esta parte va primero, porque decide si deberías estar aquí siquiera. Todos los productos que venden consistencia de personaje te venden una identidad guardada — Higgsfield entrena un Soul ID, Vidu conserva un juego de referencias, Runway ancla una sesión. Lo que se guarda es un archivo, y lo que pasa en el momento de generar es que ese archivo se adjunta a tu petición. Así que la pregunta no es si una herramienta recuerda. Es cuántos archivos acepta a la vez, y qué estás pagando por tenerlos guardados en algún sitio.
Las mediciones son duras con todo el mundo, y conviene saberlo antes de hacer el presupuesto. En el Face Consistency Benchmark, una cara dentro de un solo clip de texto a video se va entre 2,1 y 5,7 veces más lejos que esa misma medición sobre metraje real — 0,0843 de distancia coseno ArcFace en video real frente a 0,1734 en el mejor modelo medido y 0,4843 en el peor. Entre dos clips distintos la cosa empeora, no mejora: los métodos condicionados por referencia de la comparativa ContextAnyone se quedan en una similitud ArcFace de 0,54 a 0,59 entre videos. Una imagen fija de referencia es la palanca más grande que existe, y no es un candado. Lo que te compra es una cara que quien mira lee como la misma persona, en la mayoría de las tomas, por el precio de una toma.
Al mes, por una identidad guardada
$15–$129
Al mes, por una identidad guardada
Por intento en otros sitios, según la duración
$0.45–$2.00
Por intento en otros sitios, según la duración
Imágenes, clips y audios en una petición
9 · 3 · 3
Imágenes, clips y audios en una petición
Un plano de 8 segundos aquí, con sonido
~$1.52
Un plano de 8 segundos aquí, con sonido
Sin identidad que entrenar antes del primer plano
Sin biblioteca de personajes por la que seguir pagando alquiler
Sin pasada aparte de sincronización de labios que comprar
Sin marca de agua que explicar, en ningún plan
Lo que pones tú
Cuatro maneras de decir quién es esta persona
Lo único que de verdad importa: el modelo vuelve a renderizar cada píxel, la cara incluida. Nunca pega tu referencia dentro. Así que el trabajo de cada archivo de aquí abajo es acotar un redibujo, no aportar un material.
01
Imágenes fijas del personaje
Hasta nueve. Una frontal limpia vale más que tres ángulos malos — medido sobre referencias que no son frontales, la puntuación de identidad cae más de la mitad. Añade el vestuario y el atrezo como imágenes propias.
La señal más fuerte · hasta 9 imágenes
02
Un clip en el que ya sale
Hasta tres. Un video lleva lo que una imagen fija no puede: la forma de andar, el ritmo, cómo sostiene una pausa, un recorrido de cámara. Dos de los cuatro ejemplos de esta página sacan de ahí su interpretación.
Movimiento y ritmo · hasta 3 clips
03
Su voz
Hasta tres audios, y una identidad es una voz tanto como una cara. H3 toma el timbre como referencia y dice tu frase nueva con él, en la misma pasada que la imagen. El audio tiene que viajar con una imagen o con un clip.
Timbre, no un clon · hasta 3 audios
04
Nada más que una descripción
Funciona dentro de un plano y deja de funcionar entre uno y otro. Escríbelo una vez, genera el personaje, quédate con el fotograma que te guste y úsalo como referencia para todo lo que venga después.
Aquí el orden importa más que en ninguna otra página del sitio, porque un reparto que no fijaste en el primer plano es un reparto que ya no recuperas en el sexto.
01
Haz el casting antes de escribir
Elige los fotogramas que van a ser el personaje, y elígelos como si estuvieras haciendo un casting: una frontal limpia, un tres cuartos, el vestuario, el atrezo. Sólo con entrada no frontal, la puntuación de identidad medida cae más de la mitad — así que la frontal no es una preferencia, es el archivo que sostiene todo lo demás.
Hasta 9 imágenesUna frontal limpia
02
Dale a cada archivo un papel dentro de la frase
H3 lee el prompt con un modelo de lenguaje, así que se le puede decir qué archivo responde a qué pregunta. La Imagen 1 es el personaje; el Video 1 es la acción y el ritmo es una frase que funciona. Adjuntar cuatro archivos y describir una escena, no.
Nombra el archivoNombra su papel
El aspecto del protagonista y de la protagonista sigue estrictamente las imágenes de referencia… sus voces siguen el timbre del audio de referencia.
ImagenSonido
03
Lleva el reparto al plano siguiente
Entre una petición y otra no se recuerda nada. El segundo plano lleva las mismas referencias que el primero, más — y esta es la parte que la gente se salta — un fotograma que guardaste del primero. La salida del último plano es la mejor referencia que vas a tener para el siguiente.
Vuelve a adjuntar cada vezGuarda un fotograma
Pista de audio · 32 kHzSHOT-01.MP4
04
Prueba en 768P, remata el bueno en 2K
Un segundo en 768P son 8 créditos frente a 13 en 2K, y subir después un clip de 768P ya terminado cuesta exactamente lo que habría costado renderizarlo en 2K — así que las seis tomas que hacen falta para clavar una cara te salen más baratas. Una generación fallida se reembolsa sola.
768P · 8 créditos por segundo2K · 13 créditos por segundo
Se va entre planos, no dentro de ellos. Esto es lo que eso te cuesta.
Todas las páginas que venden consistencia de personaje te enseñan un clip, y dentro de un clip el problema está casi resuelto. El encargo que tienes de verdad son seis clips que montan juntos, y esa es otra medición: la de aquí abajo, tomada entre videos en vez de dentro de uno.
01La cifra de entre planos es la de verdad
Los métodos condicionados por referencia sacan una similitud ArcFace de 0,54 a 0,59 entre dos videos de la misma persona. Dentro de un solo clip sacan más. Haz el presupuesto pensando en el corte, no en la toma.
0,54–0,59 entre clips
02Una frontal vale por tres en ángulo
Cuando la imagen de referencia no es frontal, la puntuación de identidad del mejor sistema publicado cae más de un 50%. Si tienes un buen fotograma de tu personaje, ese es el que hay que mandar — y hay que mandarlo cada vez.
caída >50% sin frontal
03Los topes son 9 imágenes, 3 clips y 3 audios
Doce archivos en total en una petición, y el audio tiene que viajar con una imagen o con un video en vez de ir solo. Ese tope es la cifra que vale la pena comparar: casi ninguna puerta alojada a este modelo publica la suya.
12 archivos, una petición
04Nombra lo que no puede cambiar
Los ejemplos publicados que aguantan enumeran los rasgos de uno en uno — el pelo medio recogido, la corona plateada, el color de la chaqueta. Un rasgo que no nombraste es un rasgo que el redibujo puede reinterpretar, y suele hacerlo hacia el cuarto plano.
rasgos, enumerados
05Una escena es una petición por plano
H3 renderiza un solo plano continuo de 4 a 15 segundos. Una escena de seis planos son seis peticiones de unos $1.52 cada una y una pasada en tu editor — unos $9 la escena, que es la cifra que hay que pesar frente a una suscripción mensual por identidad.
6 planos ≈ $9
Las fuentes, para que las puedas comprobar: las cifras de deriva dentro de un clip son la columna ArcFace del Face Consistency Benchmark (video real 0,0843, mejor modelo medido 0,1734, peor 0,4843 — cuanto más bajo, mejor); las cifras entre clips y la caída sin frontal salen de ContextAnyone y FaithfulFaces. Ninguno de los tres probó MiniMax H3, y nosotros no hemos corrido el benchmark — están aquí para dimensionar el problema, no para clasificar este modelo.
Por qué esto y no una biblioteca de personajes
Un personaje es una voz tanto como una cara
Pregúntale a cualquiera que monte un microdrama. La mitad de las tomas que se tiran se tiran porque la cara aguantó y la interpretación no — y en la mayoría de las herramientas la voz es un segundo producto, que se compra aparte y se sincroniza a mano.
Una petición, una pasada
La voz vuelve con la cara
El estéreo de 32 kHz se genera junto a la imagen, y el audio puede ser una de tus referencias — así que el timbre que adjuntas es el timbre que dice la frase nueva. Sin paso de sincronización de labios y sin suscripción de voz aparte.
Doce archivos a la vez
El reparto entero cabe en una petición
Nueve imágenes, tres clips y tres audios, doce en total. Una escena a dos con vestuario y una placa de localización cabe de sobra ahí dentro, que es la razón por la que el teaser vampírico de arriba sostiene a dos personas y no a una.
Nada guardado
Ninguna identidad que entrenar y ningún alquiler por ella
Aquí no hay Soul ID, ni ranura de personaje, ni cuota por identidad — los archivos viven en tu disco y suben con la petición. Eso es peor si quieres una plantilla de actores; es mejor si tienes un personaje y seis planos.
Una tarifa, seis formatos
El vertical cuesta lo que el panorámico
21:9, 16:9, 4:3, 1:1, 3:4 y 9:16 se cobran todos a la misma tarifa por segundo, porque arriba se factura por segundo y la forma da igual. El microdrama es vertical y no cuesta más por serlo.
Lo que pierdes
Una garantía. Este es el límite honesto de la categoría entera: una referencia hace que la cara se lea como la misma persona en la mayoría de las tomas, y entre planos las cifras publicadas se quedan cerca de 0,55 de similitud, no cerca de 1. Si lo que entregas necesita una cara exacta al fotograma — un actor conocido, la persona que representa a una marca, una imagen con derechos —, contrata a esa persona y grábala. Genera los planos que la rodean.
Encargos que se repiten
Cuatro encargos de personaje que sobreviven quince segundos
Cuatro encargos distintos, cuatro clips que se hicieron así de verdad, y detrás de cada botón el prompt que los hizo. Todos quieren un archivo tuyo — la etiqueta del clip dice cuál, y el botón abre la puerta correcta.
16:9 · 6 s · 2 imágenes de referencia + 1 clip
Cambia a uno de ellos, conserva el resto
Dos ediciones en una frase: el niño del fondo se convierte en el perro de la Imagen 1, y la chaqueta de más a la izquierda cambia de color. No se menciona a nadie más del plano, y nadie más cambia. Esta es la forma de una nota que le darías a un montador, y es la forma que H3 lee.
16:9 · 6 s · 1 clip como referencia
Añade a alguien que encaje ahí
Una línea, y el recién llegado hereda el uniforme, la forma de andar y la luz. El modelo no está pegando un recorte encima — está redibujando el plano con una persona más dentro, que es la razón por la que la sombra cae bien y la razón por la que no puedes recuperar los píxeles originales.
16:9 · 15 s · 2 imágenes de referencia
Un personaje dibujado, fiel a la hoja de modelo
La ilustración es donde más se nota la deriva, porque una cara dibujada no tiene holgura fotográfica en la que esconderse: la separación de los ojos coincide con la hoja de modelo o no coincide. La Imagen 2 es una referencia estricta de identidad, y el resto del prompt es cámara y atmósfera.
9:16 · 15 s · 2 imágenes de referencia
Una escena vertical con el reparto fijado
El microdrama vertical es el encargo para el que existe esta página: decenas de planos, las mismas dos caras, en vertical. Quince segundos son un plano — el reparto es lo que vuelves a adjuntar en la siguiente petición, y el montaje ocurre en tu editor, no aquí.
Los cuatro son ejemplos publicados por la propia MiniMax, recopilados bajo CC BY 4.0 — que es la razón por la que cada botón puede cargar el prompt exactamente como se corrió.
Lo que cuesta de verdad
Una escena de seis planos con un personaje son 414 créditos. Unos $9.
Un clip son 5 créditos planos por la pasada de comprensión del prompt, más 8 créditos por segundo en 768P o 13 por segundo en 2K. Las referencias no se cobran — adjuntar nueve imágenes cuesta lo mismo que no adjuntar ninguna. Un crédito es un centavo del precio de lista que publica la propia MiniMax, así que todo esto se puede contrastar contra una página que este sitio no controla. Una generación que falla se reembolsa sola, que aquí importa más que en ningún otro sitio: sostener una cara es un trabajo que se reintenta.
Sí, comercialmente — y la cuestión del parecido es tuya
Esta es la única página del sitio donde los derechos que importan no son los nuestros. Subir una cara no es lo mismo que subir un logotipo, así que aquí está la posición antes de que gastes nada.
Uso comercialTambién el gratis. Sin marca de agua en ningún plan, sin regalías por clip, sin licencia aparte que comprar. MiniMax no reclama derechos sobre los Resultados que generas, y este sitio no añade ninguno propio.
Una cara que no es tuyaLa que importa aquí. Nada de esta página te da derechos sobre la imagen de alguien, y la cara de una persona real no es tuya para meterla en un anuncio porque tuvieras una foto suya. Consigue la misma autorización que conseguirías para un rodaje.
Tus propios intérpretesUna imagen fija de alguien que ha dado su consentimiento sigue siendo tuya. Lo que subes se usa para correr tu petición; lo que vuelve es tuyo para emitirlo, y se aplican las mismas comprobaciones legales que harías sobre metraje grabado.
Lo que se rechazaLa violencia explícita y el contenido sexual se rechazan en la puerta de entrada antes de facturar un segundo, y también el material hecho para hacer pasar a una persona generada por una figura pública real. Esa comprobación corre sobre el prompt y sobre lo que adjuntas.
Lo que aprendimos sosteniendo personajes con MiniMax H3
Medido sobre generaciones reales en vez de leído en una ficha de modelo — los topes de referencias, la retícula de fotogramas donde tiene que caer un corte y cómo se escribe el sonido.
Preguntas frecuentes sobre el personaje consistente con IA
Las ocho preguntas que la gente hace antes de comprometer un personaje a una escena, respondidas con los números que hay detrás.
01
¿Este generador de video con personaje consistente es gratis?
El primer clip sí, y es el modelo de verdad — 4 segundos, 768P, con sonido, sin marca de agua, sin tarjeta, y no caduca. Todo lo de esta página se reproduce sin cuenta ninguna. Después, un plano de 8 segundos en 768P son 69 créditos y uno de 15 son 125; los créditos arrancan en $9.9, lo que deja una escena de seis planos en unos $9. Una generación que falla no te cuesta nada.
02
¿El personaje va a salir realmente igual en cada plano?
Que se lea como la misma persona, sí, en la mayoría de las tomas. Idéntico fotograma a fotograma, no — y ninguna herramienta de esta categoría lo entrega. Las mediciones publicadas dejan la similitud de identidad condicionada por referencia entre dos clips en torno a 0,54–0,59, frente a una base de metraje real que es mucho más ajustada. Cuenta con quedarte cuatro tomas de cada seis, y con volver a adjuntar las mismas referencias en cada petición.
03
¿Cuántos archivos de referencia puedo adjuntar?
Hasta 9 imágenes, 3 clips de video y 3 audios, 12 archivos en total en una petición. El audio tiene que viajar con una imagen o con un clip en vez de ir solo. Adjuntar referencias no cuesta nada extra — lo que pagas son los segundos que renderizas.
04
¿Qué sostiene mejor a un personaje, unas fotos o un clip de video?
Sostienen cosas distintas. Una imagen fija es la señal más fuerte para la cara y el vestuario; un clip lleva la forma de andar, el ritmo y la cámara. Usa las dos y di en el prompt cuál es cuál. Si sólo tienes un archivo, que sea una frontal limpia: con entrada no frontal, la puntuación de identidad medida cae más de la mitad.
05
¿El personaje puede conservar la misma voz?
Sí — adjunta el audio como referencia y H3 dice tu frase nueva con ese timbre, generado en la misma pasada que la imagen en vez de doblado encima después. Es una referencia de timbre, no una voz clonada que puedas guardar en el banco, y necesita una imagen o un clip al lado.
06
¿En qué se diferencia de un Soul ID o de una biblioteca de personajes?
Esos te guardan una identidad y te cobran una suscripción por la plantilla de actores — de $15 a $129 al mes en Higgsfield, por ejemplo. Aquí no hay nada guardado: tus archivos suben con cada petición y pagas segundos. Peor si estás gestionando veinte personajes, mejor si tienes uno y seis planos que hacer.
07
¿Puedo hacer una escena entera de una vez?
No. H3 renderiza un solo plano continuo de 4 a 15 segundos enteros a 24 fps, así que una escena es una petición por plano y el montaje ocurre en tu editor. Las duraciones caen sobre una retícula de 17n+5 fotogramas, lo que convierte a los 192 fotogramas — exactamente 8,000 segundos — en el único segundo entero del rango y en el que hay que usar si tus planos tienen que cortar con música.
08
¿Puedo usar la cara de otra persona como referencia?
Sólo si tienes derecho a hacerlo. Nada de aquí te da derechos sobre la imagen de una persona, y generar a una figura pública real se rechaza en la puerta de entrada. Con tus propios intérpretes, consigue la misma autorización que conseguirías para un rodaje; lo que vuelve es entonces tuyo para usarlo comercialmente, en todos los planes y también en el gratis.
Deja de describir a tu personaje. Hazle el casting.
Una imagen fija, una frase que diga para qué sirve cada archivo, y un plano de vuelta en unos noventa segundos. El primero es gratis — sin tarjeta, sin marca de agua, y es tuyo para usarlo comercialmente.