Generador de video con personaje consistente

Ningún modelo de video recuerda a tu personaje de una petición a la siguiente, y los que dicen que sí lo hacen guardan el archivo y te lo devuelven. Así que sáltate la identidad que hay que entrenar primero: adjunta las imágenes fijas, el clip y la voz al plano que estás pidiendo, hasta doce archivos en una sola petición.
El primero es gratis. Sin tarjeta.

Escribe el siguiente plano

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • Dale al personaje un archivo, no un adjetivo — una imagen frontal limpia gana siempre a un párrafo de descripción
  • Di para qué sirve cada archivo: este es la cara, este es el movimiento, este es la voz
  • Nombra los rasgos que no se pueden mover — el pelo, la chaqueta, la cicatriz. Lo que no nombras queda a merced del modelo
  • Una escena es una petición por plano, y las mismas referencias vuelven a entrar cada vez

Sin tarjeta: todos los clips de esta página se reproducen sin cuenta, y una cuenta gratuita corre uno tuyo — 4 s, 768P, con sonido, sin marca de agua, tuyo para descargarlo y para usarlo comercialmente.

Cuatro maneras de sostener a un personaje, sacadas de los ejemplos que publica la propia MiniMax. Cada tarjeta abre el prompt completo.

Video con personaje consistente: una pareja en el fregadero de la cocina se lanza espuma de lavavajillas, con la cara de ella tomada de una imagen fija y su ritmo de un clip aparte

La cara sale de una fija, la interpretación de un clip

Entra el prompt, sale el reparto

El prompt a la izquierda. Lo que devolvió, a la derecha.

La cara sale de una fija, la interpretación de un clip16:9 · 15 s · 1 imagen de referencia + 1 clip

Dos archivos, dos encargos. La imagen fija dice quién es esta persona; el clip dice cómo se mueve, a qué velocidad y con qué ritmo. Ninguno hace el trabajo del otro — y el prompt nombra qué archivo responde a qué pregunta antes de describir una sola acción.

The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.

Video con personaje consistente: una pareja en el fregadero de la cocina se lanza espuma de lavavajillas, con la cara de ella tomada de una imagen fija y su ritmo de un clip aparte
Un personaje sostenido quince segundos16:9 · 15 s · 2 imágenes de referencia

Lee la primera cláusula: usa la Imagen 2 como referencia fija del personaje, y después cuatro rasgos nombrados uno por uno — el pelo negro medio recogido, la corona plateada hueca, la túnica, la paleta de color. Esa lista es todo el truco. Los rasgos que no nombras son rasgos que el modelo puede redibujar a su aire.

Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.

Video con personaje consistente: una heroína xianxia de túnica blanca y corona de pelo plateada atraviesa una secuencia nevada con el vestuario intacto de un plano a otro
Dos protagonistas, un teaser9:16 · 15 s · 2 imágenes de referencia

Un reparto, no un personaje. El prompt fija a los dos protagonistas a sus imágenes de referencia antes de escribir un solo tiempo, porque una escena con dos personas son dos identidades que pueden irse cada una por su lado — y la que no anclaste es la que se mueve.

Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.

Video con personaje consistente: un teaser vertical de romance vampírico que sostiene a los mismos dos protagonistas en un portal, un pasillo y un plano corto a dos
Reparto nuevo, misma coreografía16:9 · 6 s · 1 clip como referencia

La identidad que se sostiene aquí no es una cara — es una rutina. Tres hombres de traje se convierten en tres capibaras, y cada tiempo de una secuencia de suelo de nueve movimientos sobrevive al cambio porque quien lleva el ritmo es el clip, no la frase.

Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.

Video con personaje consistente: tres capibaras en traje ejecutan una rutina de suelo compleja siguiendo exactamente el movimiento de los tres hombres del clip que se da como referencia

Qué es esto, y qué no es

Aquí nada recuerda a tu personaje. Ese es el problema entero, y el método entero.

Esta parte va primero, porque decide si deberías estar aquí siquiera. Todos los productos que venden consistencia de personaje te venden una identidad guardada — Higgsfield entrena un Soul ID, Vidu conserva un juego de referencias, Runway ancla una sesión. Lo que se guarda es un archivo, y lo que pasa en el momento de generar es que ese archivo se adjunta a tu petición.
Así que la pregunta no es si una herramienta recuerda. Es cuántos archivos acepta a la vez, y qué estás pagando por tenerlos guardados en algún sitio.

Las mediciones son duras con todo el mundo, y conviene saberlo antes de hacer el presupuesto. En el Face Consistency Benchmark, una cara dentro de un solo clip de texto a video se va entre 2,1 y 5,7 veces más lejos que esa misma medición sobre metraje real — 0,0843 de distancia coseno ArcFace en video real frente a 0,1734 en el mejor modelo medido y 0,4843 en el peor. Entre dos clips distintos la cosa empeora, no mejora: los métodos condicionados por referencia de la comparativa ContextAnyone se quedan en una similitud ArcFace de 0,54 a 0,59 entre videos.
Una imagen fija de referencia es la palanca más grande que existe, y no es un candado. Lo que te compra es una cara que quien mira lee como la misma persona, en la mayoría de las tomas, por el precio de una toma.

Al mes, por una identidad guardada
$15–$129

Al mes, por una identidad guardada

Por intento en otros sitios, según la duración
$0.45–$2.00

Por intento en otros sitios, según la duración

Imágenes, clips y audios en una petición
9 · 3 · 3

Imágenes, clips y audios en una petición

Un plano de 8 segundos aquí, con sonido
~$1.52

Un plano de 8 segundos aquí, con sonido

  • Sin identidad que entrenar antes del primer plano
  • Sin biblioteca de personajes por la que seguir pagando alquiler
  • Sin pasada aparte de sincronización de labios que comprar
  • Sin marca de agua que explicar, en ningún plan

Lo que pones tú

Cuatro maneras de decir quién es esta persona

Lo único que de verdad importa: el modelo vuelve a renderizar cada píxel, la cara incluida. Nunca pega tu referencia dentro. Así que el trabajo de cada archivo de aquí abajo es acotar un redibujo, no aportar un material.

  • Imágenes fijas del personaje

    Hasta nueve. Una frontal limpia vale más que tres ángulos malos — medido sobre referencias que no son frontales, la puntuación de identidad cae más de la mitad. Añade el vestuario y el atrezo como imágenes propias.

    La señal más fuerte · hasta 9 imágenes
  • Un clip en el que ya sale

    Hasta tres. Un video lleva lo que una imagen fija no puede: la forma de andar, el ritmo, cómo sostiene una pausa, un recorrido de cámara. Dos de los cuatro ejemplos de esta página sacan de ahí su interpretación.

    Movimiento y ritmo · hasta 3 clips
  • Su voz

    Hasta tres audios, y una identidad es una voz tanto como una cara. H3 toma el timbre como referencia y dice tu frase nueva con él, en la misma pasada que la imagen. El audio tiene que viajar con una imagen o con un clip.

    Timbre, no un clon · hasta 3 audios
  • Nada más que una descripción

    Funciona dentro de un plano y deja de funcionar entre uno y otro. Escríbelo una vez, genera el personaje, quédate con el fotograma que te guste y úsalo como referencia para todo lo que venga después.

    Un solo plano · texto a video

Las cuatro corren en el mismo modelo y a una sola tarifa — 8 créditos por segundo en 768P, 13 en 2K, más 5 por el clip. Las referencias no cuestan nada extra. Cada límite y cada tarifa, con la fecha del último cambio.

De principio a fin

Cómo sostener un personaje en cuatro pasos

Aquí el orden importa más que en ninguna otra página del sitio, porque un reparto que no fijaste en el primer plano es un reparto que ya no recuperas en el sexto.

  1. Un personaje xianxia de túnica blanca, el fotograma que se convierte en la imagen fija de referencia

    Haz el casting antes de escribir

    Elige los fotogramas que van a ser el personaje, y elígelos como si estuvieras haciendo un casting: una frontal limpia, un tres cuartos, el vestuario, el atrezo. Sólo con entrada no frontal, la puntuación de identidad medida cae más de la mitad — así que la frontal no es una preferencia, es el archivo que sostiene todo lo demás.

    Hasta 9 imágenesUna frontal limpia
  2. Un plano a dos en una cocina cuyas caras vinieron de una imagen fija y cuyo ritmo vino de un clip

    Dale a cada archivo un papel dentro de la frase

    H3 lee el prompt con un modelo de lenguaje, así que se le puede decir qué archivo responde a qué pregunta. La Imagen 1 es el personaje; el Video 1 es la acción y el ritmo es una frase que funciona. Adjuntar cuatro archivos y describir una escena, no.

    Nombra el archivoNombra su papel
  3. Dos protagonistas en un teaser vertical, sostenidos a través de un corte

    El aspecto del protagonista y de la protagonista sigue estrictamente las imágenes de referencia… sus voces siguen el timbre del audio de referencia.

    ImagenSonido

    Lleva el reparto al plano siguiente

    Entre una petición y otra no se recuerda nada. El segundo plano lleva las mismas referencias que el primero, más — y esta es la parte que la gente se salta — un fotograma que guardaste del primero. La salida del último plano es la mejor referencia que vas a tener para el siguiente.

    Vuelve a adjuntar cada vezGuarda un fotograma
  4. Un protagonista masculino dibujado en primer plano, la toma terminada
    Pista de audio · 32 kHzSHOT-01.MP4

    Prueba en 768P, remata el bueno en 2K

    Un segundo en 768P son 8 créditos frente a 13 en 2K, y subir después un clip de 768P ya terminado cuesta exactamente lo que habría costado renderizarlo en 2K — así que las seis tomas que hacen falta para clavar una cara te salen más baratas. Una generación fallida se reembolsa sola.

    768P · 8 créditos por segundo2K · 13 créditos por segundo

Cuatro pasos, sin instalar nada, sin tarjeta. Abrir el generador.

Lo que nadie te cuenta

Se va entre planos, no dentro de ellos. Esto es lo que eso te cuesta.

Todas las páginas que venden consistencia de personaje te enseñan un clip, y dentro de un clip el problema está casi resuelto. El encargo que tienes de verdad son seis clips que montan juntos, y esa es otra medición: la de aquí abajo, tomada entre videos en vez de dentro de uno.

  1. 01La cifra de entre planos es la de verdad

    Los métodos condicionados por referencia sacan una similitud ArcFace de 0,54 a 0,59 entre dos videos de la misma persona. Dentro de un solo clip sacan más. Haz el presupuesto pensando en el corte, no en la toma.

    0,54–0,59 entre clips

  2. 02Una frontal vale por tres en ángulo

    Cuando la imagen de referencia no es frontal, la puntuación de identidad del mejor sistema publicado cae más de un 50%. Si tienes un buen fotograma de tu personaje, ese es el que hay que mandar — y hay que mandarlo cada vez.

    caída >50% sin frontal

  3. 03Los topes son 9 imágenes, 3 clips y 3 audios

    Doce archivos en total en una petición, y el audio tiene que viajar con una imagen o con un video en vez de ir solo. Ese tope es la cifra que vale la pena comparar: casi ninguna puerta alojada a este modelo publica la suya.

    12 archivos, una petición

  4. 04Nombra lo que no puede cambiar

    Los ejemplos publicados que aguantan enumeran los rasgos de uno en uno — el pelo medio recogido, la corona plateada, el color de la chaqueta. Un rasgo que no nombraste es un rasgo que el redibujo puede reinterpretar, y suele hacerlo hacia el cuarto plano.

    rasgos, enumerados

  5. 05Una escena es una petición por plano

    H3 renderiza un solo plano continuo de 4 a 15 segundos. Una escena de seis planos son seis peticiones de unos $1.52 cada una y una pasada en tu editor — unos $9 la escena, que es la cifra que hay que pesar frente a una suscripción mensual por identidad.

    6 planos ≈ $9

Las fuentes, para que las puedas comprobar: las cifras de deriva dentro de un clip son la columna ArcFace del Face Consistency Benchmark (video real 0,0843, mejor modelo medido 0,1734, peor 0,4843 — cuanto más bajo, mejor); las cifras entre clips y la caída sin frontal salen de ContextAnyone y FaithfulFaces. Ninguno de los tres probó MiniMax H3, y nosotros no hemos corrido el benchmark — están aquí para dimensionar el problema, no para clasificar este modelo.

Por qué esto y no una biblioteca de personajes

Un personaje es una voz tanto como una cara

Pregúntale a cualquiera que monte un microdrama. La mitad de las tomas que se tiran se tiran porque la cara aguantó y la interpretación no — y en la mayoría de las herramientas la voz es un segundo producto, que se compra aparte y se sincroniza a mano.

  • Una petición, una pasada

    La voz vuelve con la cara

    El estéreo de 32 kHz se genera junto a la imagen, y el audio puede ser una de tus referencias — así que el timbre que adjuntas es el timbre que dice la frase nueva. Sin paso de sincronización de labios y sin suscripción de voz aparte.

  • Doce archivos a la vez

    El reparto entero cabe en una petición

    Nueve imágenes, tres clips y tres audios, doce en total. Una escena a dos con vestuario y una placa de localización cabe de sobra ahí dentro, que es la razón por la que el teaser vampírico de arriba sostiene a dos personas y no a una.

  • Nada guardado

    Ninguna identidad que entrenar y ningún alquiler por ella

    Aquí no hay Soul ID, ni ranura de personaje, ni cuota por identidad — los archivos viven en tu disco y suben con la petición. Eso es peor si quieres una plantilla de actores; es mejor si tienes un personaje y seis planos.

  • Una tarifa, seis formatos

    El vertical cuesta lo que el panorámico

    21:9, 16:9, 4:3, 1:1, 3:4 y 9:16 se cobran todos a la misma tarifa por segundo, porque arriba se factura por segundo y la forma da igual. El microdrama es vertical y no cuesta más por serlo.

Lo que pierdes

Una garantía. Este es el límite honesto de la categoría entera: una referencia hace que la cara se lea como la misma persona en la mayoría de las tomas, y entre planos las cifras publicadas se quedan cerca de 0,55 de similitud, no cerca de 1. Si lo que entregas necesita una cara exacta al fotograma — un actor conocido, la persona que representa a una marca, una imagen con derechos —, contrata a esa persona y grábala. Genera los planos que la rodean.

Encargos que se repiten

Cuatro encargos de personaje que sobreviven quince segundos

Cuatro encargos distintos, cuatro clips que se hicieron así de verdad, y detrás de cada botón el prompt que los hizo. Todos quieren un archivo tuyo — la etiqueta del clip dice cuál, y el botón abre la puerta correcta.

  • Video con personaje consistente: unos niños corren por un campo en verano, uno de ellos sustituido por un golden retriever y una chaqueta recoloreada, el resto intacto
    16:9 · 6 s · 2 imágenes de referencia + 1 clip

    Cambia a uno de ellos, conserva el resto

    Dos ediciones en una frase: el niño del fondo se convierte en el perro de la Imagen 1, y la chaqueta de más a la izquierda cambia de color. No se menciona a nadie más del plano, y nadie más cambia. Esta es la forma de una nota que le darías a un montador, y es la forma que H3 lee.

  • Video con personaje consistente: se añade una figura con traje a juego a la izquierda de un plano a dos, moviéndose al paso de los demás
    16:9 · 6 s · 1 clip como referencia

    Añade a alguien que encaje ahí

    Una línea, y el recién llegado hereda el uniforme, la forma de andar y la luz. El modelo no está pegando un recorte encima — está redibujando el plano con una persona más dentro, que es la razón por la que la sombra cae bien y la razón por la que no puedes recuperar los píxeles originales.

  • Video con personaje consistente: el protagonista masculino de un juego otome con chaqueta de cuero atraviesa un PV de ciudad nocturna con su diseño intacto en cada corte
    16:9 · 15 s · 2 imágenes de referencia

    Un personaje dibujado, fiel a la hoja de modelo

    La ilustración es donde más se nota la deriva, porque una cara dibujada no tiene holgura fotográfica en la que esconderse: la separación de los ojos coincide con la hoja de modelo o no coincide. La Imagen 2 es una referencia estricta de identidad, y el resto del prompt es cámara y atmósfera.

  • Video con personaje consistente: una discusión de microdrama vertical en el interior de un restaurante pequeño, con los mismos dos intérpretes sostenidos durante todo el intercambio
    9:16 · 15 s · 2 imágenes de referencia

    Una escena vertical con el reparto fijado

    El microdrama vertical es el encargo para el que existe esta página: decenas de planos, las mismas dos caras, en vertical. Quince segundos son un plano — el reparto es lo que vuelves a adjuntar en la siguiente petición, y el montaje ocurre en tu editor, no aquí.

Los cuatro son ejemplos publicados por la propia MiniMax, recopilados bajo CC BY 4.0 — que es la razón por la que cada botón puede cargar el prompt exactamente como se corrió.

Lo que cuesta de verdad

Una escena de seis planos con un personaje son 414 créditos. Unos $9.

Un clip son 5 créditos planos por la pasada de comprensión del prompt, más 8 créditos por segundo en 768P o 13 por segundo en 2K. Las referencias no se cobran — adjuntar nueve imágenes cuesta lo mismo que no adjuntar ninguna. Un crédito es un centavo del precio de lista que publica la propia MiniMax, así que todo esto se puede contrastar contra una página que este sitio no controla. Una generación que falla se reembolsa sola, que aquí importa más que en ningún otro sitio: sostener una cara es un trabajo que se reintenta.

Lo que cuesta un plano de personaje, por duración

Un plano de 4 s, 768P
37 créditos
Un plano de 8 s, 768P
69 créditos
Un plano de 15 s, 768P
125 créditos
Seis planos de 8 s, 768P
414 créditos
Un plano de 8 s, 2K
109 créditos
Seis planos de 8 s, 2K
654 créditos

Precios completos · cada límite y cada tarifa, con fecha · lo que cuesta de verdad un segundo en 2K

Los mismos créditos al mes en los dos casos

  • GratisSin tarjeta

    Un clip real de MiniMax H3, con sonido. Todo lo que pase de 4 s · 768P corre con créditos.

    $0para siempre

    Sin tarjeta en ningún momento

    Empezar gratis

    Sólo verificación antibot — sin email

    1 clip en MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · con sonido
    Entra 7 días seguidos — 37 créditos, un clip más

    Cualquier pack desde $9.9 desbloquea el generador de videos con IA MiniMax H3 — todos los modos, 768P y 2K

    • MiniMax H3 en 2K nativoSólo de pago
    • Audio nativo junto con la imagenSólo de pago
    • Un clip, sin tarjeta
    • 1 clip a la vez
    • Los clips fallidos no cuestan nada
    • Generación privada
    • Cualquier pack desbloquea el generador de videos con IA MiniMax H3 en todos los modos

    La capa gratuita es otro motor. Ver planes

    Velocidad y cola

    Cola
    Carril gratuito
    Tareas a la vez
    1
    Lote
    1
    Historial
    24 h · 7 días con sesión iniciada
    Soporte
    Comunidad
  • LiteAhorra 30%

    Desbloquea el generador de videos con IA MiniMax H3 en 2K nativo. El plan de pago más pequeño — Pro es el que elige casi todo el mundo.

    $16.9/mo$24.9

    $202.8 cobrados una vez al año · Ahorra $96 al año

    Devolución en 7 días · cancela cuando quieras

    750 créditos / mes · ~20 videos

    4 s · 768P · texto a video

    o ~13 a 4 s en 2K

    Los mismos créditos al mes o al año

    • MiniMax H3 en 2K nativo — con audio nativo
    • Diálogo, efectos y música en el mismo archivo
    • Hasta 15 segundos15 s
    • ~20 videos al mes a 4 s en 768P, texto a video
    • Los clips fallidos no cuestan nada
    • Devolución en 7 días si no gastaste créditos
    • 1 tarea a la vez
    • 2 variantes de un prompt en lote

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Estándar
    Tareas a la vez
    1
    Lote
    2
    Historial
    7 días
    Soporte
    Email · 48 h
  • Recomendado para casi todos
    ProAhorra 30%

    $32 más que Lite. ~47 videos al mes, el mismo generador de videos con IA MiniMax H3, con la cola más rápida.

    $39.9/mo$56.9

    $478.8 cobrados una vez al año · Ahorra $204 al año

    Devolución en 7 días · cancela cuando quieras

    1 775 créditos / mes · ~47 videos

    4 s · 768P · texto a video

    o ~31 a 4 s en 2K

    Los mismos créditos al mes o al año

    • Todo lo de Lite
    • ~47 videos al mes a 4 s en 768P, texto a video
    • 3 tareas a la vez
    • Video a prompt
    • 4 variantes de un prompt en lote
    • Historial de 7 días
    • Devolución en 7 días si no gastaste créditos

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Rápida
    Tareas a la vez
    3
    Lote
    4
    Historial
    7 días
    Soporte
    Email · 12 h
  • StudioAhorra 30%

    Un mes entero de volumen, el primero de la cola y una persona que responde en 4 horas.

    $99.9/mo$142.9

    $1 198.8 cobrados una vez al año · Ahorra $516 al año

    Devolución en 7 días · cancela cuando quieras

    4 425 créditos / mes · ~119 videos

    4 s · 768P · texto a video

    o ~77 a 4 s en 2K

    Los mismos créditos al mes o al año

    • Todo lo de Pro
    • ~119 videos al mes a 4 s en 768P, texto a video
    • 8 tareas a la vez
    • 4 variantes de un prompt en lote
    • Historial de 7 días
    • Soporte prioritario en 4 horas
    • El menor gasto de créditos que damos
    • Devolución en 7 días si no gastaste créditos

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Prioritaria — el primero de la cola
    Tareas a la vez
    8
    Lote
    4
    Historial
    7 días
    Soporte
    Prioritario · 4 h

¿De verdad lo puedes usar?

Sí, comercialmente — y la cuestión del parecido es tuya

Esta es la única página del sitio donde los derechos que importan no son los nuestros. Subir una cara no es lo mismo que subir un logotipo, así que aquí está la posición antes de que gastes nada.

  • Uso comercialTambién el gratis. Sin marca de agua en ningún plan, sin regalías por clip, sin licencia aparte que comprar. MiniMax no reclama derechos sobre los Resultados que generas, y este sitio no añade ninguno propio.
  • Una cara que no es tuyaLa que importa aquí. Nada de esta página te da derechos sobre la imagen de alguien, y la cara de una persona real no es tuya para meterla en un anuncio porque tuvieras una foto suya. Consigue la misma autorización que conseguirías para un rodaje.
  • Tus propios intérpretesUna imagen fija de alguien que ha dado su consentimiento sigue siendo tuya. Lo que subes se usa para correr tu petición; lo que vuelve es tuyo para emitirlo, y se aplican las mismas comprobaciones legales que harías sobre metraje grabado.
  • Lo que se rechazaLa violencia explícita y el contenido sexual se rechazan en la puerta de entrada antes de facturar un segundo, y también el material hecho para hacer pasar a una persona generada por una figura pública real. Esa comprobación corre sobre el prompt y sobre lo que adjuntas.

El uso responsable, completo

Antes de gastar nada

Preguntas frecuentes sobre el personaje consistente con IA

Las ocho preguntas que la gente hace antes de comprometer un personaje a una escena, respondidas con los números que hay detrás.

¿Este generador de video con personaje consistente es gratis?

El primer clip sí, y es el modelo de verdad — 4 segundos, 768P, con sonido, sin marca de agua, sin tarjeta, y no caduca. Todo lo de esta página se reproduce sin cuenta ninguna. Después, un plano de 8 segundos en 768P son 69 créditos y uno de 15 son 125; los créditos arrancan en $9.9, lo que deja una escena de seis planos en unos $9. Una generación que falla no te cuesta nada.

¿El personaje va a salir realmente igual en cada plano?

Que se lea como la misma persona, sí, en la mayoría de las tomas. Idéntico fotograma a fotograma, no — y ninguna herramienta de esta categoría lo entrega. Las mediciones publicadas dejan la similitud de identidad condicionada por referencia entre dos clips en torno a 0,54–0,59, frente a una base de metraje real que es mucho más ajustada. Cuenta con quedarte cuatro tomas de cada seis, y con volver a adjuntar las mismas referencias en cada petición.

¿Cuántos archivos de referencia puedo adjuntar?

Hasta 9 imágenes, 3 clips de video y 3 audios, 12 archivos en total en una petición. El audio tiene que viajar con una imagen o con un clip en vez de ir solo. Adjuntar referencias no cuesta nada extra — lo que pagas son los segundos que renderizas.

¿Qué sostiene mejor a un personaje, unas fotos o un clip de video?

Sostienen cosas distintas. Una imagen fija es la señal más fuerte para la cara y el vestuario; un clip lleva la forma de andar, el ritmo y la cámara. Usa las dos y di en el prompt cuál es cuál. Si sólo tienes un archivo, que sea una frontal limpia: con entrada no frontal, la puntuación de identidad medida cae más de la mitad.

¿El personaje puede conservar la misma voz?

Sí — adjunta el audio como referencia y H3 dice tu frase nueva con ese timbre, generado en la misma pasada que la imagen en vez de doblado encima después. Es una referencia de timbre, no una voz clonada que puedas guardar en el banco, y necesita una imagen o un clip al lado.

¿En qué se diferencia de un Soul ID o de una biblioteca de personajes?

Esos te guardan una identidad y te cobran una suscripción por la plantilla de actores — de $15 a $129 al mes en Higgsfield, por ejemplo. Aquí no hay nada guardado: tus archivos suben con cada petición y pagas segundos. Peor si estás gestionando veinte personajes, mejor si tienes uno y seis planos que hacer.

¿Puedo hacer una escena entera de una vez?

No. H3 renderiza un solo plano continuo de 4 a 15 segundos enteros a 24 fps, así que una escena es una petición por plano y el montaje ocurre en tu editor. Las duraciones caen sobre una retícula de 17n+5 fotogramas, lo que convierte a los 192 fotogramas — exactamente 8,000 segundos — en el único segundo entero del rango y en el que hay que usar si tus planos tienen que cortar con música.

¿Puedo usar la cara de otra persona como referencia?

Sólo si tienes derecho a hacerlo. Nada de aquí te da derechos sobre la imagen de una persona, y generar a una figura pública real se rechaza en la puerta de entrada. Con tus propios intérpretes, consigue la misma autorización que conseguirías para un rodaje; lo que vuelve es entonces tuyo para usarlo comercialmente, en todos los planes y también en el gratis.

Deja de describir a tu personaje. Hazle el casting.

Una imagen fija, una frase que diga para qué sirve cada archivo, y un plano de vuelta en unos noventa segundos. El primero es gratis — sin tarjeta, sin marca de agua, y es tuyo para usarlo comercialmente.

Crear cuenta gratis · 1 clip en MiniMax H3

Escrito y mantenido por el equipo editorial de MiniMax H3 AI Video GeneratorPublicado el Última actualización: Versión de la herramienta 2026.09.4