Generador de sincronización de labios con IA

Suelta una foto, escribe lo que debe decir y recibes un video hablando — la voz viene con él, así que no hay ningún archivo de audio que preparar antes. De cuatro a quince segundos, hasta 2K, en once idiomas.

Desde una foto

Crear imagen

JPG · PNG · WEBP · HEIC · ≤30 MB · una cara

0 / 7000

El hablante mantiene la misma cara, el mismo pelo, la misma ropa y los mismos colores en todo el clip; sólo cambian la cámara y el movimiento descrito.

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

Todos los clips de esta página se reproducen y se descargan sin cuenta. Ejecutar tu propia frase se factura por segundo de salida — 37 créditos compran el suelo de cuatro segundos en 768P.

Salida real de MiniMax H3 · Pulsa Probar esta sincronización para cargar el prompt completo, no un resumen

Una presentadora de pódcast con auriculares sonriendo ante un micrófono de mesa mientras dice su frase, lip sync de MiniMax H38 s · 16:9 · 768P

Una foto y una frase

Qué le hace el lip sync a tu foto

Una sola fotografía, y la sincronización de labios con IA que viene con ella

No se pinta nada sobre tu imagen. La fotografía pasa a ser el primer fotograma de un plano en el que esa persona habla, y la voz se genera en la misma pasada — así que no hay ningún archivo de audio que preparar antes.

La fotografía que entró: una mujer en la mesa de un café en la acera, con la cabeza baja sobre una taza de café, sin hablar

Tu fotografía

Generado — imagen y sonido juntos

De cuatro a quince segundos enteros a 24 fps, 768P o 2K, en once idiomas que hemos ejecutado de principio a fin. JPG, PNG, WEBP, HEIC y HEIF entran directamente, cosa que conviene decir porque casi todas las fotografías de personas son fotos de móvil y casi todas las herramientas te obligan en silencio a convertirlas antes. Una foto de móvil suele animarse mejor que un retrato profesional retocado — el retoque quita la textura que el movimiento necesita. Los dientes, si puedes elegir: una boca cerrada no guarda ninguna información sobre lo que hay detrás de los labios, así que el modelo se inventa un interior, y los interiores inventados son lo que hace que un resultado se lea como falso.

Tu foto es el fotograma uno
001

Tu foto es el fotograma uno

Cualquier segundo entero
4–15 s

Cualquier segundo entero

Idiomas verificados
11

Idiomas verificados

Sonido de la misma pasada
Estéreo

Sonido de la misma pasada

  • Ningún archivo de audio que preparar
  • Ningún ajuste fotograma a fotograma
  • Ninguna pasada aparte de lip sync

El lip sync terminado

Así se ve la sincronización de labios cuando sale bien

Lo que ves es lo que salió — sin reescalado, sin etalonaje, sin segunda pasada. Al lado está el prompt completo que lo produjo, no un resumen. Pulsa Probar esta sincronización y cae directamente en la caja de arriba, con la duración y la relación con las que se hizo, para que cambies una línea y veas qué se mueve. Sube el volumen: lo que oyes salió de la misma pasada que la boca que lo dice.

Más prompts de lip sync ↗
La mujer de la fotografía de arriba, ahora de frente a cámara con la boca abierta a mitad de una nota, la misma mesa y la misma calle detrás16:9 · 6 s

El prompt completo, no un resumen

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6 s · 16:9

La fotografía de arriba, y los seis segundos en que se convirtió

Una pasada, un prompt, exactamente como lo devolvió el modelo

Qué puede abrir la boca

La sincronización de labios no tiene por qué ser la fotografía de una persona

  • Una mujer ante un espejo de tocador iluminado sosteniendo un aceite labial y hablando a cámara, con la cara fijada a la fotografía de referencia en cada corte16:9 · 15 s
    Una personaFotoUna fotografía de referencia sostenida en todos los planos, incluido un primer plano de la boca — que es donde un lip sync sobrevive a tamaño completo o no.
  • Un hombre y una mujer discutiendo en un salón, con la cámara al hombro, cada uno con una línea por turno16:9 · 15 s
    Dos personas, un cuadro165 caracteresHablan los dos, por turnos, y el prompt entero era una sola frase. Las etiquetas de hablante están ahí para cuando necesites decir quién habla primero; esta pasada no las usó.
  • Una niña con sombrero de paja hablando con una nubecita de lluvia con corona de flores dentro de un invernadero, las dos dibujadas en 2D pictórico16:9 · 15 s
    Un personaje dibujadoIlustración2D pictórico, y la boca está dibujada con la misma mano que el resto del cuadro. Nada fotorrealista en todo el plano.
  • Un gato negro con sombrero fedora y un ratón con vestido de lunares hablando en un banco del parque a la hora dorada16:9 · 15 s
    Un personaje animalAnimalUn gato y un ratón, cada uno con una línea. Las caras no son humanas y las bocas siguen cayendo en las sílabas.

Estas cuatro son pasadas de otras personas, no nuestras — por eso llevan la marca de Hailuo en la esquina y los clips del resto de esta página no. Esa marca es el recibo: cada una se publicó con su prompt por @SimplyAnnisa, @heydin_ai y @ManuAGI01, y puedes leer cada palabra de las cuatro en esos enlaces.

Lo que no está aquí, porque no lo hemos ejecutado: la fotografía de un perro o de un gato reales, y un retrato pintado. Ninguno está bloqueado y los dos merecen la pena — la misma postura que toma esta página con los idiomas más allá de los once que ha verificado. No afirmamos lo que no hemos visto volver.

El procedimiento completo

Cómo hacer lip sync a una foto en tres pasos

El paso que decide el resultado es el primero, y acertar cuesta unos cuatro segundos. Las dos primeras tarjetas son el generador de arriba de esta página a mitad de trabajo — el archivo que aceptó, la frase escrita en él. La tercera es lo que volvió.

  1. La fila de subida del generador de esta página con una fotografía aceptada: una miniatura de la mujer en la mesa del café, el nombre de archivo ref-espresso.webp y una marca verde que dice 1280×724 · 1,77:1 · 62 KB

    Suelta una cara

    Vale una foto, y también valen de dos a quince segundos de material. Una cara, mirando a cámara, nada por delante de la boca. Los archivos HEIC del iPhone entran directamente, y la caja te lee el archivo — tamaño, forma, peso — antes de que hayas gastado nada.

    Una caraJPG · PNG · WEBP · HEIC
  2. La caja de prompt del generador de esta página con una línea escrita dentro — (S1) speaks warmly, [Spanish] Lo uso cada mañana desde hace un mes — y el contador marcando 73 / 7000

    Di lo que dice

    Escribe la frase y una etiqueta de idioma y la voz llega con ella — no hay ningún archivo de audio que preparar antes. La línea de lip sync de la caja son setenta y tres caracteres de los 7 000 que tienes; todo lo demás es para describir el plano.

    73 de 7 000 caracteresNinguna voz que castear
  3. El lip sync terminado, con su audio ya dentro del archivo
    Pista de audio · 32 kHzLIP-SYNC.MP4

    Reprodúcelo y cambia una palabra

    El clip llega con el sonido ya dentro del archivo. La mayoría se queda con el segundo o el tercero, no con el primero — cada intento se guarda, así que estás editando en vez de empezar de cero.

    4–15 s · hasta 2KSonido ya mezclado dentro

Las dos primeras tarjetas son capturas de la caja de arriba de esta página, no un dibujo de una. La fotografía que subes no se modifica nunca — lo que vuelve es un archivo nuevo. El clip de la tercera tarjeta es de MiniMax, publicado con su prompt en el anuncio de H3: la imagen fijó la cara, una pista vocal fijó el canto, un fragmento de película fijó el movimiento de cámara. Esa pasada usó la vía de audio; la caja de arriba admite las dos.

Casos de uso

Para qué usa la gente la sincronización de labios

Cuatro sitios por donde empezar. Cada uno vuelca en el generador de arriba el prompt completo que hay detrás de un clip terminado, con la duración y la relación con las que se hizo.

  • Una presentadora de pódcast sonriendo ante un micrófono de mesa mientras dice una sola frase, lip sync de MiniMax H3
    16:9 · 8 s

    Una frase directa a cámara

    Todo el clip es una persona y una frase. Que no pase de unas doce palabras en seis segundos — las frases largas en duraciones cortas son la razón habitual de que el primer intento decepcione.

  • Dos personajes en un intercambio tenso en el interior de un castillo oscuro, con las dos identidades sostenidas durante la escena
    9:16 · 9 s

    Una línea de diálogo para una escena

    Un personaje dice la frase en el plano que ya te habías imaginado. Describe a la persona además de las palabras — ropa, pelo, un rasgo distintivo — y la cara se queda quieta durante todo el clip.

  • Una mujer a la puerta de una panadería hablando a cámara del cruasán gigante que sostiene, con el lip sync sostenido en cinco planos
    9:16 · 15 s

    Alguien hablando de un producto

    Imagen fija de la persona más imagen fija del producto, y las frases escritas plano a plano. Ésta es la que corre los quince segundos enteros, así que también es la que te enseña dónde está el techo.

  • Una mujer en un estudio azul haciendo lip sync a una pista de rap, con la cara fijada a la imagen de referencia
    16:9 · 15 s

    Una voz cantada, no una frase hablada

    Pon el tono en canta, o sube la voz y deja que ella mueva la boca. La pista que subes pasa a ser la banda sonora final, no una referencia para otra, y subirla no se factura. Que el clip dure al menos lo que la pista.

¿Partes de un video y tus píxeles originales tienen que sobrevivir? Eso es doblaje, y una herramienta de recortar y pegar lo hace mejor que esta página — aquí todo reconstruye el plano en vez de editarlo.

Idiomas

Once idiomas de lip sync, y el formato de línea que los mueve

Once que hemos ejecutado de principio a fin — en cada uno la boca se moldea a partir de los sonidos propios de ese idioma y no de una aproximación inglesa. Escribe la frase hablada en su propio idioma y la interpretación cuadra; escríbela en inglés con una etiqueta de idioma y no. Cómo se escribe la línea de lip sync tiene el formato.

Once verificados para lip sync

11

  • Árabe
  • Chino
  • Inglés
  • Francés
  • Alemán
  • Italiano
  • Japonés
  • Coreano
  • Portugués
  • Ruso
  • Español

Para dar escala: la propia documentación de Google para Veo 3.1 dice que el inglés está totalmente admitido y que los demás idiomas no se han evaluado. ¿Necesitas la misma cara o la misma voz en varios clips? Usa imagen de referencia.

Qué cuesta una pasada

Qué puedes inspeccionar, qué cuesta una pasada y qué cambia un plan

Una cosa por delante: ésta es una herramienta de pago. Un lip sync sin sonido no es un lip sync, así que esta página corre MiniMax H3 y no el motor mudo de sólo imagen, y no hay ninguna pasada de prueba que darte. Lo que sí puedes hacer sin pagar es inspeccionar el trabajo: todos los clips de arriba se reproducen y se descargan sin cuenta, con el prompt que los hizo. Una pasada empieza en 37 créditos — cuatro segundos en 768P, lo más corto que hace el modelo. Cada intento se guarda, y el que importa es el segundo, porque casi nadie se queda con el primer clip. Subir de plan compra más créditos al mes, 2K en clips más largos sin racionar, y un coste por segundo terminado más bajo.

Cómo se factura esto

Se factura por
segundo de salida
Generación fallida
devuelta
Audio que subes
no se factura
Clips de esta página
se reproducen · sin cuenta

Precios completos del lip sync.

Los mismos créditos al mes en los dos casos

  • GratisSin tarjeta

    Un clip real de MiniMax H3, con sonido. Todo lo que pase de 4 s · 768P corre con créditos.

    $0para siempre

    Sin tarjeta en ningún momento

    Empezar gratis

    Sólo verificación antibot — sin email

    1 clip en MiniMax H3

    MiniMax H3 · 4 s · 768P · 16:9 · con sonido
    Entra 7 días seguidos — 37 créditos, un clip más

    Cualquier pack desde $9.9 desbloquea el generador de videos con IA MiniMax H3 — todos los modos, 768P y 2K

    • MiniMax H3 en 2K nativoSólo de pago
    • Audio nativo junto con la imagenSólo de pago
    • Un clip, sin tarjeta
    • 1 clip a la vez
    • Los clips fallidos no cuestan nada
    • Generación privada
    • Cualquier pack desbloquea el generador de videos con IA MiniMax H3 en todos los modos

    La capa gratuita es otro motor. Ver planes

    Velocidad y cola

    Cola
    Carril gratuito
    Tareas a la vez
    1
    Lote
    1
    Historial
    24 h · 7 días con sesión iniciada
    Soporte
    Comunidad
  • LiteAhorra 30%

    Desbloquea el generador de videos con IA MiniMax H3 en 2K nativo. El plan de pago más pequeño — Pro es el que elige casi todo el mundo.

    $16.9/mo$24.9

    $202.8 cobrados una vez al año · Ahorra $96 al año

    Devolución en 7 días · cancela cuando quieras

    750 créditos / mes · ~20 videos

    4 s · 768P · texto a video

    o ~13 a 4 s en 2K

    Los mismos créditos al mes o al año

    • MiniMax H3 en 2K nativo — con audio nativo
    • Diálogo, efectos y música en el mismo archivo
    • Hasta 15 segundos15 s
    • ~20 videos al mes a 4 s en 768P, texto a video
    • Los clips fallidos no cuestan nada
    • Devolución en 7 días si no gastaste créditos
    • 1 tarea a la vez
    • 2 variantes de un prompt en lote

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Estándar
    Tareas a la vez
    1
    Lote
    2
    Historial
    7 días
    Soporte
    Email · 48 h
  • Recomendado para casi todos
    ProAhorra 30%

    $32 más que Lite. ~47 videos al mes, el mismo generador de videos con IA MiniMax H3, con la cola más rápida.

    $39.9/mo$56.9

    $478.8 cobrados una vez al año · Ahorra $204 al año

    Devolución en 7 días · cancela cuando quieras

    1 775 créditos / mes · ~47 videos

    4 s · 768P · texto a video

    o ~31 a 4 s en 2K

    Los mismos créditos al mes o al año

    • Todo lo de Lite
    • ~47 videos al mes a 4 s en 768P, texto a video
    • 3 tareas a la vez
    • Video a prompt
    • 4 variantes de un prompt en lote
    • Historial de 7 días
    • Devolución en 7 días si no gastaste créditos

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Rápida
    Tareas a la vez
    3
    Lote
    4
    Historial
    7 días
    Soporte
    Email · 12 h
  • StudioAhorra 30%

    Un mes entero de volumen, el primero de la cola y una persona que responde en 4 horas.

    $99.9/mo$142.9

    $1 198.8 cobrados una vez al año · Ahorra $516 al año

    Devolución en 7 días · cancela cuando quieras

    4 425 créditos / mes · ~119 videos

    4 s · 768P · texto a video

    o ~77 a 4 s en 2K

    Los mismos créditos al mes o al año

    • Todo lo de Pro
    • ~119 videos al mes a 4 s en 768P, texto a video
    • 8 tareas a la vez
    • 4 variantes de un prompt en lote
    • Historial de 7 días
    • Soporte prioritario en 4 horas
    • El menor gasto de créditos que damos
    • Devolución en 7 días si no gastaste créditos

    Uso comercial incluido — qué cubre

    Velocidad y cola

    Cola
    Prioritaria — el primero de la cola
    Tareas a la vez
    8
    Lote
    4
    Historial
    7 días
    Soporte
    Prioritario · 4 h

Cómo se hace el lip sync

Por qué el lip sync aguanta a resolución completa

Cualquier otra herramienta de lip sync busca la boca en tu imagen y la sustituye. Ésta no la busca nunca — y esa única diferencia es toda la razón de que la boca no se lea como un parche.

  • La señal

    Una boca que no cuadra con la piel

    Un parche a una resolución distinta de la cara que lo rodea, y una línea a lo largo de la mandíbula que repta cuando la cabeza gira. Una vez que lo has visto ya no puedes dejar de verlo — y nunca fue culpa de tu fotografía.

  • La causa

    Un cuadrado de 96 píxeles, pegado de vuelta

    El método habitual busca la boca, recorta un cuadradito a su alrededor — a menudo de 96 por 96 —, genera formas de boca nuevas a ese tamaño y las pega sobre tu fotograma. Todo lo que queda fuera del cuadrado no pasó nunca por el modelo.

  • Cómo saberlo antes

    Lee el verbo que una herramienta usa sobre sí misma

    Mapea formas de boca sobre la cara de tu video. Las funde con la imagen original. Sobre, con — de una manera o de otra se está poniendo algo encima de una cara que ya estaba, y la línea de la mandíbula es donde eso termina.

  • Qué pasa aquí

    Un fotograma nuevo, con sonido incluido, en una pasada

    MiniMax H3 no busca nunca tu boca, porque no está editando tu fotograma. Sin recorte, sin pegado, sin borde que seguir: la boca lleva la resolución de las mejillas porque en la imagen sólo hay una resolución. La voz sale de esa misma pasada, así que nunca te queda una banda sonora entusiasmada sobre una cara plana.

El intercambio, antes de subir nada

Tu material original no sobrevive. Recibes un clip nuevo construido a partir de él, no tu clip con una boca nueva. Si necesitas recuperar tus propios píxeles — un curso de cuarenta minutos que necesita banda sonora en español, por ejemplo — la herramienta de recortar y pegar te servirá mejor que esta página.

La línea de lip sync

Qué decide la línea de lip sync que la foto no puede decidir

La foto decide si esto funciona siquiera. La línea de lip sync decide qué obtienes, cuánto dura y cuánto cuesta — y esas tres son la misma decisión.

  1. 01La duración es un presupuesto

    La salida es un número entero de segundos, de 4 a 15. A un ritmo de habla normal eso son entre diez y cuarenta palabras aproximadamente. Escribe la línea primero, cuéntala y luego elige la duración — hacerlo al revés es como se consigue una interpretación corriendo contra un reloj que no puede ganar.

    4–15 s, segundos enteros

  2. 02Una etiqueta sostiene el resultado

    [Language] elige el juego de fonemas con el que se moldea la boca, así que es la etiqueta que cambia la imagen. (S1) sólo se gana su sitio cuando en el cuadro hay más de un hablante posible — frente a una sola cara no cambia nada que puedas ver.

    (S1) … [Spanish] …

  3. 03El techo de caracteres no es para la línea

    7 000 caracteres cubren el prompt entero. Una frase hablada son decenas de caracteres; todo lo demás es el plano — quién, dónde, con qué luz, con qué encuadre. Quedarse sin sitio es un problema de descripción, nunca de diálogo.

    7 000 caracteres

  4. 04Los segundos son la factura

    8 créditos por segundo de salida en 768P, 13 en 2K. La línea de lip sync fija la duración y la duración fija la factura, así que una toma de quince segundos cuesta casi cuatro veces una de cuatro. Casi todas las frases que merece la pena oír son cortas.

    8 créditos / s · 768P

Nada de esto es adivinar cómo funciona el modelo — las duraciones y el techo de caracteres son los límites publicados, y los precios por segundo son los de precios. ¿Quieres que te describan el plano? Generador de prompts escribe los otros 6 900 caracteres.

Uso responsable del lip sync

A quién le puedes hacer lip sync

A la tuya, a una para la que tengas permiso, o a una que no es de nadie porque la has generado.

  • CarasHacer que una persona real parezca decir algo que no dijo está prohibido por la licencia de H3 — ni figuras públicas ni la foto de un desconocido.
  • VocesUna pista subida que clona cómo suena una persona concreta tiene que ser tuya, con licencia o sintética.
  • DenunciasEl enlace para denunciar está en todas las páginas y en todos los resultados. Las cuentas que reinciden se cierran.
  • MenoresNo subas nunca una foto ni un clip en el que aparezca un menor.
  • Lo que subesNo se usa para entrenar nada. Puedes borrarlo, y borrar tu cuenta, cuando quieras.
  • Derechos comercialesUso comercial incluido en todos los planes, también el gratuito — los clips se generan a través de la API de MiniMax, cuyos términos cubren el uso comercial del resultado. Un resumen, no asesoramiento legal.

Política completa: uso responsable del lip sync

Preguntas que la gente hace de verdad

Preguntas frecuentes sobre sincronización de labios con IA

Lo que conviene saber antes de ejecutar tu primera frase

¿El generador de lip sync con IA es gratis?

No — ejecutar uno es de pago. Un lip sync sin sonido no es un lip sync, así que esta página corre MiniMax H3 y no el motor mudo de sólo imagen, y una pasada empieza en 37 créditos: cuatro segundos en 768P. Lo que no necesita cuenta son las pruebas: todos los clips terminados de aquí, y el prompt completo que hay detrás, se reproducen y se descargan tal cual.

¿Cómo pruebo el lip sync con IA sin gastar mucho?

Ejecuta primero cuatro segundos. Se factura por segundo de salida, así que la toma más corta es la mirada más barata a si la cara aguanta y la boca cuadra — 37 créditos frente a 125 de unos quince completos. Acierta con la foto y con la frase a cuatro segundos, y luego elige la duración que quieres de verdad.

¿Necesito un archivo de audio para hacer lip sync?

No, y ésa es la diferencia principal con casi todas las herramientas de esta categoría. Escribe la frase, elige un idioma y la voz se genera con la boca. Si ya tienes una grabación o una canción, súbela y pasa a ser la banda sonora final.

¿El clip viene con sonido?

Sí — estéreo de 32 kHz, hecho en la misma pasada que la imagen, dentro de un solo MP4. No hay paso de audio aparte ni nada que mezclar.

¿Puedo hacer lip sync a un video que ya tengo?

Sí, entendiendo antes una cosa: H3 regenera el plano en vez de repintar la boca sobre tus fotogramas. Tu material guía el resultado; no sobrevive dentro de él. Así que esta página acierta cuando quieres una toma nueva de la misma idea, y falla cuando los píxeles originales son lo importante — un curso de cuarenta minutos que necesita banda sonora en español, el material de un cliente que nadie puede redibujar. Para eso, una herramienta de doblaje de recortar y pegar te servirá mejor que nosotros.

¿Cuánto puede durar un clip de lip sync?

Cualquier número entero de segundos de 4 a 15, a 24 fps. Quince es un techo del modelo, no un límite de plan — ningún nivel lo sube.

¿Qué idiomas admite la sincronización de labios?

Once verificados: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español. Los demás suelen funcionar y no están bloqueados; simplemente no los hemos ejecutado, así que no los afirmamos.

¿Por qué el lip sync salía borroso en la herramienta que usaba antes?

Casi seguro porque recorta una región pequeña alrededor de la boca, genera a ese tamaño y la pega de vuelta. En un fotograma de 1080p ese parche es la única parte que pasó por un cuello de botella de baja resolución, así que se lee blanda al lado de las mejillas. Tu foto no tuvo nada que ver.

¿Va a seguir pareciéndose a la persona de mi foto?

Aguanta cuando el prompt describe a la persona además de lo que dice, y se desvía cuando sólo describe el habla. Los orígenes de frente aguantan bastante mejor. Misma regla y mismo arreglo que en foto a video, y el bloqueo de apariencia te escribe la cláusula.

¿Qué foto debería usar para el lip sync?

Una cara, de frente, con luz pareja, nada por delante de la boca y los dientes visibles si puedes elegir. Una foto de móvil suele ganarle a un retrato profesional retocado — el retoque quita la textura que el movimiento necesita.

¿Y si mi audio dura más que el clip?

Se corta a la duración del clip; no se comprime ni se acelera. Pon la duración al menos igual que la de tu pista — el generador compara las dos y se ofrece a arreglarlo.

¿El lip sync puede cantar en vez de hablar?

Sí. Pon el tono en canta, o sube la voz y deja que ella mueva la boca. El mismo techo de quince segundos.

¿Puedo sacarlo en 2K?

Sí. El 2K vuelve a generar a partir del contexto original en vez de reescalar píxeles, así que el detalle de la boca sobrevive al paso en lugar de interpolarse.

¿Hace falta una cuenta?

Para reproducir o descargar cualquier cosa de esta página, no. Para ejecutar la tuya, sí, y créditos con ella, porque esta página corre MiniMax H3 de pago. Tus intentos se guardan, así que el segundo es una edición y no una subida nueva.

¿Mi resultado lleva marca de agua?

La salida de pago no lleva. Lo que descargas es lo que produjo el modelo.

¿Qué pasa después de pulsar Generar en un lip sync?

Va al modelo y vuelve como un MP4 terminado en tu historial, con el sonido ya dentro del archivo. No hace falta que te quedes en la página — una pasada a la que tu navegador nunca volvió se termina en el servidor, y lo que el proveedor pierda se marca como fallido con los créditos devueltos automáticamente.

¿Puedo usar los clips comercialmente?

Uso personal y de evaluación, en todos los planes. Los términos comerciales vienen directamente de MiniMax, a través de Hailuo o de su API oficial. Un resumen, no asesoramiento legal.

¿Qué formatos y tamaños de foto funcionan?

JPG, JPEG, PNG, WEBP, HEIC y HEIF, hasta 30 MB por archivo, entre 256 y 5 760 píxeles de lado y con una relación de aspecto entre 2:5 y 5:2. HEIC y HEIF entran directamente, así que una foto hecha con un iPhone no necesita conversión previa. Éstos son los límites publicados, y la caja de subida comprueba tu archivo contra ellos antes de que gastes nada.

¿Puede haber más de una persona en la foto?

Sí, y una sola línea lo resuelve. Con dos caras en cuadro el modelo elige un hablante salvo que nombres a uno, así que etiquétalos: (S1) asks, [Spanish] ¿Ya lo enviaste? (S2) replies firmly, [Spanish] Hace dos horas. Frente a una sola cara la etiqueta no cambia nada que puedas ver, y por eso sólo merece la pena saberlo cuando lo necesitas.

¿Cuánto puede durar la línea de lip sync?

7 000 caracteres cubren el prompt entero, y una frase hablada son decenas de caracteres — todo lo demás es el plano. El techo de verdad es el reloj: de cuatro a quince segundos son entre diez y cuarenta palabras a un ritmo de habla normal. Escribe la línea, cuéntala y luego elige la duración. Quedarse sin sitio es un problema de descripción, nunca de diálogo.

Una foto, una frase, y el lip sync está hecho.

Ésa es toda la entrada — y todo lo de arriba se reproduce inicies sesión o no.

Crear cuenta gratis · 1 clip en MiniMax H3

Escrito y mantenido por el equipo editorial de MiniMax H3 AI Video GeneratorPublicado el Última actualización: