Generador de sincronización de labios con IA
Suelta una foto, escribe lo que debe decir y recibes un video hablando — la voz viene con él, así que no hay ningún archivo de audio que preparar antes. De cuatro a quince segundos, hasta 2K, en once idiomas.
Salida real de MiniMax H3 · Pulsa Probar esta sincronización para cargar el prompt completo, no un resumen
8 s · 16:9 · 768PUna foto y una frase
Una sola fotografía,
y la sincronización de labios con IA que viene con ella
No se pinta nada sobre tu imagen. La fotografía pasa a ser el primer fotograma de un plano en el que esa persona habla, y la voz se genera en la misma pasada — así que no hay ningún archivo de audio que preparar antes.

Tu fotografía
Generado — imagen y sonido juntos
De cuatro a quince segundos enteros a 24 fps, 768P o 2K, en once idiomas que hemos ejecutado de principio a fin. JPG, PNG, WEBP, HEIC y HEIF entran directamente, cosa que conviene decir porque casi todas las fotografías de personas son fotos de móvil y casi todas las herramientas te obligan en silencio a convertirlas antes. Una foto de móvil suele animarse mejor que un retrato profesional retocado — el retoque quita la textura que el movimiento necesita. Los dientes, si puedes elegir: una boca cerrada no guarda ninguna información sobre lo que hay detrás de los labios, así que el modelo se inventa un interior, y los interiores inventados son lo que hace que un resultado se lea como falso.
- Tu foto es el fotograma uno
- 001
- Cualquier segundo entero
- 4–15 s
- Idiomas verificados
- 11
- Sonido de la misma pasada
- Estéreo
Tu foto es el fotograma uno
Cualquier segundo entero
Idiomas verificados
Sonido de la misma pasada
- Ningún archivo de audio que preparar
- Ningún ajuste fotograma a fotograma
- Ninguna pasada aparte de lip sync
Así se ve la sincronización de labios cuando sale bien
Lo que ves es lo que salió — sin reescalado, sin etalonaje, sin segunda pasada. Al lado está el prompt completo que lo produjo, no un resumen. Pulsa Probar esta sincronización y cae directamente en la caja de arriba, con la duración y la relación con las que se hizo, para que cambies una línea y veas qué se mueve. Sube el volumen: lo que oyes salió de la misma pasada que la boca que lo dice.
Más prompts de lip sync ↗
16:9 · 6 sEl prompt completo, no un resumen
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
La fotografía de arriba, y los seis segundos en que se convirtió
Una pasada, un prompt, exactamente como lo devolvió el modelo
La sincronización de labios no tiene por qué ser
la fotografía de una persona
16:9 · 15 sUna personaFotoUna fotografía de referencia sostenida en todos los planos, incluido un primer plano de la boca — que es donde un lip sync sobrevive a tamaño completo o no.
16:9 · 15 sDos personas, un cuadro165 caracteresHablan los dos, por turnos, y el prompt entero era una sola frase. Las etiquetas de hablante están ahí para cuando necesites decir quién habla primero; esta pasada no las usó.
16:9 · 15 sUn personaje dibujadoIlustración2D pictórico, y la boca está dibujada con la misma mano que el resto del cuadro. Nada fotorrealista en todo el plano.
16:9 · 15 sUn personaje animalAnimalUn gato y un ratón, cada uno con una línea. Las caras no son humanas y las bocas siguen cayendo en las sílabas.
Estas cuatro son pasadas de otras personas, no nuestras — por eso llevan la marca de Hailuo en la esquina y los clips del resto de esta página no. Esa marca es el recibo: cada una se publicó con su prompt por @SimplyAnnisa, @heydin_ai y @ManuAGI01, y puedes leer cada palabra de las cuatro en esos enlaces.
Lo que no está aquí, porque no lo hemos ejecutado: la fotografía de un perro o de un gato reales, y un retrato pintado. Ninguno está bloqueado y los dos merecen la pena — la misma postura que toma esta página con los idiomas más allá de los once que ha verificado. No afirmamos lo que no hemos visto volver.
Cómo hacer lip sync a una foto en tres pasos
El paso que decide el resultado es el primero, y acertar cuesta unos cuatro segundos. Las dos primeras tarjetas son el generador de arriba de esta página a mitad de trabajo — el archivo que aceptó, la frase escrita en él. La tercera es lo que volvió.

Suelta una cara
Vale una foto, y también valen de dos a quince segundos de material. Una cara, mirando a cámara, nada por delante de la boca. Los archivos HEIC del iPhone entran directamente, y la caja te lee el archivo — tamaño, forma, peso — antes de que hayas gastado nada.
Una caraJPG · PNG · WEBP · HEIC![La caja de prompt del generador de esta página con una línea escrita dentro — (S1) speaks warmly, [Spanish] Lo uso cada mañana desde hace un mes — y el contador marcando 73 / 7000](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
Di lo que dice
Escribe la frase y una etiqueta de idioma y la voz llega con ella — no hay ningún archivo de audio que preparar antes. La línea de lip sync de la caja son setenta y tres caracteres de los 7 000 que tienes; todo lo demás es para describir el plano.
73 de 7 000 caracteresNinguna voz que castear
Pista de audio · 32 kHzLIP-SYNC.MP4Reprodúcelo y cambia una palabra
El clip llega con el sonido ya dentro del archivo. La mayoría se queda con el segundo o el tercero, no con el primero — cada intento se guarda, así que estás editando en vez de empezar de cero.
4–15 s · hasta 2KSonido ya mezclado dentro
Las dos primeras tarjetas son capturas de la caja de arriba de esta página, no un dibujo de una. La fotografía que subes no se modifica nunca — lo que vuelve es un archivo nuevo. El clip de la tercera tarjeta es de MiniMax, publicado con su prompt en el anuncio de H3: la imagen fijó la cara, una pista vocal fijó el canto, un fragmento de película fijó el movimiento de cámara. Esa pasada usó la vía de audio; la caja de arriba admite las dos.
Para qué usa la gente la sincronización de labios
Cuatro sitios por donde empezar. Cada uno vuelca en el generador de arriba el prompt completo que hay detrás de un clip terminado, con la duración y la relación con las que se hizo.
16:9 · 8 sUna frase directa a cámara
Todo el clip es una persona y una frase. Que no pase de unas doce palabras en seis segundos — las frases largas en duraciones cortas son la razón habitual de que el primer intento decepcione.
9:16 · 9 sUna línea de diálogo para una escena
Un personaje dice la frase en el plano que ya te habías imaginado. Describe a la persona además de las palabras — ropa, pelo, un rasgo distintivo — y la cara se queda quieta durante todo el clip.
9:16 · 15 sAlguien hablando de un producto
Imagen fija de la persona más imagen fija del producto, y las frases escritas plano a plano. Ésta es la que corre los quince segundos enteros, así que también es la que te enseña dónde está el techo.
16:9 · 15 sUna voz cantada, no una frase hablada
Pon el tono en canta, o sube la voz y deja que ella mueva la boca. La pista que subes pasa a ser la banda sonora final, no una referencia para otra, y subirla no se factura. Que el clip dure al menos lo que la pista.
¿Partes de un video y tus píxeles originales tienen que sobrevivir? Eso es doblaje, y una herramienta de recortar y pegar lo hace mejor que esta página — aquí todo reconstruye el plano en vez de editarlo.
Once idiomas de lip sync, y el formato de línea que los mueve
Once que hemos ejecutado de principio a fin — en cada uno la boca se moldea a partir de los sonidos propios de ese idioma y no de una aproximación inglesa. Escribe la frase hablada en su propio idioma y la interpretación cuadra; escríbela en inglés con una etiqueta de idioma y no. Cómo se escribe la línea de lip sync tiene el formato.
Once verificados para lip sync
11
- Árabe
- Chino
- Inglés
- Francés
- Alemán
- Italiano
- Japonés
- Coreano
- Portugués
- Ruso
- Español
Para dar escala: la propia documentación de Google para Veo 3.1 dice que el inglés está totalmente admitido y que los demás idiomas no se han evaluado. ¿Necesitas la misma cara o la misma voz en varios clips? Usa imagen de referencia.
Qué puedes inspeccionar, qué cuesta una pasada y qué cambia un plan
Una cosa por delante: ésta es una herramienta de pago. Un lip sync sin sonido no es un lip sync, así que esta página corre MiniMax H3 y no el motor mudo de sólo imagen, y no hay ninguna pasada de prueba que darte. Lo que sí puedes hacer sin pagar es inspeccionar el trabajo: todos los clips de arriba se reproducen y se descargan sin cuenta, con el prompt que los hizo. Una pasada empieza en 37 créditos — cuatro segundos en 768P, lo más corto que hace el modelo. Cada intento se guarda, y el que importa es el segundo, porque casi nadie se queda con el primer clip. Subir de plan compra más créditos al mes, 2K en clips más largos sin racionar, y un coste por segundo terminado más bajo.
Cómo se factura esto
- Se factura por
- segundo de salida
- Generación fallida
- devuelta
- Audio que subes
- no se factura
- Clips de esta página
- se reproducen · sin cuenta
Los mismos créditos al mes en los dos casos
- GratisSin tarjeta
Un clip real de MiniMax H3, con sonido. Todo lo que pase de 4 s · 768P corre con créditos.
$0para siempreSin tarjeta en ningún momento
Empezar gratisSólo verificación antibot — sin email
1 clip en MiniMax H3
MiniMax H3 · 4 s · 768P · 16:9 · con sonido
Entra 7 días seguidos — 37 créditos, un clip másCualquier pack desde $9.9 desbloquea el generador de videos con IA MiniMax H3 — todos los modos, 768P y 2K
- MiniMax H3 en 2K nativoSólo de pago
- Audio nativo junto con la imagenSólo de pago
- Un clip, sin tarjeta
- 1 clip a la vez
- Los clips fallidos no cuestan nada
- Generación privada
- Cualquier pack desbloquea el generador de videos con IA MiniMax H3 en todos los modos
La capa gratuita es otro motor. Ver planes
Velocidad y cola
- Cola
- Carril gratuito
- Tareas a la vez
- 1
- Lote
- 1
- Historial
- 24 h · 7 días con sesión iniciada
- Soporte
- Comunidad
- LiteAhorra 30%
Desbloquea el generador de videos con IA MiniMax H3 en 2K nativo. El plan de pago más pequeño — Pro es el que elige casi todo el mundo.
$16.9/mo$24.9$202.8 cobrados una vez al año · Ahorra $96 al año
Devolución en 7 días · cancela cuando quieras
750 créditos / mes · ~20 videos
4 s · 768P · texto a video
o ~13 a 4 s en 2K
Los mismos créditos al mes o al año
- MiniMax H3 en 2K nativo — con audio nativo
- Diálogo, efectos y música en el mismo archivo
- Hasta 15 segundos15 s
- ~20 videos al mes a 4 s en 768P, texto a video
- Los clips fallidos no cuestan nada
- Devolución en 7 días si no gastaste créditos
- 1 tarea a la vez
- 2 variantes de un prompt en lote
Uso comercial incluido — qué cubre
Velocidad y cola
- Cola
- Estándar
- Tareas a la vez
- 1
- Lote
- 2
- Historial
- 7 días
- Soporte
- Email · 48 h
- Recomendado para casi todosProAhorra 30%
$32 más que Lite. ~47 videos al mes, el mismo generador de videos con IA MiniMax H3, con la cola más rápida.
$39.9/mo$56.9$478.8 cobrados una vez al año · Ahorra $204 al año
Devolución en 7 días · cancela cuando quieras
1 775 créditos / mes · ~47 videos
4 s · 768P · texto a video
o ~31 a 4 s en 2K
Los mismos créditos al mes o al año
- Todo lo de Lite
- ~47 videos al mes a 4 s en 768P, texto a video
- 3 tareas a la vez3×
- Video a prompt
- 4 variantes de un prompt en lote
- Historial de 7 días
- Devolución en 7 días si no gastaste créditos
Uso comercial incluido — qué cubre
Velocidad y cola
- Cola
- Rápida
- Tareas a la vez
- 3
- Lote
- 4
- Historial
- 7 días
- Soporte
- Email · 12 h
- StudioAhorra 30%
Un mes entero de volumen, el primero de la cola y una persona que responde en 4 horas.
$99.9/mo$142.9$1 198.8 cobrados una vez al año · Ahorra $516 al año
Devolución en 7 días · cancela cuando quieras
4 425 créditos / mes · ~119 videos
4 s · 768P · texto a video
o ~77 a 4 s en 2K
Los mismos créditos al mes o al año
- Todo lo de Pro
- ~119 videos al mes a 4 s en 768P, texto a video
- 8 tareas a la vez8×
- 4 variantes de un prompt en lote
- Historial de 7 días
- Soporte prioritario en 4 horas
- El menor gasto de créditos que damos
- Devolución en 7 días si no gastaste créditos
Uso comercial incluido — qué cubre
Velocidad y cola
- Cola
- Prioritaria — el primero de la cola
- Tareas a la vez
- 8
- Lote
- 4
- Historial
- 7 días
- Soporte
- Prioritario · 4 h
Por qué el lip sync aguanta
a resolución completa
Cualquier otra herramienta de lip sync busca la boca en tu imagen y la sustituye. Ésta no la busca nunca — y esa única diferencia es toda la razón de que la boca no se lea como un parche.
Una boca que no cuadra con la piel
Un parche a una resolución distinta de la cara que lo rodea, y una línea a lo largo de la mandíbula que repta cuando la cabeza gira. Una vez que lo has visto ya no puedes dejar de verlo — y nunca fue culpa de tu fotografía.
Un cuadrado de 96 píxeles, pegado de vuelta
El método habitual busca la boca, recorta un cuadradito a su alrededor — a menudo de 96 por 96 —, genera formas de boca nuevas a ese tamaño y las pega sobre tu fotograma. Todo lo que queda fuera del cuadrado no pasó nunca por el modelo.
Lee el verbo que una herramienta usa sobre sí misma
Mapea formas de boca sobre la cara de tu video. Las funde con la imagen original. Sobre, con — de una manera o de otra se está poniendo algo encima de una cara que ya estaba, y la línea de la mandíbula es donde eso termina.
Un fotograma nuevo, con sonido incluido, en una pasada
MiniMax H3 no busca nunca tu boca, porque no está editando tu fotograma. Sin recorte, sin pegado, sin borde que seguir: la boca lleva la resolución de las mejillas porque en la imagen sólo hay una resolución. La voz sale de esa misma pasada, así que nunca te queda una banda sonora entusiasmada sobre una cara plana.
Tu material original no sobrevive. Recibes un clip nuevo construido a partir de él, no tu clip con una boca nueva. Si necesitas recuperar tus propios píxeles — un curso de cuarenta minutos que necesita banda sonora en español, por ejemplo — la herramienta de recortar y pegar te servirá mejor que esta página.
Qué decide la línea de lip sync
que la foto no puede decidir
La foto decide si esto funciona siquiera. La línea de lip sync decide qué obtienes, cuánto dura y cuánto cuesta — y esas tres son la misma decisión.
La duración es un presupuesto
La salida es un número entero de segundos, de 4 a 15. A un ritmo de habla normal eso son entre diez y cuarenta palabras aproximadamente. Escribe la línea primero, cuéntala y luego elige la duración — hacerlo al revés es como se consigue una interpretación corriendo contra un reloj que no puede ganar.
4–15 s, segundos enteros
Una etiqueta sostiene el resultado
[Language] elige el juego de fonemas con el que se moldea la boca, así que es la etiqueta que cambia la imagen. (S1) sólo se gana su sitio cuando en el cuadro hay más de un hablante posible — frente a una sola cara no cambia nada que puedas ver.
(S1) … [Spanish] …
El techo de caracteres no es para la línea
7 000 caracteres cubren el prompt entero. Una frase hablada son decenas de caracteres; todo lo demás es el plano — quién, dónde, con qué luz, con qué encuadre. Quedarse sin sitio es un problema de descripción, nunca de diálogo.
7 000 caracteres
Los segundos son la factura
8 créditos por segundo de salida en 768P, 13 en 2K. La línea de lip sync fija la duración y la duración fija la factura, así que una toma de quince segundos cuesta casi cuatro veces una de cuatro. Casi todas las frases que merece la pena oír son cortas.
8 créditos / s · 768P
Nada de esto es adivinar cómo funciona el modelo — las duraciones y el techo de caracteres son los límites publicados, y los precios por segundo son los de precios. ¿Quieres que te describan el plano? Generador de prompts escribe los otros 6 900 caracteres.
A quién le puedes hacer lip sync
A la tuya, a una para la que tengas permiso, o a una que no es de nadie porque la has generado.
- CarasHacer que una persona real parezca decir algo que no dijo está prohibido por la licencia de H3 — ni figuras públicas ni la foto de un desconocido.
- VocesUna pista subida que clona cómo suena una persona concreta tiene que ser tuya, con licencia o sintética.
- DenunciasEl enlace para denunciar está en todas las páginas y en todos los resultados. Las cuentas que reinciden se cierran.
- MenoresNo subas nunca una foto ni un clip en el que aparezca un menor.
- Lo que subesNo se usa para entrenar nada. Puedes borrarlo, y borrar tu cuenta, cuando quieras.
- Derechos comercialesUso comercial incluido en todos los planes, también el gratuito — los clips se generan a través de la API de MiniMax, cuyos términos cubren el uso comercial del resultado. Un resumen, no asesoramiento legal.
Preguntas frecuentes sobre sincronización de labios con IA
Lo que conviene saber antes de ejecutar tu primera frase
¿El generador de lip sync con IA es gratis?
¿Cómo pruebo el lip sync con IA sin gastar mucho?
¿Necesito un archivo de audio para hacer lip sync?
¿El clip viene con sonido?
¿Puedo hacer lip sync a un video que ya tengo?
¿Cuánto puede durar un clip de lip sync?
¿Qué idiomas admite la sincronización de labios?
¿Por qué el lip sync salía borroso en la herramienta que usaba antes?
¿Va a seguir pareciéndose a la persona de mi foto?
¿Qué foto debería usar para el lip sync?
¿Y si mi audio dura más que el clip?
¿El lip sync puede cantar en vez de hablar?
¿Puedo sacarlo en 2K?
¿Hace falta una cuenta?
¿Mi resultado lleva marca de agua?
¿Qué pasa después de pulsar Generar en un lip sync?
¿Puedo usar los clips comercialmente?
¿Qué formatos y tamaños de foto funcionan?
¿Puede haber más de una persona en la foto?
¿Cuánto puede durar la línea de lip sync?
Una foto, una frase, y el lip sync está hecho.
Ésa es toda la entrada — y todo lo de arriba se reproduce inicies sesión o no.
Crear cuenta gratis · 1 clip en MiniMax H3Escrito y mantenido por el equipo editorial de MiniMax H3 AI Video GeneratorPublicado el Última actualización:
