Prompt craft

Escribir el sonido en un prompt de H3: los tres campos de audio

La imagen y el estéreo de 32 kHz salen de la misma pasada, así que el audio se escribe en el prompt. Tres campos deciden qué oyes, y el diálogo tiene sintaxis.

6 min de lecturaRedacciónRedacción
Escribir el sonido en un prompt de H3: los tres campos de audio

Casi todos los modelos de video tratan el sonido como un segundo trabajo. H3 no: la imagen y el audio salen de la misma pasada hacia delante, en estéreo de 32 kHz y dentro de un mismo MP4. No hay un prompt de audio aparte ni un interruptor para apagarlo.

La consecuencia práctica es que si no escribiste el sonido, no lo elegiste. El modelo va a producir algo de todas formas, y lo que produce cuando nadie le dice nada es un promedio verosímil de la escena.

El prompt estructurado tiene tres campos que llevan sonido

El formato de prompt que consume H3 es un documento estructurado, no un párrafo. Para las tareas de texto, de imagen y de fotograma clave son tres campos, siempre en este orden:

integrated_multimodal_description
overall_soundscape
non_diegetic_music

No son intercambiables, y el reparto es lo aprovechable:

  • integrated_multimodal_description lleva los planos — composición, sujeto, entorno, acción, cámara y cualquier cosa que se oiga en un momento concreto, con su marca de tiempo: At 00:04.500, the door latch clicks.
  • overall_soundscape es el ambiente y el foley del mundo. Tono de sala, lluvia, tráfico a lo lejos, la nevera. Cosas que son ciertas durante todo el clip.
  • non_diegetic_music es la banda sonora — fuera de la escena, no la oye nadie que esté dentro. Estilo, instrumentación, tempo y cómo se mueve el ánimo.

El último es donde vive el error más común. Describir una banda sonora dentro del campo del soundscape le pide al modelo música que existe en la habitación, y lo que sale suena como si estuviera puesta en un altavoz justo fuera de cuadro. Si quieres banda sonora, dilo en el campo de la banda sonora.

Escribir non_diegetic_music: none es una instrucción legítima y poco usada. El material con aire documental casi siempre la quiere.

El diálogo tiene una sintaxis

Ésta es la parte difícil de descubrir y que cambia los resultados de inmediato. Las líneas se etiquetan con un identificador de hablante, un idioma y una nota de interpretación:

(S1) speaks softly, [English] Follow the wind, live free.

Ahí hay tres cosas trabajando:

  • (S1) es un identificador de hablante estable. Reutilízalo y la voz se mantiene igual de una línea a otra; mete un (S2) y sale una segunda voz distinta. Así es como se sostiene un diálogo a dos.
  • [English] fija el idioma hablado. Once tienen soporte fiable: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
  • La nota de interpretación que va antes del corchete — speaks softly, level broadcast delivery, shouting over traffic — mueve la actuación más que cualquier cantidad de adjetivos en la descripción visual.

Una regla con la que tropieza todo el que escribe en otro idioma: la guía oficial dice que el prompt reescrito se escriba en inglés, pero que el diálogo, la letra de las canciones y cualquier texto visible en cuadro se queden en su idioma original. Una línea en alemán sigue en alemán dentro de los corchetes; la descripción que la rodea va en inglés.

La misma regla gobierna las letras que la cámara puede ver, y conviene decirlo aparte porque el fallo es silencioso: nombra un idioma y H3 renderiza el texto en pantalla en ése, no nombres ninguno y lo coge de la escena. Así es como un encargo en inglés vuelve con un rótulo final en chino, medido fotograma a fotograma en qué hace MiniMax H3 con el texto que no nombraste.

Un ejemplo trabajado

Aquí va un plano de informativos escrito por la vía larga. No es complicado — es que está completo.

integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.

overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.

non_diegetic_music:
None.

Las dos restricciones que más importan son la última línea de cada uno de los dos campos finales. “Room tone only” y “None” son las que impiden que el modelo le ponga música al plano y añada un trajín de redacción que nadie pidió.

Las reglas que la guía oficial sí hace cumplir

Cinco, y vale la pena contrastar tu prompt con ellas:

  1. Escribe la reescritura en inglés; deja el diálogo, la letra y el texto en pantalla en su propio idioma.
  2. Describe cada plano en el orden composición → sujeto → entorno → acción → cámara → sonido → el momento exacto en que aparece cualquier material referenciado.
  3. Nada de resúmenes de la trama, nada de etiquetas de referencia sin resolver, nada de tiempos que no sumen la duración pedida.
  4. Cada detalle tiene que corresponder a algo visible o audible. “Ella se siente insegura” no es un detalle. “Mira fuera de cuadro y no termina la frase” sí.
  5. Mantén fijo el orden de los campos.

La regla 4 es la que mejora todo lo demás sin hacer ruido. Un prompt escrito enteramente con cosas que un micrófono o un objetivo podrían registrar es un prompt que el modelo puede ejecutar.

Dos cosas que conviene saber sobre el presupuesto

El movimiento de cámara son tres partes, no una. El léxico oficial es tipo de movimiento + amplitud + velocidad — “push-in lento, amplitud pequeña” en vez de “movimiento de cámara cinematográfico”. El lenguaje vago del movimiento es de donde sale buena parte de la papilla del video generado.

Tienes mucho más sitio del que crees. El endpoint de creación acepta prompts de hasta 7 000 caracteres. Como comparación, la entrada de texto de Veo se corta en 1 024 tokens. Tres campos bien escritos no van a acercarse al techo, así que no hay motivo para comprimir la descripción del sonido hasta dejarla en una cláusula.

Escribe los tres y luego escucha lo que vuelve: el generador de video con IA de MiniMax H3 devuelve el estéreo de 32 kHz dentro del mismo MP4, así que no hay nada que mezclar después.

Redacción

Escrito por

Redacción

minimax-h3ai.video

Publicado en el generador de video con IA MiniMax H3, una interfaz independiente de terceros construida sobre MiniMax H3.

Todos los artículos