Prompt craft

Как прописать звук в промпте H3: три поля

Картинка и стерео 32 кГц выходят из одного прохода, поэтому звук пишется в промпте. Что вы услышите, решают три поля, а у диалога свой синтаксис.

6 мин чтенияРедакцияРедакция
Как прописать звук в промпте H3: три поля

Большинство видеомоделей относятся к звуку как ко второй работе. H3 — нет: картинка и звук выходят из одного и того же прямого прохода, стерео 32 кГц, упакованные в один MP4. Отдельного промпта для звука не существует, и переключателя, чтобы его выключить, тоже нет.

Практическое следствие такое: если вы звук не написали, вы его не выбирали. Модель всё равно что-нибудь выдаст, и в отсутствие указаний это будет правдоподобное среднее по сцене.

В структурном промпте три поля несут звук

Формат промпта, который потребляет H3, — это структурный документ, а не абзац. Для задач по тексту, по фото и по ключевым кадрам это три поля, всегда в таком порядке:

integrated_multimodal_description
overall_soundscape
non_diegetic_music

Они не взаимозаменяемы, и разделение — самая полезная часть:

  • integrated_multimodal_description несёт планы: композицию, героя, окружение, действие, камеру и всё, что слышно в конкретный момент, с отметкой времени: At 00:04.500, the door latch clicks.
  • overall_soundscape — атмосфера мира и шумы. Тон комнаты, дождь, дальний трафик, холодильник. То, что верно для всего клипа.
  • non_diegetic_music — музыка вне сцены, которую никто внутри неё не слышит. Стиль, состав инструментов, темп и то, как движется настроение.

В последнем поле живёт самая частая ошибка. Описав саундтрек внутри поля атмосферы, вы просите у модели музыку, которая существует в комнате, и получаете нечто похожее на колонку, играющую сразу за краем кадра. Нужна музыка вне сцены — так и скажите в поле для неё.

Написать non_diegetic_music: none — законная и недооценённая инструкция. Материалу с документальной интонацией она почти всегда нужна.

У диалога есть синтаксис

Это та часть, которую трудно обнаружить и которая сразу меняет результат. Реплики размечаются идентификатором говорящего, языком и пометой о подаче:

(S1) speaks softly, [English] Follow the wind, live free.

Здесь работают три вещи:

  • (S1) — устойчивый идентификатор говорящего. Повторите его, и голос останется тем же во всех репликах; введите (S2) — получите второй, отдельный голос. Именно так держится диалог на двоих.
  • [English] задаёт язык речи. Одиннадцать поддержаны надёжно: арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский.
  • Помета о подаче перед скобкой — speaks softly, level broadcast delivery, shouting over traffic — двигает игру сильнее, чем любое количество прилагательных в описании картинки.

Одно правило подводит тех, кто пишет не по-английски: официальная рекомендация — писать переписанный промпт по-английски, но оставлять диалог, тексты песен и любой текст в кадре на их родном языке. Немецкая реплика внутри скобок остаётся немецкой; описание вокруг неё — английское.

То же правило управляет надписями, которые видит камера, и это стоит сказать отдельно, потому что отказ здесь беззвучный: назовите язык — и H3 отрисует экранный текст на нём, не назовите — возьмёт язык из сцены. Именно так англоязычное задание возвращается с китайской заставкой, и это измерено покадрово в разборе что MiniMax H3 делает с текстом, который вы не называли.

Разобранный пример

Вот план из новостной студии, написанный длинным способом. Он не сложный — он просто полный.

integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.

overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.

non_diegetic_music:
None.

Больше всего значат два ограничения — последние строки двух последних полей. Именно «Room tone only» и «None» не дают модели подложить под план музыку и добавить новостную суету, которой вы не просили.

Правила, которые официальная рекомендация действительно требует

Их пять, и промпт стоит сверить с ними:

  1. Пишите переписанный промпт по-английски; диалог, тексты песен и экранный текст оставляйте на их языке.
  2. Описывайте каждый план в порядке композиция → герой → окружение → действие → камера → звук → точный момент, когда появляется любой упомянутый материал.
  3. Никаких пересказов сюжета, никаких неразрешённых референсных тегов, никаких таймингов, которые не складываются в запрошенную длительность.
  4. Каждая деталь должна соответствовать чему-то видимому или слышимому. «Ей тревожно» — не деталь. «Она бросает взгляд за кадр и не договаривает фразу» — деталь.
  5. Порядок полей не меняется.

Правило 4 — то, которое тихо улучшает всё остальное. Промпт, написанный целиком из вещей, которые способны зарегистрировать микрофон или объектив, — это промпт, который модель может исполнить.

Две вещи про бюджет, которые стоит знать

Движение камеры состоит из трёх частей, а не из одной. Официальный словарь — это тип движения плюс амплитуда плюс скорость: «медленный наезд, малая амплитуда», а не «кинематографичное движение камеры». Расплывчатые формулировки движения — источник изрядной части каши в сгенерированном видео.

Места у вас гораздо больше, чем кажется. Эндпойнт создания принимает промпты до 7 000 символов. Для сравнения: текстовый вход Veo упирается в 1 024 токена. Три поля, написанные как следует, до потолка и близко не дойдут, так что сжимать описание звука до придаточного незачем.

Напишите все три и послушайте, что вернётся: нейросеть для генерации видео MiniMax H3 отдаёт стерео 32 кГц внутри того же MP4, так что сводить потом нечего.

Редакция

Автор

Редакция

minimax-h3ai.video

Опубликовано на нейросети для генерации видео MiniMax H3 — независимом стороннем интерфейсе к модели MiniMax H3.

Все статьи