Как прописать звук в промпте H3: три поля
Картинка и стерео 32 кГц выходят из одного прохода, поэтому звук пишется в промпте. Что вы услышите, решают три поля, а у диалога свой синтаксис.

Большинство видеомоделей относятся к звуку как ко второй работе. H3 — нет: картинка и звук выходят из одного и того же прямого прохода, стерео 32 кГц, упакованные в один MP4. Отдельного промпта для звука не существует, и переключателя, чтобы его выключить, тоже нет.
Практическое следствие такое: если вы звук не написали, вы его не выбирали. Модель всё равно что-нибудь выдаст, и в отсутствие указаний это будет правдоподобное среднее по сцене.
В структурном промпте три поля несут звук
Формат промпта, который потребляет H3, — это структурный документ, а не абзац. Для задач по тексту, по фото и по ключевым кадрам это три поля, всегда в таком порядке:
integrated_multimodal_description
overall_soundscape
non_diegetic_musicОни не взаимозаменяемы, и разделение — самая полезная часть:
integrated_multimodal_descriptionнесёт планы: композицию, героя, окружение, действие, камеру и всё, что слышно в конкретный момент, с отметкой времени:At 00:04.500, the door latch clicks.overall_soundscape— атмосфера мира и шумы. Тон комнаты, дождь, дальний трафик, холодильник. То, что верно для всего клипа.non_diegetic_music— музыка вне сцены, которую никто внутри неё не слышит. Стиль, состав инструментов, темп и то, как движется настроение.
В последнем поле живёт самая частая ошибка. Описав саундтрек внутри поля атмосферы, вы просите у модели музыку, которая существует в комнате, и получаете нечто похожее на колонку, играющую сразу за краем кадра. Нужна музыка вне сцены — так и скажите в поле для неё.
Написать non_diegetic_music: none — законная и недооценённая инструкция.
Материалу с документальной интонацией она почти всегда нужна.
У диалога есть синтаксис
Это та часть, которую трудно обнаружить и которая сразу меняет результат. Реплики размечаются идентификатором говорящего, языком и пометой о подаче:
(S1) speaks softly, [English] Follow the wind, live free.Здесь работают три вещи:
(S1)— устойчивый идентификатор говорящего. Повторите его, и голос останется тем же во всех репликах; введите(S2)— получите второй, отдельный голос. Именно так держится диалог на двоих.[English]задаёт язык речи. Одиннадцать поддержаны надёжно: арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский.- Помета о подаче перед скобкой — speaks softly, level broadcast delivery, shouting over traffic — двигает игру сильнее, чем любое количество прилагательных в описании картинки.
Одно правило подводит тех, кто пишет не по-английски: официальная рекомендация — писать переписанный промпт по-английски, но оставлять диалог, тексты песен и любой текст в кадре на их родном языке. Немецкая реплика внутри скобок остаётся немецкой; описание вокруг неё — английское.
То же правило управляет надписями, которые видит камера, и это стоит сказать отдельно, потому что отказ здесь беззвучный: назовите язык — и H3 отрисует экранный текст на нём, не назовите — возьмёт язык из сцены. Именно так англоязычное задание возвращается с китайской заставкой, и это измерено покадрово в разборе что MiniMax H3 делает с текстом, который вы не называли.
Разобранный пример
Вот план из новостной студии, написанный длинным способом. Он не сложный — он просто полный.
integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.
overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.
non_diegetic_music:
None.Больше всего значат два ограничения — последние строки двух последних полей. Именно «Room tone only» и «None» не дают модели подложить под план музыку и добавить новостную суету, которой вы не просили.
Правила, которые официальная рекомендация действительно требует
Их пять, и промпт стоит сверить с ними:
- Пишите переписанный промпт по-английски; диалог, тексты песен и экранный текст оставляйте на их языке.
- Описывайте каждый план в порядке композиция → герой → окружение → действие → камера → звук → точный момент, когда появляется любой упомянутый материал.
- Никаких пересказов сюжета, никаких неразрешённых референсных тегов, никаких таймингов, которые не складываются в запрошенную длительность.
- Каждая деталь должна соответствовать чему-то видимому или слышимому. «Ей тревожно» — не деталь. «Она бросает взгляд за кадр и не договаривает фразу» — деталь.
- Порядок полей не меняется.
Правило 4 — то, которое тихо улучшает всё остальное. Промпт, написанный целиком из вещей, которые способны зарегистрировать микрофон или объектив, — это промпт, который модель может исполнить.
Две вещи про бюджет, которые стоит знать
Движение камеры состоит из трёх частей, а не из одной. Официальный словарь — это тип движения плюс амплитуда плюс скорость: «медленный наезд, малая амплитуда», а не «кинематографичное движение камеры». Расплывчатые формулировки движения — источник изрядной части каши в сгенерированном видео.
Места у вас гораздо больше, чем кажется. Эндпойнт создания принимает промпты до 7 000 символов. Для сравнения: текстовый вход Veo упирается в 1 024 токена. Три поля, написанные как следует, до потолка и близко не дойдут, так что сжимать описание звука до придаточного незачем.
Напишите все три и послушайте, что вернётся: нейросеть для генерации видео MiniMax H3 отдаёт стерео 32 кГц внутри того же MP4, так что сводить потом нечего.
Автор
Редакция
minimax-h3ai.video
Опубликовано на нейросети для генерации видео MiniMax H3 — независимом стороннем интерфейсе к модели MiniMax H3.


