Prompt craft

MiniMax H3 声音提示词怎么写:决定你听见什么的三个字段

画面和 32 kHz 立体声是同一次前向传播出来的,所以声音得写进提示词。三个字段决定你听见什么,对白还另有一套语法。

6 分钟读完编辑部编辑部
MiniMax H3 声音提示词怎么写:决定你听见什么的三个字段

多数视频模型把声音当成第二道工序。H3 不是:画面和音频是同一次前向传播出来的,32 kHz 立体声,装在同一个 MP4 里。没有单独的音频提示词,也没有开关能把它关掉。

落到手上就是一句话:你没写声音,就等于没选声音。 模型不管怎样都会给你一份,而在没有指令的情况下它给的,是这个场景的一个说得过去的平均值。

结构化提示词里有三个带声音的字段

H3 吃的提示词格式是一份结构化文档,不是一段话。文字、图片和关键帧任务下是三个字段,顺序永远是这个:

integrated_multimodal_description
overall_soundscape
non_diegetic_music

它们不能互换,而这一刀切下去恰恰是有用的地方:

  • integrated_multimodal_description 装的是镜头——构图、主体、环境、动作、运镜,以及在某个具体时刻听见的东西,带时间戳:At 00:04.500, the door latch clicks.
  • overall_soundscape 是这个世界的环境声与拟音。室内底噪、雨、远处的车流、冰箱。整条片子从头到尾都成立的那些东西。
  • non_diegetic_music 是配乐——在场景之外,场景里的人一个都听不见。风格、配器、速度,以及情绪怎么走。

最常见的错误就住在最后这个字段上。把配乐写进环境声字段,等于让模型给你一段房间里真实存在的音乐,于是你听到的像是画外某个音箱在放。想要配乐,就在配乐字段里说。

non_diegetic_music: none 是一条完全正当、但很少有人用的指令。带纪实味道的素材几乎总是需要它。

对白有一套语法

这一段最难被人发现,而且一用上结果立刻就变。台词要挂三样东西:说话人标识、语种、语气说明:

(S1) speaks softly, [English] Follow the wind, live free.

里面有三样东西在干活:

  • (S1) 是一个稳定的说话人编号。重复用它,声音在多句之间就不会变;引入 (S2),你就得到第二个、明显不同的声音。双人对白能立住,靠的就是这个。
  • [English] 定的是说出口的语言。有十一种支持是可靠的:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语。
  • 方括号前面那句语气说明——speaks softlylevel broadcast deliveryshouting over traffic——对表演的影响,比你在画面描述里堆多少形容词都大。

有一条规则会绊倒用其他语言写作的人:官方的说法是,改写后的提示词要用英文写,但对白、歌词,以及画面里出现的文字,一律保留原来的语种。一句德语台词在方括号里仍然是德语;围着它的描述是英文。

一个写全的例子

下面是一个演播室镜头,按最啰嗦的写法写出来。它并不复杂——它只是完整。

integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.

overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.

non_diegetic_music:
None.

最要紧的两条约束,是后两个字段各自的最后一句。「Room tone only」和「None」——正是它们拦住了模型给这个镜头配乐、以及给你加一段你没要的演播室嘈杂声。

官方规则里真正会被执行的那几条

五条,值得拿去对着自己的提示词过一遍:

  1. 改写用英文写;对白、歌词和画面上的文字保留各自的语种。
  2. 每个镜头按这个顺序描述:构图 → 主体 → 环境 → 动作 → 运镜 → 声音 → 任何被引用的素材具体在哪一刻出现
  3. 不要剧情梗概,不要用了却没定义的引用标签,不要跟请求时长对不上的时间安排。
  4. 每一个细节都必须对应某样看得见或听得见的东西。「她感到不确定」不是细节。「她瞥了一眼画外,那句话没说完」才是。
  5. 字段顺序固定,不许动。

第 4 条是那条会悄悄把一切都改善掉的规则。一条完全由「麦克风或者镜头能记录下来的东西」写成的提示词,才是模型能执行的提示词。

关于预算,两件值得知道的事

运镜是三部分,不是一部分。 官方那套词汇是「动作类型 + 幅度 + 速度」——写「slow push-in, small magnitude」,而不是「cinematic camera move」。生成视频里那种糊成一团的感觉,很大一部分就来自含混的运动描述。

你的余量比你以为的大得多。 create 接口能吃 7,000 字符的提示词。作为对照,Veo 的文本输入上限是 1,024 token。三个字段哪怕写得很实,也离天花板远得很——所以没有任何理由把声音描述压成一个从句。

编辑部

作者

编辑部

minimax-h3ai.video

所有文章