Prompt craft

把聲音寫進 H3 提示詞,以及決定你聽到什麼的那三個欄位

畫面和 32 kHz 立體聲是同一次運算出來的,所以聲音得寫在提示詞裡。三個欄位決定你聽到什麼,而台詞另有一套寫法。

6 分鐘讀完編輯部編輯部
把聲音寫進 H3 提示詞,以及決定你聽到什麼的那三個欄位

多數影片模型把聲音當成第二件差事。H3 不是:畫面和聲音來自同一次前向運算, 32 kHz 立體聲,包在同一個 MP4 裡。沒有另外一個音訊提示詞,也沒有關掉它的開關。

實際的後果是:你沒有寫的聲音,就不是你選的聲音。 模型無論如何都會生一份出來, 而它在沒有指示時交出來的,是這個場景聽起來最像的那個平均值。

結構化提示詞裡有三個帶聲音的欄位

H3 吃的提示詞格式是一份結構化文件,不是一段話。文字、圖片和關鍵影格任務用的是 三個欄位,順序永遠是這個:

integrated_multimodal_description
overall_soundscape
non_diegetic_music

它們不能互換,而這個切分本身就是有用的部分:

  • integrated_multimodal_description 裝的是鏡頭——構圖、主體、環境、動作、 攝影機,以及任何在某個特定時刻被聽見的東西,帶時間碼: At 00:04.500, the door latch clicks.
  • overall_soundscape 是這個世界的環境音和擬音。房間底噪、雨聲、遠處的車流、 冰箱。整支片子裡都成立的那些東西。
  • non_diegetic_music 是配樂——在場景之外,場景裡沒有人聽得到。風格、配器、 速度,以及情緒怎麼走。

最常見的錯誤就住在最後這一個裡。把配樂寫進音景那一欄,等於要模型生一段存在於 這個房間裡的音樂,於是你拿到的東西聽起來像是畫面外某個喇叭正在放。要配樂, 就寫在配樂那一欄。

non_diegetic_music: none 是一條完全正當、而且很少人用的指示。 帶紀錄片味道的素材幾乎永遠需要它。

台詞有它自己的語法

這是最難自己摸出來、但一寫就立刻改變結果的部分。每一句台詞都掛著一個說話者代號、 一個語言,和一句表演提示:

(S1) speaks softly, [English] Follow the wind, live free.

這裡有三樣東西在做事:

  • (S1) 是一個穩定的說話者 ID。重複用它,這個聲音在好幾句之間都不會變; 引入 (S2) 就得到第二個、明顯不同的聲音。兩個人的對手戲就是這樣撐住的。
  • [English] 指定說出來的語言。有十一種是穩定支援的:阿拉伯文、中文、英文、 法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。
  • 方括號前面那句表演提示——speaks softlylevel broadcast deliveryshouting over traffic——對表演的影響,比你在畫面描述裡堆多少形容詞都大。

有一條規則會絆倒用其他語言寫稿的人:官方建議是把改寫後的提示詞用英文寫, 但台詞、歌詞,以及任何會出現在畫面裡的文字,維持原本的語言。一句德文台詞 在方括號裡就還是德文;圍著它的描述是英文。

同一條規則管的還有攝影機看得見的字,而這一條值得單獨講,因為它壞掉的時候是無聲的: 指定了語言,H3 就用那個語言渲染畫面上的文字;沒指定,它就從場景裡挑一個。 一份英文簡報最後拿回一張中文片尾卡就是這麼來的—— MiniMax H3 拿你沒指定的文字怎麼辦 那篇是一格一格量出來的。

一個寫完整的例子

底下是一顆新聞棚鏡頭,按長的寫法寫出來。它不複雜——它只是寫完了。

integrated_multimodal_description:
[Shot 1] Locked-off medium shot, chest up. A presenter sits at a dark
news desk, studio key light from camera left, out-of-focus screens
behind her. She looks straight down the lens and delivers one line.
At 00:00.800 she begins speaking. At 00:03.200 she pauses, then
completes the sentence.
(S1) level broadcast delivery, [English] The vote came in just after
midnight.

overall_soundscape:
Room tone only. Faint air handling. No audience, no paper, no
keyboard.

non_diegetic_music:
None.

最要緊的兩條限制,是後面那兩個欄位各自的最後一句。「Room tone only」和「None」 才是攔住模型的東西——不然它會替這顆鏡頭配上樂,再加一片你沒要的新聞棚人聲。

官方指引真正在管的那幾條

五條,值得拿去對一遍自己的提示詞:

  1. 改寫用英文寫;台詞、歌詞和畫面上的文字留在它們自己的語言裡。
  2. 每一顆鏡頭按這個順序描述:構圖 → 主體 → 環境 → 動作 → 攝影機 → 聲音 → 任何被引用的素材出現的確切時刻
  3. 不要劇情摘要,不要沒有交代的引用標記,不要加起來對不上指定長度的時間安排。
  4. 每一個細節都必須對應到看得見或聽得到的東西。「她感到不確定」不是細節。 「她瞥向畫面外,那句話沒有說完」才是。
  5. 欄位順序固定不動。

第 4 條是那條會悄悄把所有東西都變好的規則。一份完全由麥克風或鏡頭記錄得到的 東西寫成的提示詞,才是模型執行得了的提示詞。

關於額度,兩件值得知道的事

運鏡是三個部分,不是一個。 官方的詞彙表是運動類型 + 幅度 + 速度—— 寫「slow push-in, small magnitude」,而不是「cinematic camera move」。 生成影片裡那種糊糊的感覺,很大一部分就來自含混的運動描述。

你的空間比你以為的大得多。 建立任務的端點接受最長 7,000 個字元的提示詞。 對照一下,Veo 的文字輸入上限是 1,024 個 token。三個欄位好好寫也碰不到天花板, 所以沒有任何理由把聲音的描述壓縮成一個子句。

三個都寫,然後聽聽回來的東西:MiniMax H3 AI 影片生成器 把 32 kHz 立體聲放在同一個 MP4 裡交回來,事後不必再混一次音。

編輯部

作者

編輯部

minimax-h3ai.video

發布於 MiniMax H3 AI Video Generator,一個基於 MiniMax H3 的獨立第三方介面。

所有文章