我量了七支 AI 恐怖片。其中六支從頭到尾沒有安靜過。
七支官方 MiniMax H3 片子,2,340 次量測:只有一支真的安靜下來過,而它正是唯一一支恐怖片。類比恐怖需要提示詞給它什麼。

如果你的 AI 恐怖片一直做出來是滑稽而不是可怕,問題大概不在那隻怪物身上。 我懶得再猜了,所以與其爭論,不如把它量出來。
七支官方 MiniMax H3 展示片——我合法拿得到的每一支——全部下載下來過 ffmpeg,
以半秒為窗口量 RMS 音量,總共 2,340 個窗口。這是每一支的地板:

七支裡有六支從來不安靜。一次都沒有,連一個窗口都沒有。 那支時尚片——提示詞裡明確要 VHS 訊號干擾和監視器畫面中斷的那一支—— 整整十五秒都待在一個 16.8 dB 的帶子裡,最低只到 −25.5 dB。 那不是一條有動態的聲音軌。那是一堵牆。
有一支打破了這個模式,而它是這一組裡唯一走恐怖調性的。
那個例外,以及它的提示詞沒有說的話
那支吸血鬼預告開場大約有 1.6 秒在 −40 dB 以下,接著在 8.5s、10.0s 和 13.9s 又各沉下去一次。那不是一條開頭安靜的平軌。那是節奏—— 如果有人要你畫出「不安」的形狀,你就會畫成那樣。
看那一支的時候把聲音打開。整件事的重點都在你看不見的那一半。
於是我回頭翻它的提示詞,想找出產生這個結果的那條聲音指示,結果沒有。 1,366 個字元裡,完全沒有提到聲音、音樂、配樂、環境音、寂靜或安靜。一個字都沒有。
那份提示詞真正帶著的,是一種情緒調性,用四種不同的說法講了四次—— dark romance、gloomy oppression、high-end, restrained and compact、 the hook of a hit short drama's first 15 seconds—— 以及一份它拒絕成為的東西的清單:
No blood, no cheap horror, no Halloween feel, no modern street feel.
對照組就在同一份語料裡。官方那支犯罪片頭同樣拒絕恐怖,但它的做法不一樣: 它寫的是 not horror, not heavy,把溫度連同戲服一起否定掉。 它的地板是 −27.9 dB,而且一刻都沒有停過。
拒絕戲服,留下溫度。 這是我的解讀,而我想把它的強度講清楚: 六支片子告訴我預設就是滿場的聲音,這一點很紮實。 一支片子告訴我一個恐怖調性對那個預設做了什麼,而那是一個樣本。 在把它當成定論之前,我會先跑一次受控版本——同一個場景, 一條指名調性、一條不指名。
由此推出兩件事,而第二件才是有用的那件
降質那一套是免費的。 VHS 訊號干擾、掃描線、色差、漏光、磁帶顆粒、 訊號中斷——那是提示詞裡的一行,而官方那支時尚片證明了它一要就有。 這是大家搶著吵的那一半。它是簡單的那一半。
它同時也是這個模型的弱點不再是弱點的那一半。 每一個擴散影片模型都會在 VAE 上丟掉皮膚細節、在遠處散掉、把快速運動抹糊。 商品類的工作要跟這三件事對打。類比恐怖則花錢買外掛去假造這三件事。 這是極少數幾個你應該把模型對準它做不好的地方的類型。
寂靜不是免費的,而且它不來自你會去找的那個地方。
non_diegetic_music: N/A 仍然是我寫的第一行,你也應該寫——
把那個欄位留空,和在裡面填 N/A,不是同一條指示。
但按上面的證據,光是那個欄位並不是產生這一組裡唯一那支安靜片子的原因。
指名調性才是。
所以我現在把情緒調性寫得跟畫面調性一樣明確,並且指名否定掉錯的類型。 它讀起來像是布景裝飾。它看起來在做實事。
為什麼是 8.000 秒
H3 在 24 fps 下以 17n + 5 個影格為單位算圖,
也就是說你要的幾乎每一個長度都會落在小數上。192 影格正好是 8.000 秒,
而在可用的區間裡,它是唯一的整秒。
我量的那七支每一支都坐在那張網格上——其中五支是 362 影格,也就是 15.083 秒—— 而 MiniMax 自己的圖片轉影片展示是 192 影格。所以這不是我們推導出來的稀奇事。 它是這個模型的行為,而做參考素材的那些人已經在裡面工作了。 我們把整張網格算在這裡。
選八秒而不是十五秒還有第二個理由。你沒辦法在十五秒裡慢慢燒。 慢燒需要鋪陳、撐住、斷裂;十五秒只買得起撐住和斷裂。 所以這個形狀是繼承不安,而不是建立不安——第一格就必須讓人覺得不對, 之後的一切都是償還。
| 時間 | 影格 | 畫面 | 聲音 |
|---|---|---|---|
| 00:00.000 | 0 | 空走廊,廣角,靜止。一根日光燈管以一個緩慢不規則的週期閃爍。 | 安定器嗡聲、磁帶嘶聲、一棟建築沉降的聲音。沒有腳步、沒有呼吸、沒有人聲。 |
| 00:05.000 | 120 | 硬切到完全相同的構圖。走廊盡頭現在站著一個又高又瘦的身影,失焦,背對鏡頭。它沒有走進來。它就是在那裡。 | 不變。 畫面動了,聲音沒有。 |
| 00:07.000 | 168 | 沒有變化。 | 嗡聲斷掉。一秒的磁帶嘶聲,只剩它。 |
| 00:08.000 | 192 | 結束。 | — |
有一個細節在這裡比在任何地方都重要:把你的節拍放在一個真實存在的影格上。
24 fps 下,00:07.400 是第 177.6 格,那一格不存在,
於是你把自己的時間點交給了一次四捨五入。
00:07.000 是第 168 格,剛好留下一秒的尾巴。
那份提示詞
integrated_multimodal_description:
[Shot 1] Live-action, handheld VHS camcorder footage, 1994, heavy tape grain,
chroma bleed and a faint horizontal tracking line. A wide static shot down an
empty primary-school corridor at night. Lockers line both walls. One fluorescent
tube halfway down flickers on a slow irregular cycle; everything beyond it is
dark. Nothing moves. The camera does not move.
[Shot 2] At 00:05.000, hard cut to the identical framing. A tall thin figure now
stands at the far end of the corridor, out of focus, facing away. It is not
walking and never moves. The camera does not move. The fluorescent tube keeps
flickering on the same cycle.
Restrained, patient, oppressive. No blood, no gore, no jump-scare monster,
no Halloween styling.
overall_soundscape:
Room tone only. The low electrical hum of a fluorescent ballast, the constant
hiss of magnetic tape, and the distant settling of an empty building at night.
No footsteps, no breathing, no voices, no doors. At 00:07.000 the fluorescent
hum cuts out completely and the tape hiss is left alone.
non_diegetic_music:
N/A裡面有四個選擇值得說明。
那個身影是失焦的,而且從不移動。 把它對焦、打光或讓它動起來, 你就會得到一個微微滑稽的東西,因為模型一旦得替一張臉下決定,它的品味就露出來了。 失焦加靜止,藏住了畫面裡最難渲染的東西,而且它本來就更可怕—— 一個你看不太清楚的東西,你沒辦法把眼睛移開。
Shot 2 寫明聲音不變。 畫面變了,聲音沒有。 觀眾的第一個反應是懷疑自己有沒有看錯,而懷疑就是效果。
那些「沒有」是一項一項點名的。 不是「安靜」—— 而是 no footsteps, no breathing, no voices, no doors。 照我的經驗,「安靜」會被讀成「安靜的音樂」,那跟你要的正好相反。
最後一行否定掉錯的類型。 那一行是我量完之後才加的,也是我不會拿掉的那一行。
可以改什麼
那些調性字眼。 這一頁上槓桿最大的一行。 把 restrained 換成 frantic,你改動混音的程度不下於改動剪接, 不管你有沒有碰過聲音那幾個欄位。
那個身影到底要不要清晰起來。 在最後讓它往清晰的方向走一步, 是可用的單一改動裡最大的一個,而它通常會讓片子變差。試一次,你就知道為什麼。
房間底噪從哪裡來。 日光燈安定器在這裡做了很多事,因為它有一個音高, 而音高可以停。把它換成風聲或車流,就沒有東西可以被切斷了—— 這一驚需要一個帶著稜角的聲音。
哪裡會出錯
| 症狀 | 原因 | 要改的那一行 |
|---|---|---|
| 該安靜的地方底下有音樂 | non_diegetic_music 留空了,沒有設值 | 在裡面寫 N/A |
| 有人在說話,或在旁白 | 音景說了「安靜」,卻從來沒說「沒有人聲」 | 把那些「沒有」一項一項點名 |
| 怪物看起來很滑稽 | 那個身影對到焦、被打了光,或者在動 | out of focus、never moves,把它留在畫面最暗的地方 |
| 整支片子從頭吵到尾 | 給了畫面調性,沒給情緒調性 | 加上那條否定的句子 |
| 節拍晚了一點點 | 長度不在影格網格上 | 用 192 影格——8.000 秒 |
這要多少錢
按我們的費率,768P 一秒是 8 點數,而每支片子帶一次 5 點數的解析, 所以一條八秒的片子是 69 點數。
要緊的數字是「幾條」,不是「那一條」。抓三到四條才會有一條值得留—— 那是整個這類工具誠實的數字,恐怖片也不例外, 因為你追的是一種感覺,不是一張檢查表。留一條大約算 276 點數。
用 768P 拍,而且不是為了省錢。這個類型要的就是降質,而 2K 跟你作對。 這是少數幾個便宜那一檔才是正確那一檔的情況, 而省下來的差額買到的是真正產出那一條的額外次數。費率在這裡。
這東西能發嗎?
搜尋結果第一頁上似乎沒有人回答的問題,也是每一個恐怖創作者真正在意的問題。
類比恐怖靠的是降質和缺席,不是血腥,而那正好讓它待在多數平台的政策之內—— 也待在我們的政策之內。把 no blood, no gore 寫進提示詞不只是品味。 它還放行了一道過濾。
有一條規則不管怎樣都值得守:不要用有名字的第三方角色。 Backrooms、閾限空間和沒有品牌的不安是你的。別人的怪物不是, 而那是一場跟法務部門的仗,不是一場跟內容政策的仗。
試試看
一字不差的官方提示詞、那些槓桿,以及完整的失敗清單,都在 哥德預告範本上, 包括這篇文章建立在上面的那份量測。如果你想從上面那條走廊開始, 文字轉影片 裡的 Horror 預設會把它載進來,音景已經填好。
如果你要的是底下那個「H3 把聲音當成內容而不是配菜」的論證,那 另外寫在一篇裡。
來源片段是 MiniMax 的官方範例,發布於 awesome-minimax-h3-prompts 集合
(CC BY 4.0)與 MiniMax H3 模型卡。量測是我們自己做的:
ffmpeg -af astats=metadata=1:reset=24,2026-09-03。

