我量了七条 AI 恐怖片。其中六条从头到尾没安静过。
七条官方 MiniMax H3 片、2,340 次测量:只有一条真的安静下来过,而它恰好是唯一一条恐怖片。analog horror 到底需要提示词给什么。

如果你的 AI 恐怖片总是拍出来滑稽多过吓人,问题多半不在怪物身上。我懒得再猜了,所以没去争论,直接量了一遍。
七条官方 MiniMax H3 展示片——我能合法拿到的每一条——全部下载下来过 ffmpeg,按半秒窗口测 RMS 电平,合计 2,340 个窗口。下面是每一条的底噪地板:

七条里有六条从来没安静过。 一次都没有,一个窗口都没有。那条时尚片——提示词里明确要了 VHS 故障与 CCTV 信号中断的那条——整整十五秒都待在一个 16.8 dB 的带子里,最低只到 −25.5 dB。那不是一条有动态的声轨,那是一堵墙。
有一条打破了这个模式,而它是这组里唯一一条走恐怖调性的。
那个例外,以及它的提示词里没写的东西
吸血鬼预告片开头大约 1.6 秒在 −40 dB 以下,随后在 8.5 秒、10.0 秒、13.9 秒又各沉下去一次。那不是一条前面安静的平轨,那是节奏——如果有人让你画出「不安」的形状,你画出来就是这个样子。
这一条请把声音打开。整件事的关键全在你看不见的那一半里。
于是我回头去翻它的提示词,想找出产生这个效果的那条音频指令——没有这条指令。 1,366 个字符里,没有出现 sound、music、score、ambience、silence 或 quiet。一个都没有。
提示词里真正有的,是一个用四种说法反复讲的情绪调性——dark romance、gloomy oppression、high-end, restrained and compact、一部爆款短剧头 15 秒的钩子——以及一串它拒绝成为的东西:
No blood, no cheap horror, no Halloween feel, no modern street feel.
对照组就摆在同一批素材里。官方那条犯罪题材片头也拒绝恐怖,但拒绝的方式不同:它写的是 not horror, not heavy,把温度连同戏服一起否定掉了。它的地板是 −27.9 dB,全片一刻没停。
否定戏服,保住温度。 这是我的读法,而它有多硬我想说清楚:六条片告诉我默认状态是满铺声音,这一条很扎实;一条片告诉我恐怖调性会对这个默认做什么,那是一个样本。 在把它当定论之前,我会先跑一次对照版——同一个场景,一条点明调性,一条不点。
由此有两个推论,第二个才是有用的那个
降解工具包是白送的。 VHS 故障、扫描线、色差、漏光、磁带颗粒、信号中断——这些就是提示词里的一行,而官方那条时尚片证明了它招之即来。这是所有人抢着讨论的那一半,也是容易的那一半。
它同时还是这个模型的短板不再是短板的那一半。所有扩散视频模型都会在 VAE 那里丢掉皮肤细节、在远景处散架、把快速运动抹糊。产品片要跟这三件事死磕;analog horror 要花钱买插件去伪造这三件事。这是极少数你该把模型往它不擅长的地方推的题材之一。
静默不是白送的,而且它不来自你会去找的那个地方。 non_diegetic_music: N/A 仍然是我写的第一行,你也该写——把那个字段留空,和往里填 N/A,不是同一条指令。 但按上面的证据,光靠这个字段并没有产出那组里唯一安静的那条片。是点明调性做到的。
所以我现在把情绪调性写得和视觉一样明确,并且点名否定掉错的那个类型。它读起来像布景装饰,但它看上去在真的干活。
为什么是 8.000 秒
H3 按 24 fps 渲染 17n + 5 帧的块,所以你要的几乎每一个时长都会落在小数上。192 帧正好是 8.000 秒,而在可用区间里它是唯一的整秒。
我量的七条片每一条都落在这个栅格上——其中五条是 362 帧,也就是 15.083 秒——而 MiniMax 自己的图生视频展示片是 192 帧。所以这不是我们推出来的一个趣闻,这就是模型的行为,而且做参考素材的人已经在这个栅格里工作了。我们把这个栅格完整算过一遍。
选 8 秒而不是 15 秒还有第二个理由:十五秒里做不出慢烧。 慢烧需要「铺陈—保持—打破」,十五秒只买得起「保持」和「打破」。所以这个形状是继承不安,而不是建立不安——第一帧就得已经不对劲,后面的每一帧都是在还账。
| 时间 | 帧 | 画面 | 声音 |
|---|---|---|---|
| 00:00.000 | 0 | 空走廊,广角,固定机位。一支荧光灯管按一个缓慢不规则的周期闪。 | 镇流器嗡声、磁带嘶声、楼在沉降。没有脚步、没有呼吸、没有人声。 |
| 00:05.000 | 120 | 硬切到完全相同的构图。走廊尽头现在站着一个瘦高的身影,虚焦,背对镜头。它没有走进来,它就是在那儿了。 | 不变。 画面动了,声音没动。 |
| 00:07.000 | 168 | 无变化。 | 嗡声切断。剩下一秒,只有磁带嘶声。 |
| 00:08.000 | 192 | 结束。 | — |
有一个细节在这里比在别处都重要:把你的节拍放在一个真实存在的帧上。 24 fps 下 00:07.400 是第 177.6 帧,它不存在,于是你把自己的时间点交给了一个取整步骤。00:07.000 是第 168 帧,正好留出一秒尾巴。
提示词
integrated_multimodal_description:
[Shot 1] Live-action, handheld VHS camcorder footage, 1994, heavy tape grain,
chroma bleed and a faint horizontal tracking line. A wide static shot down an
empty primary-school corridor at night. Lockers line both walls. One fluorescent
tube halfway down flickers on a slow irregular cycle; everything beyond it is
dark. Nothing moves. The camera does not move.
[Shot 2] At 00:05.000, hard cut to the identical framing. A tall thin figure now
stands at the far end of the corridor, out of focus, facing away. It is not
walking and never moves. The camera does not move. The fluorescent tube keeps
flickering on the same cycle.
Restrained, patient, oppressive. No blood, no gore, no jump-scare monster,
no Halloween styling.
overall_soundscape:
Room tone only. The low electrical hum of a fluorescent ballast, the constant
hiss of magnetic tape, and the distant settling of an empty building at night.
No footsteps, no breathing, no voices, no doors. At 00:07.000 the fluorescent
hum cuts out completely and the tape hiss is left alone.
non_diegetic_music:
N/A里面有四个选择值得解释。
那个身影是虚焦的,而且从不移动。 你一旦给它对焦、打光或者让它动起来,出来的东西就会带点滑稽——因为模型一旦被迫对一张脸做出承诺,它的品味就露出来了。 虚焦加静止藏掉了画面里最难渲染的那样东西,而且更吓人:你没法把视线从一个你看不清的东西上移开。
Shot 2 明写了声音不变。 画面变,声音不变。观众的第一反应是怀疑自己刚才看错了,而怀疑本身就是效果。
每一样「没有」都被单独点名。 不是「安静」——而是 no footsteps, no breathing, no voices, no doors。以我的经验,「安静」会被读成「安静的音乐」,那恰好是你要的反面。
最后一行否定掉错的那个类型。 这一行是我量完之后加的,也是我最不会删的一行。
该改哪里
调性词。 这一页上杠杆最大的一行。把 restrained 换成 frantic,你改动的混音幅度跟改剪辑一样大——不管你有没有碰那几个音频字段。
那个身影到底要不要清晰起来。 让它在最后一刻往清晰迈一步,是可选项里最大的一个改动,而它通常会让片子变差。 试一次,好知道为什么。
室内底噪从哪儿来。 荧光灯镇流器在这里干了很多活,因为它有一个音高,而音高可以停。 换成风声或车流声,就没有东西可以切断了——这个惊吓需要一个带棱角的声音。
哪里会出错
| 症状 | 成因 | 该改哪一行 |
|---|---|---|
| 本该静默的那段底下有音乐 | non_diegetic_music 留空了而不是填了值 | 往里写 N/A |
| 有人在说话,或者在旁白 | 声景写了「安静」但从没写「没有人声」 | 把每一样「没有」逐条点名 |
| 怪物看着滑稽 | 身影对焦了、被打光了,或者动了 | out of focus、never moves,把它留在画面最暗的地方 |
| 整条片从头响到尾 | 给了视觉调性,没给情绪调性 | 加那行否定 |
| 节拍晚了一丁点 | 时长不在帧栅格上 | 用 192 帧——8.000 秒 |
要花多少钱
按本站费率,768P 每秒 8 积分,每条片另有 5 积分的解析,所以一条八秒的是 69 积分。
真正要紧的数字是要几条,不是一条。做好三到四条才留得下一条的准备——这是整个这一类工具上诚实的数字,恐怖题材也不例外,因为你追的是一种感觉而不是一张清单。一条能用的,算下来大约 276 积分。
用 768P 拍,而且不是为了省钱。 这个题材要的就是降解,2K 是跟你作对。这是少数几种「便宜那一档才是正确那一档」的情况,而省下来的差价正好买到那几条真正产出成片的额外尝试。费率在这里。
能发出去吗
这是搜索结果第一页上似乎没人回答、而每一个恐怖创作者都真的想问的问题。
analog horror 靠的是降解与缺席,而不是血浆,而这恰恰是它能待在大多数平台政策之内的原因——也待在我们的政策之内。把 no blood, no gore 写进提示词不只是品味问题,它还能过闸。
有一条规矩无论如何都值得守住:不要用别人家的角色。 Backrooms、liminal space、没有品牌的不安,这些都是你的;别人的怪物不是,而那是一场跟法务部门而不是跟内容政策的仗。
去试
一字不差的官方提示词、所有可调的杠杆和完整的失败清单都在哥特预告片模板里,包括这篇文章赖以成立的那份测量。如果你更想从上面那条走廊开始,文生视频里的 Horror 预设已经把声景填好了。
如果你想看底层那个论点——H3 是把音频当内容而不是当配菜的——那件事单独写过。
源片是 MiniMax 的官方示例,发布于 awesome-minimax-h3-prompts 合集(CC BY 4.0)与 MiniMax H3 模型卡。测量是我们自己做的:ffmpeg -af astats=metadata=1:reset=24,2026-09-03。


