AI ASMR 触发音视频生成
ASMR 本质是一个配了画面的音频品类,毁掉它的永远是同步——脆响晚三分之一秒,观众立刻觉得假,而且是先感觉到、后说得出。这里声音和画面在同一次生成里产出,所以壳真正裂开的那一刻才有那声脆响。32 kHz 立体声,4 到 15 秒的 ASMR,不用再去翻音效库。
从素材库里挑的五条,挑的标准是触发音而不是画面。**请戴耳机。**你听到的每一声都是跟着帧一起生成出来的。
6s · 16:9 · 768P注水与压粉
AI ASMR 失败的原因:它首先是同步问题,其次才是画面问题
常规的 AI ASMR 视频流程是这样的:先生成一条无声片子,去音效库找触发音,叠两三条音轨,再一点点挪音频峰值去对齐画面峰值。第一步之后的每一步,都是因为模型只交给你沉默。而挪音频这一步永远差那么一点——脆响晚三分之一秒,观众在能说出哪里不对之前就已经感觉到了。

一条提示词
画面与触发音,一起生成
这里声音和帧出自同一次前向传播,所以它们天然对齐,而不是靠剪辑对齐。你导的是一个本来就有声音的场景,而不是给一个没声音的场景配乐。 这不代表音频是自动的——它把工作挪进了提示词里,而这个品类需要的三层声音在那里各有各的位置。下一节就把这个字段拆开讲。
- 画面与声音同一次产出
- 1
- 立体声,不是单声道上混
- 32 kHz
- 需要授权的音效库
- 0
- 最短时长,多数站点从 5 秒起
- 4s
画面与声音同一次产出
立体声,不是单声道上混
需要授权的音效库
最短时长,多数站点从 5 秒起
- 不用再去音效库里搜
- 不用在剪辑软件里手动对峰值
- 不用为了让触发音出来而压低背景音乐
- 不用花钱去掉水印
一条提示词,一次生成,声音是跟着画面一起来的
打开这条之前先戴上耳机——用画面去评判一条 AI ASMR 视频,等于在评判它的另一半。注水声、油脂层破开的声音、杯子落在托碟上的声音,都不是找来的、摆上去的、对上去的——它们和帧出自同一次生成,所以才会落在该落的那一帧上。卡片会把完整提示词按原本的时长和画幅交给你,换个材质就能再跑一遍。
更多 ASMR 提示词 ↗
16:9 · 6s · 768P完整提示词,不是摘要
16:9, 6 seconds, 768P. Extreme close-up of espresso pouring into a warm cup under a single soft light, crema breaking across the surface. Slow, steady, no hands in frame.
六秒钟,声音落在该落的帧上,因为它从来就不是一个单独的文件
这些都不是为这个页面专门拍的——它们是素材库里触发音最强的几条。我们宁可给你看五条真实的,也不给你看五条摆拍的。
做 AI ASMR 视频的三条路
三条路跑的是同一个模型、同一个价格。区别只在于声音设计里有多少是你自己写的——而且三条路都不以打开音频软件收尾。
- 4–15 秒,32 kHz 立体声
用简单的文字提示词生成 AI ASMR 视频
描述 ASMR 的材质以及它在做什么。触发音、次层质感和环境底噪,是同一个字段里的三个分句。
- 帮你把分层写出来
用 AI 改进你的 ASMR 提示词
把一个粗糙的 ASMR 想法粘进去,拿回三段式结构:声景被拆成分层,音乐字段被填上而不是留空。
- 参考片 → 提示词 → 成片
从一条参考片到成片的完整 AI 流程
丢进一条你喜欢的 ASMR 片子,拿回能产出它的提示词——包括它的声音是怎么搭起来的。然后换一个材质,跑起来。
三条路,同一个价格——768P 每秒 8 积分,而 ASMR 没有理由离开 768P。
四步做出一条 AI ASMR 视频
做 ASMR 的顺序和通常的视频建议正好相反。先写声音,让画面跟着声音走,因为画面只要说得过去,声音必须对。

先选材质,不是先选氛围
*磨砂玻璃、绒面织物、亚克力板、气泡膜、木梳的齿。*材质驱动的触发音是这个模型最强的地方,也是这个品类流量最大的地方。你写出材质,模型能推出声音;你只写声音,它就得去猜材质。
材质优先不需要出镜的脸
把三层声音写进同一个字段
主触发音在最前,次层质感压在它下面,环境底噪垫在两者之下。这就是每一份 ASMR 混音教程都让你在音频工作站里搭的结构——在这里它是声景字段里的三个分句,一次生成出来。
触发音质感层底噪层
刻意把音乐关掉
在 `non_diegetic_music` 里写 `N/A`。留空不等于同一条指令——模型照样会给场景配乐,而触发音底下压着任何有节奏的东西,都会抵消你想要的效果。这是最常见的一个失败。
non_diegetic_music: N/A
生成 8 秒,然后循环
ASMR 靠的是完播率高的短循环,而192 帧——正好 8.000 秒——是模型能产出的唯一一个整秒,也就是唯一一个能无缝循环的时长。要别的长度,你就得回剪辑软件里裁掉一个零头。
192 帧8.000s无缝循环
这四步里没有一步发生在生成之后。这个品类其余产品要在音频工作站里做的分层与对时,在这里被一个按正确顺序写好的字段取代了。
决定你的 ASMR 视频有没有酥麻感的五项检查
每一项都是 ASMR 提示词里的一个分句,也都是这个品类反复被讨论的一种失败。花一次生成之前先过一遍。
空隙底下有底噪
触发音之间那种纯数字的寂静,是最容易破坏沉浸感的破绽,因为真实录音永远有本底噪声。写明一层很轻的环境音,让它垫在所有声音之下。
两层之下的环境底噪
音乐字段写着 N/A
留空不是一条指令。触发音底下压着任何有节奏的东西都会抵消它——这个品类自己的教程也说,宁可完全不要音乐,也别小声混进去。
non_diegetic_music: N/A
有两层触发音,而不是一层
单一声音循环,三十秒内就会听出人工感。把主角放在最前,再在它下面放一个相关的声音——刀被放下的声音、指尖重新换位置的声音。
主层 + 次层
声音和画面上的材质对得上
一种材质的画面配上另一种材质的声音特征,沉浸感瞬间就没了。在这里两者出自同一次生成,所以唯一会做错的方式,是材质写得太含糊。
写清楚是什么材质
没有人说话
ASMR 观众要的是纯触发音。别默认它不会加人声,直接写上*不要说话、不要旁白、不要人声*——画面里有人的时候,模型很乐意给他配上一句。
不要说话,不要旁白
五项里有四项在说声音,第五项在说让画面跟声音对上。这个比例本身就是这个品类的定义。
让这个模型不适合做恐怖片的那一点,恰好让它适合做 ASMR
我们为了另一件事测过七条官方 H3 片子——2,340 个半秒窗口——其中六条在任何时刻都没有真正降到本底噪声。在 我们的恐怖视频页 上,这正是整页要解决的问题,因为恐惧感活在空隙里。而对 ASMR 来说,这是必需品。
它不会给你数字寂静
破坏 ASMR 沉浸感的破绽,是一段什么都没有的空隙。这个模型的本能是把声音铺满,所以这个品类最费力气去避免的失败,在这里反而要费力气才做得出来。
提示词里每一层都有自己的位置
主触发音、次层质感、环境底噪——每份混音教程都在讲的三层结构,在这里写进同一个字段里一起生成,而不是事后在三条音轨上拼起来。
同步不是一个步骤
瞬态音会落在事件发生的那一帧上,因为两者本来就出自同一次生成。不用挪,换个时长重新生成也不会有东西跑偏。
耳语类是它的弱项
材质类触发音才是它站得住的地方。口腔音那种亲密感和贴耳耳语,在生成音频里普遍都是最弱的一环,这里也一样——如果你要做的是有人说话的内容,请从 对口型 开始。
十五秒是硬上限,所以长篇 ASMR 不是在这里生成出来的——你生成的是那个循环,然后让它重复。这适合短视频,因为这个形式本来就活在那里;这不适合三十分钟的助眠视频。如果你要做的是后者,这就是错的工具,早知道比晚知道便宜。
四类经得起十五秒的 ASMR 触发音
每一类 ASMR 触发音都会按原本的时长和画幅,从素材库里载入一条提示词。四类都是材质触发音,这也是这个模型最强的那一档。
9:16 · 15s脆裂与撕开
先是壳让开,然后是更软的内里。两层声音长在同一个动作里,所以这是最容易上手的起点。
1:1 · 15s陶釉上的干涩摩擦
粉末、竹子和陶。几乎没有动作,整条片子全靠一种你从音效库里很难干净找到的质感撑着。
9:16 · 8s一响一响分开的爆裂
彼此之间留着真正空隙的独立事件——这是环境底噪最要紧的情形,因为空隙本身就是结构。
9:16 · 15s玻璃、金属、喷头
慢慢处理的硬表面。这一档最接近传统的敲击类 ASMR,也是最经得起长片的一档。
注意这四类里都缺了什么:一张脸和一个人声。材质触发音是生成式 ASMR 更聪明的起手切口,而且它们也正是算法在完播率上会奖励的那一类。
一个八秒的循环是 69 积分,而循环正是你想要的
一条片子固定 5 积分用于读你的提示词,再加 768P 每秒 8 积分。ASMR 没有理由离开 768P——ASMR 是戴着耳机在手机上看的,多出来的分辨率看不见,声音才是全部。生成八秒,让它循环,把省下来的钱花在试第二种材质上。
这是怎么计费的
- 计费单位
- 成片每秒
- 768P 每秒
- 8 积分
- 每条片子
- 5 积分,不分长短
- 768P 八秒循环
- 69 积分
- 生成失败
- 自动退回,不用填表
- 9:16 或 1:1
- 与 16:9 同价
两种付法每月积分一样多
- 免费不用绑卡
不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。
$0永久全程不需要信用卡
免费开始只做机器人校验,不要邮箱
1 条,不用账号
Agnes Video V2.0 · 16:9 · 5 秒 · 无声
登录仍然免费,Agnes 引擎每天 3 条,无声$9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K
- MiniMax H3 原生 2K仅付费
- 声音与画面一起生成仅付费
- 一条,不用账号
- 同时跑 1 个任务
- 失败的片子不花钱
- 生成内容私有
- 任意积分包都能解锁 MiniMax H3 的全部模式
免费档是另一个引擎。看套餐
速度与排队
- 队列
- 免费通道
- 同时任务数
- 1
- 批量
- 1
- 历史保留
- 24 小时 · 登录后 7 天
- 支持
- 社区
- Lite省 30%
解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。
$16.9/mo$24.9按年扣 $202.8 · 一年省 $96
7 天退款 · 随时取消
每月 750 积分 · 约 20 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 13 条
月付年付,每月积分一样多
- MiniMax H3 原生 2K:音画同生
- 对白、音效与配乐在同一个文件里
- 最长 15 秒15s
- 每月约 20 条 4 秒 768P 文生视频
- 失败的片子不花钱
- 积分未使用可 7 天退款
- 同时跑 1 个任务
- 同一条提示词可批量出 2 个版本
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 标准
- 同时任务数
- 1
- 批量
- 2
- 历史保留
- 7 天
- 支持
- 邮件 · 48 小时
- 多数人推荐Pro省 30%
比 Lite 多 $32。每月约 47 条,同样的 MiniMax H3,队列更快。
$39.9/mo$56.9按年扣 $478.8 · 一年省 $204
7 天退款 · 随时取消
每月 1,775 积分 · 约 47 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 31 条
月付年付,每月积分一样多
- 包含 Lite 的全部
- 每月约 47 条 4 秒 768P 文生视频
- 同时跑 3 个任务3×
- 视频反推提示词
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 积分未使用可 7 天退款
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 快速
- 同时任务数
- 3
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 邮件 · 12 小时
- Studio省 30%
一整个月的产量,排队最优先,还有 4 小时内回你的真人。
$99.9/mo$142.9按年扣 $1,198.8 · 一年省 $516
7 天退款 · 随时取消
每月 4,425 积分 · 约 119 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 77 条
月付年付,每月积分一样多
- 包含 Pro 的全部
- 每月约 119 条 4 秒 768P 文生视频
- 同时跑 8 个任务8×
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 优先支持,4 小时内响应
- 我们能给到的最低积分消耗
- 积分未使用可 7 天退款
仅限个人与评估用途:商用权利来自 MiniMax
速度与排队
- 队列
- 优先,排在最前面
- 同时任务数
- 8
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 优先 · 4 小时
发布一条 AI ASMR 视频之前该检查什么
AI ASMR 的内容问题比多数品类都少,但多了一个披露问题。
- 披露说明它是生成的。ASMR 观众对真实性异常敏感,平台也越来越多地对合成音频做检测——一开始就标注清楚的片子,不会被当成对一段真实录音的主张。
- 人声不要克隆创作者的耳语。声音是可识别身份的,ASMR 的声音尤其如此——观众跟的就是那个声音。
- 手和脸生成的手没问题。真实、可识别的人需要本人同意,这一点和本站其他地方一样。
- 权利所有套餐(包括付费套餐)的产出都仅供个人使用与评估。本站无法就模型产出授予商用权利。
AI ASMR 视频生成常见问题
问得最多的八个 AI ASMR 问题,连同背后的数字一起回答。
这个 AI ASMR 视频生成工具免费吗?
之后还要自己去加触发音吗?
我做的 AI ASMR 为什么听起来很假?
怎么让它别加音乐?
一条 AI ASMR 片子该做多长?
它能做耳语或口腔音 ASMR 吗?
ASMR 要用 2K 生成吗?
能做竖屏吗?
由 MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新
