AI ASMR 触发音视频生成

ASMR 本质是一个配了画面的音频品类,毁掉它的永远是同步——脆响晚三分之一秒,观众立刻觉得假,而且是先感觉到、后说得出。这里声音和画面在同一次生成里产出,所以壳真正裂开的那一刻才有那声脆响。32 kHz 立体声,4 到 15 秒的 ASMR,不用再去翻音效库。

写下你的镜头

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • 文生视频必须指定画幅,这里没有「自适应」这个选项
  • 时长按 24 fps 下的 17n+5 帧对齐,所以 192 帧(8.000 秒)是范围内唯一的整秒
  • 写上 `non_diegetic_music: N/A`——触发音底下压着任何有节奏的东西都会毁掉效果
  • 写材质,别写声音。「脆响」是模糊的,「瓜皮被切开时那声湿脆」不是

不用银行卡、不用注册:在免费引擎上跑一条,本页每个示例都能听,完整提示词也一并给你。注册免费账号再加三条带声音的真实 MiniMax H3 片子,而且都不过期。

从素材库里挑的五条,挑的标准是触发音而不是画面。**请戴耳机。**你听到的每一声都是跟着帧一起生成出来的。

AI ASMR 视频:微距近景下的意式浓缩注水,油脂层在杯面上散开6s · 16:9 · 768P

注水与压粉

AI ASMR 为什么常翻车

AI ASMR 失败的原因:它首先是同步问题,其次才是画面问题

常规的 AI ASMR 视频流程是这样的:先生成一条无声片子,去音效库找触发音,叠两三条音轨,再一点点挪音频峰值去对齐画面峰值。第一步之后的每一步,都是因为模型只交给你沉默。而挪音频这一步永远差那么一点——脆响晚三分之一秒,观众在能说出哪里不对之前就已经感觉到了。

微距近景下的意式浓缩注水,声音跟着帧一起生成

一条提示词

画面与触发音,一起生成

这里声音和帧出自同一次前向传播,所以它们天然对齐,而不是靠剪辑对齐。你导的是一个本来就有声音的场景,而不是给一个没声音的场景配乐。 这不代表音频是自动的——它把工作挪进了提示词里,而这个品类需要的三层声音在那里各有各的位置。下一节就把这个字段拆开讲。

画面与声音同一次产出
1

画面与声音同一次产出

立体声,不是单声道上混
32 kHz

立体声,不是单声道上混

需要授权的音效库
0

需要授权的音效库

最短时长,多数站点从 5 秒起
4s

最短时长,多数站点从 5 秒起

  • 不用再去音效库里搜
  • 不用在剪辑软件里手动对峰值
  • 不用为了让触发音出来而压低背景音乐
  • 不用花钱去掉水印

提示词生成视频

一条提示词,一次生成,声音是跟着画面一起来的

打开这条之前先戴上耳机——用画面去评判一条 AI ASMR 视频,等于在评判它的另一半。注水声、油脂层破开的声音、杯子落在托碟上的声音,都不是找来的、摆上去的、对上去的——它们和帧出自同一次生成,所以才会落在该落的那一帧上。卡片会把完整提示词按原本的时长和画幅交给你,换个材质就能再跑一遍。

更多 ASMR 提示词 ↗
AI ASMR 视频:微距近景下的意式浓缩注水,油脂层在杯面上散开16:9 · 6s · 768P

完整提示词,不是摘要

16:9, 6 seconds, 768P. Extreme close-up of espresso pouring into a warm cup under a single soft light, crema breaking across the surface. Slow, steady, no hands in frame.

6s · 16:9

六秒钟,声音落在该落的帧上,因为它从来就不是一个单独的文件

这些都不是为这个页面专门拍的——它们是素材库里触发音最强的几条。我们宁可给你看五条真实的,也不给你看五条摆拍的。

它能做什么

做 AI ASMR 视频的三条路

三条路跑的是同一个模型、同一个价格。区别只在于声音设计里有多少是你自己写的——而且三条路都不以打开音频软件收尾。

  • 用简单的文字提示词生成 AI ASMR 视频

    描述 ASMR 的材质以及它在做什么。触发音、次层质感和环境底噪,是同一个字段里的三个分句。

    4–15 秒,32 kHz 立体声
  • 用 AI 改进你的 ASMR 提示词

    把一个粗糙的 ASMR 想法粘进去,拿回三段式结构:声景被拆成分层,音乐字段被填上而不是留空。

    帮你把分层写出来
  • 从一条参考片到成片的完整 AI 流程

    丢进一条你喜欢的 ASMR 片子,拿回能产出它的提示词——包括它的声音是怎么搭起来的。然后换一个材质,跑起来。

    参考片 → 提示词 → 成片

三条路,同一个价格——768P 每秒 8 积分,而 ASMR 没有理由离开 768P。

完整流程

四步做出一条 AI ASMR 视频

做 ASMR 的顺序和通常的视频建议正好相反。先写声音,让画面跟着声音走,因为画面只要说得过去,声音必须对。

  1. 竖构图微距下被掰开的可颂

    先选材质,不是先选氛围

    *磨砂玻璃、绒面织物、亚克力板、气泡膜、木梳的齿。*材质驱动的触发音是这个模型最强的地方,也是这个品类流量最大的地方。你写出材质,模型能推出声音;你只写声音,它就得去猜材质。

    材质优先不需要出镜的脸
  2. 写进了三层声音的 ASMR 声景字段

    把三层声音写进同一个字段

    主触发音在最前,次层质感压在它下面,环境底噪垫在两者之下。这就是每一份 ASMR 混音教程都让你在音频工作站里搭的结构——在这里它是声景字段里的三个分句,一次生成出来。

    触发音质感层底噪层
  3. 陶碗里的 ASMR 茶筅,底下没有音乐

    刻意把音乐关掉

    在 `non_diegetic_music` 里写 `N/A`。留空不等于同一条指令——模型照样会给场景配乐,而触发音底下压着任何有节奏的东西,都会抵消你想要的效果。这是最常见的一个失败。

    non_diegetic_music: N/A
  4. 慢动作爆开的 ASMR 爆米花,每一响都是独立事件

    生成 8 秒,然后循环

    ASMR 靠的是完播率高的短循环,而192 帧——正好 8.000 秒——是模型能产出的唯一一个整秒,也就是唯一一个能无缝循环的时长。要别的长度,你就得回剪辑软件里裁掉一个零头。

    192 帧8.000s无缝循环

这四步里没有一步发生在生成之后。这个品类其余产品要在音频工作站里做的分层与对时,在这里被一个按正确顺序写好的字段取代了。

声景

决定你的 ASMR 视频有没有酥麻感的五项检查

每一项都是 ASMR 提示词里的一个分句,也都是这个品类反复被讨论的一种失败。花一次生成之前先过一遍。

  1. 01空隙底下有底噪

    触发音之间那种纯数字的寂静,是最容易破坏沉浸感的破绽,因为真实录音永远有本底噪声。写明一层很轻的环境音,让它垫在所有声音之下。

    两层之下的环境底噪

  2. 02音乐字段写着 N/A

    留空不是一条指令。触发音底下压着任何有节奏的东西都会抵消它——这个品类自己的教程也说,宁可完全不要音乐,也别小声混进去。

    non_diegetic_music: N/A

  3. 03有两层触发音,而不是一层

    单一声音循环,三十秒内就会听出人工感。把主角放在最前,再在它下面放一个相关的声音——刀被放下的声音、指尖重新换位置的声音。

    主层 + 次层

  4. 04声音和画面上的材质对得上

    一种材质的画面配上另一种材质的声音特征,沉浸感瞬间就没了。在这里两者出自同一次生成,所以唯一会做错的方式,是材质写得太含糊。

    写清楚是什么材质

  5. 05没有人说话

    ASMR 观众要的是纯触发音。别默认它不会加人声,直接写上*不要说话、不要旁白、不要人声*——画面里有人的时候,模型很乐意给他配上一句。

    不要说话,不要旁白

五项里有四项在说声音,第五项在说让画面跟声音对上。这个比例本身就是这个品类的定义。

一个意外的契合

让这个模型不适合做恐怖片的那一点,恰好让它适合做 ASMR

我们为了另一件事测过七条官方 H3 片子——2,340 个半秒窗口——其中六条在任何时刻都没有真正降到本底噪声。我们的恐怖视频页 上,这正是整页要解决的问题,因为恐惧感活在空隙里。而对 ASMR 来说,这是必需品。

  • 实测

    它不会给你数字寂静

    破坏 ASMR 沉浸感的破绽,是一段什么都没有的空隙。这个模型的本能是把声音铺满,所以这个品类最费力气去避免的失败,在这里反而要费力气才做得出来。

  • 结构性

    提示词里每一层都有自己的位置

    主触发音、次层质感、环境底噪——每份混音教程都在讲的三层结构,在这里写进同一个字段里一起生成,而不是事后在三条音轨上拼起来。

  • 结构性

    同步不是一个步骤

    瞬态音会落在事件发生的那一帧上,因为两者本来就出自同一次生成。不用挪,换个时长重新生成也不会有东西跑偏。

  • 诚实的边界

    耳语类是它的弱项

    材质类触发音才是它站得住的地方。口腔音那种亲密感和贴耳耳语,在生成音频里普遍都是最弱的一环,这里也一样——如果你要做的是有人说话的内容,请从 对口型 开始。

动手之前先看代价

十五秒是硬上限,所以长篇 ASMR 不是在这里生成出来的——你生成的是那个循环,然后让它重复。这适合短视频,因为这个形式本来就活在那里;这不适合三十分钟的助眠视频。如果你要做的是后者,这就是错的工具,早知道比晚知道便宜。

触发音家族

四类经得起十五秒的 ASMR 触发音

每一类 ASMR 触发音都会按原本的时长和画幅,从素材库里载入一条提示词。四类都是材质触发音,这也是这个模型最强的那一档。

  • AI ASMR 触发音:竖构图微距下被掰开的可颂,酥皮碎屑往下落
    9:16 · 15s

    脆裂与撕开

    先是壳让开,然后是更软的内里。两层声音长在同一个动作里,所以这是最容易上手的起点。

  • ASMR 视频:方画幅里茶筅在抹茶粉中划动
    1:1 · 15s

    陶釉上的干涩摩擦

    粉末、竹子和陶。几乎没有动作,整条片子全靠一种你从音效库里很难干净找到的质感撑着。

  • AI ASMR 触发音:慢动作下爆开的爆米花,每一粒都是独立的一响
    9:16 · 8s

    一响一响分开的爆裂

    彼此之间留着真正空隙的独立事件——这是环境底噪最要紧的情形,因为空隙本身就是结构。

  • AI ASMR 视频:微距近景下的香水瓶,玻璃碰玻璃
    9:16 · 15s

    玻璃、金属、喷头

    慢慢处理的硬表面。这一档最接近传统的敲击类 ASMR,也是最经得起长片的一档。

注意这四类里都缺了什么:一张脸和一个人声。材质触发音是生成式 ASMR 更聪明的起手切口,而且它们也正是算法在完播率上会奖励的那一类。

跑一条多少钱

一个八秒的循环是 69 积分,而循环正是你想要的

一条片子固定 5 积分用于读你的提示词,再加 768P 每秒 8 积分。ASMR 没有理由离开 768P——ASMR 是戴着耳机在手机上看的,多出来的分辨率看不见,声音才是全部。生成八秒,让它循环,把省下来的钱花在试第二种材质上。

这是怎么计费的

计费单位
成片每秒
768P 每秒
8 积分
每条片子
5 积分,不分长短
768P 八秒循环
69 积分
生成失败
自动退回,不用填表
9:16 或 1:1
与 16:9 同价

完整定价 · 一条 2K 的 ASMR 片子要多少钱,以及什么时候不必上 2K

两种付法每月积分一样多

  • 免费不用绑卡

    不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。

    $0永久

    全程不需要信用卡

    免费开始

    只做机器人校验,不要邮箱

    1 条,不用账号

    Agnes Video V2.0 · 16:9 · 5 秒 · 无声
    登录仍然免费,Agnes 引擎每天 3 条,无声

    $9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K

    • MiniMax H3 原生 2K仅付费
    • 声音与画面一起生成仅付费
    • 一条,不用账号
    • 同时跑 1 个任务
    • 失败的片子不花钱
    • 生成内容私有
    • 任意积分包都能解锁 MiniMax H3 的全部模式

    免费档是另一个引擎。看套餐

    速度与排队

    队列
    免费通道
    同时任务数
    1
    批量
    1
    历史保留
    24 小时 · 登录后 7 天
    支持
    社区
  • Lite省 30%

    解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。

    $16.9/mo$24.9

    按年扣 $202.8 · 一年省 $96

    7 天退款 · 随时取消

    每月 750 积分 · 约 20 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 13 条

    月付年付,每月积分一样多

    • MiniMax H3 原生 2K:音画同生
    • 对白、音效与配乐在同一个文件里
    • 最长 15 秒15s
    • 每月约 20 条 4 秒 768P 文生视频
    • 失败的片子不花钱
    • 积分未使用可 7 天退款
    • 同时跑 1 个任务
    • 同一条提示词可批量出 2 个版本

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    标准
    同时任务数
    1
    批量
    2
    历史保留
    7 天
    支持
    邮件 · 48 小时
  • 多数人推荐
    Pro省 30%

    比 Lite 多 $32。每月约 47 条,同样的 MiniMax H3,队列更快。

    $39.9/mo$56.9

    按年扣 $478.8 · 一年省 $204

    7 天退款 · 随时取消

    每月 1,775 积分 · 约 47 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 31 条

    月付年付,每月积分一样多

    • 包含 Lite 的全部
    • 每月约 47 条 4 秒 768P 文生视频
    • 同时跑 3 个任务
    • 视频反推提示词
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 积分未使用可 7 天退款

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    快速
    同时任务数
    3
    批量
    4
    历史保留
    7 天
    支持
    邮件 · 12 小时
  • Studio省 30%

    一整个月的产量,排队最优先,还有 4 小时内回你的真人。

    $99.9/mo$142.9

    按年扣 $1,198.8 · 一年省 $516

    7 天退款 · 随时取消

    每月 4,425 积分 · 约 119 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 77 条

    月付年付,每月积分一样多

    • 包含 Pro 的全部
    • 每月约 119 条 4 秒 768P 文生视频
    • 同时跑 8 个任务
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 优先支持,4 小时内响应
    • 我们能给到的最低积分消耗
    • 积分未使用可 7 天退款

    仅限个人与评估用途:商用权利来自 MiniMax

    速度与排队

    队列
    优先,排在最前面
    同时任务数
    8
    批量
    4
    历史保留
    7 天
    支持
    优先 · 4 小时

发布之前

发布一条 AI ASMR 视频之前该检查什么

AI ASMR 的内容问题比多数品类都少,但多了一个披露问题。

  • 披露说明它是生成的。ASMR 观众对真实性异常敏感,平台也越来越多地对合成音频做检测——一开始就标注清楚的片子,不会被当成对一段真实录音的主张。
  • 人声不要克隆创作者的耳语。声音是可识别身份的,ASMR 的声音尤其如此——观众跟的就是那个声音。
  • 手和脸生成的手没问题。真实、可识别的人需要本人同意,这一点和本站其他地方一样。
  • 权利所有套餐(包括付费套餐)的产出都仅供个人使用与评估。本站无法就模型产出授予商用权利。

完整条款:负责任使用

大家真正会问的问题

AI ASMR 视频生成常见问题

问得最多的八个 AI ASMR 问题,连同背后的数字一起回答。

这个 AI ASMR 视频生成工具免费吗?

一部分免费,而且这部分是真的。不注册也能在免费引擎上跑一条 ASMR 片子——5 秒、16:9、无声,对这个品类来说等于只让你看到画面、看不到重点。注册免费账号会再加三条带声音的真实 MiniMax H3 片子,注册时一条、第 2 天签到一条、第 7 天一条,而且都不过期。之后一个 8 秒的 768P 循环是 69 积分。两种方式都不用银行卡,任何档位都没有水印。

之后还要自己去加触发音吗?

不用,而这正是做 ASMR 该选这个模型、而不是选一个无声模型的理由。音频与画面在同一次生成里以 32 kHz 立体声产出,所以瞬态音会落在事件发生的那一帧上。没有东西要找、要授权,也没有东西要挪。

我做的 AI ASMR 为什么听起来很假?

通常是三件事之一,而三件都是音频问题。空隙底下没有环境底噪,所以触发音之间的安静是数字化的死寂——真实录音从不是这样。或者只有一层触发音在循环,没有主层和次层之分。又或者音乐字段留空了,模型于是给场景配了乐,你的触发音底下压着某种有节奏的东西。

怎么让它别加音乐?

在 `non_diegetic_music` 里写 `N/A`——这是 ASMR 最常见的一个失败。留空不是同一条指令——模型会把空字段理解成*由你决定*,而不是*不要音乐*。如果画面里有人,再在声景里加上*不要说话、不要旁白、不要人声*。

一条 AI ASMR 片子该做多长?

一条 ASMR 片子应该跑八秒,然后循环。模型按 24 fps 生成 17n+5 帧,所以大多数时长都会落在一个零头上——192 帧、正好 8.000 秒,是这个区间里唯一的整秒,也就是唯一一个循环起来没有接缝的长度。硬上限是十五秒,所以长篇助眠内容不是这个工具的用途。

它能做耳语或口腔音 ASMR 吗?

比材质类 ASMR 差,这一点值得直说。材质触发音——玻璃、织物、食物、纸、水——是生成音频站得住的地方。贴耳耳语和口腔音在生成音频里普遍是最弱的一档,不只是在这里。如果你的形式是有人说话,请从 对口型 开始。

ASMR 要用 2K 生成吗?

很少有理由这么做。ASMR 是戴着耳机在手机上看的,画面通常是某一种材质的微距镜头,而 2K 要贵 1.625 倍,换来的细节这批观众根本不看。用 768P 生成,把省下来的花在第二种材质上。

能做竖屏吗?

能,而且不加价——这一点很要紧,因为多数 ASMR 都是竖屏。9:16、1:1、16:9 和 21:9 价格相同,因为计费按成片秒数走,不看画面的形状。本页四个示例里有三个是竖屏或方屏,原因正在于此。

写出材质,声音会跟着来。

八秒,三层 ASMR 声音,一次生成。不注册也能在免费引擎上跑一条。

免费生成 · 排队

MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新