AI ASMR 觸發音影片生成器

ASMR 本質上是一個配了畫面的音訊類型,而毀掉它的永遠是同步——脆響晚三分之一秒,觀眾立刻覺得假,而且是先感覺到、後說得出。在這裡聲音和畫面在同一次生成裡產出,所以殼真正裂開的那一刻才有那一聲脆響。32 kHz 立體聲,4 到 15 秒的 ASMR,不用再去翻音效庫。

把鏡頭寫出來

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • 文字轉影片一定要指定比例——這裡沒有 adaptive 這個選項
  • 長度會照 24 影格每秒下的 17n+5 影格對齊,所以 192 個影格(8.000 秒)是唯一的整秒
  • 寫上 `non_diegetic_music: N/A`——觸發音底下壓著任何有節奏的東西都會毀掉效果
  • 寫材質,不要寫聲音。「脆響」是模糊的,「瓜皮被切開時那一聲濕脆」不是

不用綁卡:這一頁上每一個範例都能聽,完整提示詞也一併給你;然後免費註冊,你的第一支就跑在 MiniMax H3 本身上——4 秒 · 768P,觸發音和畫面在同一次生成裡算出來。而且永遠不過期。

從素材庫裡挑的五支,挑的標準是觸發音而不是畫面。請戴耳機。你聽到的每一聲,都是跟著影格一起算出來的。

AI ASMR 影片:微距近景下的義式濃縮注水,油脂層在杯面上散開6 秒 · 16:9 · 768P

注水與壓粉

AI ASMR 為什麼常翻車

AI ASMR 失敗的原因:它先是一個同步問題,其次才是一個畫面問題

常見的 AI ASMR 影片流程是這樣的:先生成一支無聲的片子,去音效庫找觸發音,疊兩三條音軌,再一點一點挪音訊峰值去對齊畫面峰值。第一步之後的每一步,都是因為模型只交給你沉默。而挪音訊那一步永遠差那麼一點——脆響晚三分之一秒,觀眾在說得出哪裡不對之前就已經感覺到了。

微距近景下的義式濃縮注水,聲音跟著影格一起生成

一段提示詞

畫面與觸發音,一起生成

在這裡,聲音和影格出自同一次前向傳播,所以它們是天生對齊,不是靠剪輯對齊。你導的是一場本來就有聲音的戲,而不是替一場沒有聲音的戲配樂。 這不代表音訊是自動的——它把工作挪進了提示詞裡,而這個類型需要的三層聲音在那裡各有各的位置。下一節就把那個欄位拆開講。

畫面與聲音同一次產出
1

畫面與聲音同一次產出

立體聲,不是單聲道上混
32 kHz

立體聲,不是單聲道上混

需要授權的音效庫
0

需要授權的音效庫

最短長度,多數站從 5 秒起
4 秒

最短長度,多數站從 5 秒起

  • 不用再去音效庫裡搜
  • 不用在剪輯軟體裡手動對峰值
  • 不用為了讓觸發音出得來而壓低配樂
  • 沒有要花錢去掉的浮水印

提示詞生成影片

一段提示詞,一次生成,而聲音是跟著畫面一起來的

打開這一支之前先戴上耳機——用畫面去評判一支 AI ASMR 影片,等於在評判它的另外一半。注水聲、油脂層破開的聲音、杯子落在托碟上的聲音,都不是找來的、擺上去的、對上去的——它們和影格出自同一次生成,所以才會落在該落的那一個影格上。卡片會照它原本的長度和比例,把完整提示詞交給你,換個材質就能再跑一次。

更多 ASMR 提示詞 ↗
AI ASMR 影片:微距近景下的義式濃縮注水,油脂層在杯面上散開16:9 · 6s · 768P

完整的提示詞,不是摘要

16:9, 6 seconds, 768P. Extreme close-up of espresso pouring into a warm cup under a single soft light, crema breaking across the surface. Slow, steady, no hands in frame.

6 秒 · 16:9

六秒,而聲音落在該落的影格上,因為它從來就不是一個單獨的檔案

這些都不是為了這一頁拍的——它們是素材庫裡觸發音最強的幾支。我們寧可給你看五支真的,也不給你看五支擺出來的。

能做什麼

做一支 AI ASMR 影片的三條路

三條路跑的是同一個模型、同一個費率。變的只是聲音設計裡有多少是你自己寫的——而且三條都不以打開音訊軟體收尾。

  • 用簡單的文字提示詞生成 AI ASMR 影片

    描述 ASMR 的材質,以及它在做什麼。觸發音、次層質感和環境底噪,是同一個欄位裡的三個子句。

    4–15 秒,32 kHz 立體聲
  • 用 AI 改進你的 ASMR 提示詞

    把一個粗略的 ASMR 想法貼進去,拿回三欄位結構:聲景被拆成分層,音樂欄位被填上而不是留空。

    替你把分層寫出來
  • 從一支參考片到成品的完整 AI 流程

    丟進一支你喜歡的 ASMR 片子,拿回能產出它的提示詞——包括它的聲音是怎麼搭起來的。然後換一種材質,跑起來。

    參考片 → 提示詞 → 成品

三條路,同一個費率——768P 一秒 8 點數,而 ASMR 沒有理由離開 768P。

完整流程

四個步驟做一支 AI ASMR 影片

做 ASMR 的順序,和一般影片的建議正好相反。先寫聲音,讓畫面跟著聲音走,因為畫面只要說得過去,聲音必須對。

  1. 直式微距下被剝開的可頌

    先挑材質,不是先挑氛圍

    Frosted glass, plush fabric, an acrylic sheet, bubble wrap, the teeth of a wooden comb. 材質驅動的觸發音是這個模型最強的地方,也是這個類型流量最大的地方。你寫出材質,模型推得出聲音;你只寫聲音,它就得去猜材質。

    材質優先不需要出鏡的臉
  2. 寫進了三層聲音的 ASMR 聲景欄位

    把三層聲音寫進同一個欄位

    主觸發音在最前,次層質感壓在它下面,環境底噪墊在兩者之下。那就是每一份 ASMR 混音教學都要你在數位音訊工作站裡搭出來的結構——在這裡它是聲景欄位裡的三個子句,而且一起算出來。

    觸發音質感層底噪層
  3. 陶碗裡的 ASMR 茶筅,底下沒有音樂

    刻意把音樂關掉

    在 `non_diegetic_music` 裡寫 `N/A`。留空不是同一條指令——模型照樣會替場景配樂,而觸發音底下壓著任何有節奏的東西,都會抵消你想要的效果。這是最常見的一個失敗。

    non_diegetic_music: N/A
  4. 慢動作爆開的 ASMR 爆米花,每一響都是自己的一個事件

    生成 8 秒,然後循環

    ASMR 靠的是完播率高的短循環,而192 個影格——正好 8.000 秒——是模型算得出來的唯一一個整秒,也就是唯一一個接得起來、沒有縫的長度。要別的長度,你就得回剪輯軟體裡裁掉一個零頭。

    192 個影格8.000s無縫循環

這四個步驟裡沒有一步發生在算完之後。這個類型其餘產品要在數位音訊工作站裡做的分層和對時,在這裡被一個照正確順序寫好的欄位取代了。

聲景

決定你的 ASMR 影片有沒有酥麻感的五項檢查

每一項都是你 ASMR 提示詞裡的一個子句,也都是這個類型反覆被討論的一種失敗。花掉一次算圖之前先過一遍。

  1. 01空隙底下有底噪

    觸發音之間那種純數位的寂靜,是最容易破壞沉浸感的破綻,因為真實錄音永遠有本底噪音。寫明一層很輕的環境音,讓它墊在所有聲音之下。

    兩層之下的環境底噪

  2. 02音樂欄位寫著 N/A

    留空不是一條指令。觸發音底下壓著任何有節奏的東西都會抵消它——這個類型自己的教學也說,寧可完全不要音樂,也不要小聲混進去。

    non_diegetic_music: N/A

  3. 03有兩層觸發音,不是一層

    單一聲音循環,三十秒內就會被聽出人工感。把主角放在最前,再在它下面放一個相關的聲音——刀被放下的聲音、指尖重新換位置的聲音。

    主層 + 次層

  4. 04聲音和畫面上的材質對得上

    一種材質的畫面配上另一種材質的聲音特徵,沉浸感瞬間就沒了。在這裡兩者出自同一次生成,所以唯一會做錯的方式,是材質寫得太含糊。

    把材質寫清楚

  5. 05沒有人說話

    ASMR 觀眾要的是純觸發音。不要假設它不會加人聲,直接寫上 no speech, no narration, no vocals——畫面裡有人的時候,模型很樂意替他配上一句。

    不要說話,不要旁白

那五項裡有四項在講聲音,第五項在講讓畫面跟聲音對上。那個比例本身就是這個類型的定義。

意外的契合

讓這個模型不適合做恐怖片的那一點,正好讓它適合做 ASMR

我們為了另一件事量過七支官方 H3 片子——2,340 個半秒視窗——其中六支在任何時刻都沒有真正降到本底噪音。我們的恐怖影片頁 上,那正是整頁要解決的問題,因為恐懼活在空隙裡。而對 ASMR 來說,那是必需品。

  • 實測

    它不會給你數位寂靜

    破壞 ASMR 沉浸感的破綻,是一段什麼都沒有的空隙。這個模型的本能是把聲音鋪滿,所以這個類型最費力氣去避免的那種失敗,在這裡反而要費力氣才做得出來。

  • 結構性

    提示詞裡每一層都有自己的位置

    主觸發音、次層質感、環境底噪——每一份混音教學都在講的三層結構,在這裡寫進同一個欄位裡一起算出來,而不是事後在三條音軌上拼起來。

  • 結構性

    同步不是一個步驟

    瞬態音會落在事件發生的那一個影格上,因為兩者本來就出自同一次生成。不用挪,換個長度重新算也不會有東西跑掉。

  • 誠實的邊界

    耳語類是它的弱項

    材質類觸發音才是它站得住的地方。口腔音那種親密感和貼耳耳語,在生成音訊裡普遍都是最弱的一環,這裡也一樣——如果你要做的是有人說話的內容,請從 對嘴 開始。

動手之前先看代價

十五秒是硬上限,所以長篇 ASMR 不是在這裡算出來的——你算的是那個循環,然後讓它重複。這適合短影音,因為這個形式本來就活在那裡;這不適合三十分鐘的助眠影片。如果你要做的是後者,這就是錯的工具,而早知道比晚知道便宜。

觸發音家族

四類撐得過十五秒的 ASMR 觸發音

每一類 ASMR 觸發音都會照它原本的長度和比例,從素材庫裡載入一段提示詞。四類都是材質觸發音,那也是這個模型最強的那一檔。

  • AI ASMR 觸發音:直式微距下被剝開的可頌,酥皮碎屑往下落
    9:16 · 15s

    脆裂與撕開

    先是殼讓開,然後是更軟的內裡。兩層聲音長在同一個動作裡,所以這是最容易上手的起點。

  • ASMR 影片:方形畫面裡竹製茶筅在抹茶粉中劃動
    1:1 · 15s

    陶釉上的乾澀摩擦

    粉末、竹子和陶。幾乎沒有動作,整支片子全靠一種你從音效庫裡很難乾淨找到的質感撐著。

  • AI ASMR 觸發音:慢動作下爆開的爆米花,每一粒都是自己的一響
    9:16 · 8 秒

    一響一響分開的爆裂

    彼此之間留著真正空隙的獨立事件——這是環境底噪最要緊的情況,因為那些空隙本身就是結構。

  • AI ASMR 影片:微距近景下的香水瓶,玻璃碰玻璃
    9:16 · 15s

    玻璃、金屬、噴頭

    慢慢處理的硬表面。這一檔最接近傳統的敲擊類 ASMR,也是最撐得起長一點片子的一檔。

注意這四類裡都缺了什麼:一張臉和一個人聲。材質觸發音是生成式 ASMR 更聰明的起手切口,而且它們也正是演算法在完播率上會獎勵的那一類。

跑一支多少錢

一個八秒的循環是 69 點數,而循環正是你要的

一支片子固定 5 點數,付的是讀你提示詞那一趟,再加上 768P 每秒 8 點數。ASMR 沒有理由離開 768P——ASMR 是戴著耳機在手機上看的,多出來的解析度看不見,聲音才是全部。算八秒,讓它循環,把省下來的錢花在試第二種材質上。

這是怎麼計費的

計費依據
輸出秒數
768P 每秒
8 點數
每支片子
5 點數,不分長短
768P 八秒循環
69 點數
生成失敗
自動退回,不用填表
9:16 或 1:1
和 16:9 同價

完整價格 · 一支 2K 的 ASMR 要多少錢,以及什麼時候不必上 2K

兩種繳法,每月點數一樣

  • 免費免綁卡

    一支真的 MiniMax H3 影片,帶聲音。4 秒 · 768P 之外的一切都靠點數。

    $0永遠

    從頭到尾都不用信用卡

    免費開始

    只驗機器人——不要 email

    在 MiniMax H3 上跑 1 支

    MiniMax H3 · 4 秒 · 768P · 16:9 · 帶聲音
    7 天後回來看看——37 點數,再一支

    $9.9 起的任何一個點數包,都能解鎖 MiniMax H3 AI 影片生成器——每一種輸入方式、768P 和 2K

    • 原生 2K 的 MiniMax H3只有付費
    • 聲音和畫面一起生成只有付費
    • 一支,不用綁卡
    • 一次跑 1 支
    • 跑壞的不收錢
    • 生成內容不公開
    • 任何一個點數包都能解鎖 MiniMax H3 AI 影片生成器的每一種輸入方式

    免費層跑的是另一個引擎。看方案

    速度與排隊

    排隊
    免費通道
    同時任務數
    1
    批次
    1
    紀錄保留
    24 小時 · 登入後 7 天
    支援
    社群
  • Lite省 30%

    用原生 2K 解鎖 MiniMax H3 AI 影片生成器。最小的付費方案——大多數人選的是 Pro。

    $16.9/mo$24.9

    年繳 $202.8 · 一年省 $96

    7 天退款 · 隨時取消

    750 點數 / 月 · 約 20 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 13 支

    月繳年繳,每月點數一樣

    • 原生 2K 的 MiniMax H3——還有原生音訊
    • 對白、音效與音樂在同一個檔案裡
    • 最長 15 秒15 秒
    • 每月約 20 支 4 秒 768P 的文字轉影片
    • 跑壞的不收錢
    • 點數沒動過,7 天內可退
    • 一次跑 1 個任務
    • 同一段提示詞批次跑 2 個版本

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    一般
    同時任務數
    1
    批次
    2
    紀錄保留
    7 天
    支援
    Email · 48 小時
  • 多數人推薦
    Pro省 30%

    比 Lite 多 $32。每月約 47 支影片,同一個 MiniMax H3 AI 影片生成器,排隊更快。

    $39.9/mo$56.9

    年繳 $478.8 · 一年省 $204

    7 天退款 · 隨時取消

    1,775 點數 / 月 · 約 47 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 31 支

    月繳年繳,每月點數一樣

    • Lite 的全部
    • 每月約 47 支 4 秒 768P 的文字轉影片
    • 同時 3 個任務
    • 影片轉提示詞
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    快速
    同時任務數
    3
    批次
    4
    紀錄保留
    7 天
    支援
    Email · 12 小時
  • Studio省 30%

    整整一個月的量、排隊排在最前面,還有一個 4 小時內回覆的真人。

    $99.9/mo$142.9

    年繳 $1,198.8 · 一年省 $516

    7 天退款 · 隨時取消

    4,425 點數 / 月 · 約 119 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 77 支

    月繳年繳,每月點數一樣

    • Pro 的全部
    • 每月約 119 支 4 秒 768P 的文字轉影片
    • 同時 8 個任務
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 4 小時內的優先支援
    • 我們給得出的最低點數消耗
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    優先——排在最前面
    同時任務數
    8
    批次
    4
    紀錄保留
    7 天
    支援
    優先 · 4 小時

發布之前

發布一支 AI ASMR 影片之前該檢查什麼

AI ASMR 的內容問題比多數類型都少,但多了一個揭露問題。

  • 標示說明它是生成的。ASMR 觀眾對真實性異常敏感,而平台也愈來愈常對合成音訊做偵測——一開始就標示清楚的片子,不會被當成對一段真實錄音的主張。
  • 嗓音不要複製一位創作者的耳語。聲音是能辨識身分的,而 ASMR 的聲音尤其如此——觀眾追的就是那個聲音。
  • 手和臉生成出來的手沒問題。真實、認得出來的人需要本人同意,這一點和本站其他地方一樣。
  • 權利每一個方案都含商業使用權利,免費那一個也算——這裡的影片是透過 MiniMax 的 API 生成的,而 MiniMax 對你生成的產出不主張任何權利。

完整政策:負責任使用

大家真的會問的問題

AI ASMR 影片生成器常見問題

問得最多的八個 AI ASMR 問題,連背後的數字一起答。

這個 AI ASMR 影片生成器免費嗎?

一部分免費,而且免費那一部分是真的——對這個類型來說,這比平常更要緊。免費帳號可以拿到一支帶聲音的真 MiniMax H3 影片,4 秒、768P,而那正是這裡的重點:一支無聲的 ASMR 片子只讓你看到畫面,看不到重點。它永遠不過期。連續七天簽到拿 37 點數,剛好又是同樣尺寸的一支。之後,一個 8 秒的 768P 循環是 69 點數。兩種都不用綁卡,而且任何一層都沒有浮水印。

之後還要自己去加觸發音嗎?

不用,而這正是做 ASMR 該挑這個模型、而不是挑一個無聲模型的理由。音訊和畫面在同一次生成裡以 32 kHz 立體聲產出,所以瞬態音會落在事件發生的那一個影格上。沒有東西要找、要授權,也沒有東西要挪到位。

我做的 AI ASMR 為什麼聽起來很假?

通常是三件事之一,而三件都是音訊問題。空隙底下沒有環境底噪,所以觸發音之間的安靜是數位化的死寂——真實錄音從來不是這樣。或者只有一層觸發音在循環,沒有主層和次層之分。又或者音樂欄位留空了,模型於是替場景配了樂,而你的觸發音底下壓著某種有節奏的東西。

要怎麼讓它不要加音樂?

在 `non_diegetic_music` 裡寫 `N/A`——這是最常見的一個 ASMR 失敗。留空不是同一條指令——模型會把一個空欄位理解成 your choice,不是 no music。如果畫面裡有人,再在聲景裡加上 no speech, no narration, no vocals

一支 AI ASMR 片子該做多長?

一支 ASMR 片子應該跑八秒,然後循環。模型在 24 影格每秒下算 17n+5 個影格,所以多數長度都會落在一個零頭上——192 個影格、正好 8.000 秒,是這個區間裡唯一的整秒,也就是唯一一個循環起來沒有接縫的長度。硬上限是十五秒,所以長篇助眠內容不是這個工具的用途。

它可以做耳語或口腔音 ASMR 嗎?

比材質類 ASMR 差,而這一點值得直說。材質觸發音——玻璃、織物、食物、紙、水——才是生成音訊站得住的地方。貼耳耳語和口腔音在生成音訊裡普遍是最弱的一檔,不只是在這裡。如果你的形式是有人說話,請從 對嘴 開始。

ASMR 要用 2K 生成嗎?

很少有理由這麼做。ASMR 是戴著耳機在手機上看的,畫面通常是某一種材質的微距鏡頭,而 2K 貴 1.625 倍,換來的細節這批觀眾根本不看。用 768P 生成,把差價花在第二種材質上。

可以做直式嗎?

可以,而且不加價——這一點很要緊,因為多數 ASMR 都是直式的。9:16、1:1、16:9 和 21:9 價格相同,因為計費是按輸出秒數走、不看畫面的形狀。這一頁四個範例裡有三個是直式或方形,原因正在於此。

把材質寫出來。聲音會跟著來。

八秒、三層 ASMR 聲音、一次生成。免費註冊,第一支——連同它的觸發音——我們請你。

免費註冊 · 送 1 支 MiniMax H3

MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4