AI 對嘴影片生成器
丟一張照片進來,打上它該說的話,拿回一支會說話的影片——聲音跟著一起出來,所以不用先做音訊檔。四到十五秒,最高 2K,十一種語言。
真的 MiniMax H3 輸出 · 按「試這條對嘴」載入完整提示詞,不是摘要
8 秒 · 16:9 · 768P一張照片,一句話
一張靜態照片,
還有跟著它一起出來的 AI 對嘴
沒有任何東西被畫到你的照片上。這張照片變成一顆鏡頭的第一個影格,鏡頭裡那個人正在說話,而聲音在同一次生成裡做出來——所以你不用先做音訊檔。

你的照片
生成出來的——畫面和聲音一起
4 到 15 之間任何一個整秒,24 影格每秒,768P 或 2K,十一種我們從頭到尾跑過的語言。JPG、PNG、WEBP、HEIC 和 HEIF 都能直接進,這一點值得說,因為人的照片大多是手機拍的,而多數工具都會不聲不響地要你先轉檔。手機隨手拍常常比精修的形象照動得更好——修圖會把動起來所需要的那層質感抹掉。能選的話,讓牙齒露出來:閉著的嘴不帶任何關於唇後是什麼的資訊,模型只好自己編一個口腔,而編出來的口腔正是讓人一眼覺得不對的地方。
- 你的照片就是第一個影格
- 001
- 任何一個整秒
- 4–15 秒
- 完整跑過的語言
- 11
- 聲音來自同一次生成
- 立體聲
你的照片就是第一個影格
任何一個整秒
完整跑過的語言
聲音來自同一次生成
- 不用先做音訊檔
- 不用逐個影格對時間軸
- 不用另外跑一遍對嘴
AI 對嘴做對了是什麼樣
你看到的就是跑出來的樣子——沒有放大、沒有調色、沒有第二次生成。旁邊印的是產出它的完整提示詞,不是摘要。按「試這條對嘴」,它就直接落進上面那個框,長度和比例都照它當時的樣子,你改一句就能看出什麼跟著變。把聲音打開:你聽到的和那張嘴來自同一次生成。
更多對嘴提示詞 ↗
16:9 · 6s完整的提示詞,不是摘要
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.
上面那張照片,和它變成的那六秒
一次生成,一段提示詞,就是模型回傳的原樣
對嘴不一定非得是
一張真人的照片
16:9 · 15s一個人照片一張參考照片撐過了每一顆鏡頭,包括一個嘴部特寫——對嘴能不能在原尺寸下站得住,就看這裡。
16:9 · 15s一個畫面裡兩個人165 個字元兩個人交替開口,而整段提示詞只有一句話。說話者標記是在你需要指明誰先開口時才用的;這一次沒有用。
16:9 · 15s畫出來的角色插畫手繪感 2D,嘴和畫面其餘部分出自同一支筆。整顆鏡頭裡沒有任何寫實的東西。
16:9 · 15s動物角色動物一隻貓和一隻老鼠,各說一句。這些臉不是人臉,嘴還是落在音節上。
這四支是別人跑的,不是我們跑的——所以它們角上帶著 Hailuo 的標,而這一頁其他片子沒有。那個標就是憑據:每一支都由 @SimplyAnnisa、@heydin_ai 和 @ManuAGI01 連同提示詞一起公開,四支的每一個字都能在那些連結裡讀到。
這裡沒有的,是我們自己沒跑過的:真的狗或貓的照片,還有油畫肖像。兩樣都沒有被擋,也都值得試——和這一頁對十一種以外的語言持的是同一個立場。沒看著它跑回來的東西,我們不寫。
怎麼幫一張照片做對嘴,三個步驟
決定結果的是第一步,而把它做對大概要四秒鐘。前兩張卡是這一頁最上面那個生成器做到一半的樣子——它接住的檔案、打進去的那行台詞。第三張是回來的東西。

放一張臉進去
一張照片就行,2 到 15 秒的片段也行。一張臉,看著鏡頭,嘴上不要有東西擋著。iPhone 的 HEIC 直接進得來,而且那個框會把檔案讀回來給你看——尺寸、比例、大小——在你花掉任何東西之前。
一張臉JPG · PNG · WEBP · HEIC![這一頁那個提示詞框,裡面打好了一行台詞——(S1) speaks warmly, [English] I have used this every morning for a month——計數器顯示 73 / 7000](/_next/image?url=%2Fmedia%2Ftools%2Fls-ui-prompt.webp&w=1280&q=70)
寫他們要說的話
把句子和一個語言標記打進去,聲音就跟著一起到——不用先做音訊檔。框裡那行對嘴台詞是給你的 7,000 個字元裡的七十三個;其餘全都是用來描述鏡頭的。
7,000 個字元裡的 73 個不用找配音
音軌 · 32 kHzLIP-SYNC.MP4播一遍,然後改一個字
片子到手的時候,聲音已經在檔案裡了。多數人留下的是第二支或第三支,不是第一支——每一次嘗試都存著,所以你是在改,不是從頭來過。
4–15s · 最高 2K聲音已經混進去了
前兩張卡是這一頁最上面那個框的截圖,不是畫出來的示意圖。你上傳的照片永遠不會被改動——回來的是一個新檔案。第三張卡上的片子是 MiniMax 自己的,連同提示詞發布在 H3 發表文:靜圖定了臉,一段人聲定了唱,一段影片定了運鏡。那一次走的是音訊路線;上面那個框兩條路都收。
大家拿 AI 對嘴 來做什麼
四個起手處。每一個都會把一支做好的片子背後的完整提示詞放進最上面那個生成器,長度和比例都照它當時的樣子。
16:9 · 8 秒一句話,直接對著鏡頭
整支片子就是一個人和一句話。六秒的話,控制在大約十二個詞以內——短長度配長句子,是第一次嘗試讓人失望的常見原因。
9:16 · 9s幫一個場景配一句對白
讓角色在你已經想好的那顆鏡頭裡說出這句話。除了台詞,也把人描述出來——衣服、頭髮、一個能認出來的特徵——臉就能在整支片子裡守住。
9:16 · 15s有人在講一件商品
人物靜圖加商品靜圖,台詞一顆鏡頭一顆鏡頭地寫。這一支跑滿十五秒,所以它也是讓你看到上限在哪的那一支。
16:9 · 15s用唱的,不是用說的
把語氣設成唱,或者上傳人聲讓它帶動嘴型。上傳的音軌會直接變成最後那條聲音,而不是拿來當參考,而且上傳不計費。片子的長度至少要和音軌一樣長。
從一段影片出發,而且原本的像素必須留下來?那是配音,剪貼式的工具做得比這一頁好——這裡的一切都是把鏡頭重建出來,不是在原片上改。
你可以查驗什麼、跑一次多少錢,以及換方案會改變什麼
先把話說在前面:這是一個付費工具。沒有聲音的對嘴不叫對嘴,所以這一頁跑的是 MiniMax H3,不是那個只出畫面的無聲引擎,也就沒有一次試跑可以交給你。不花錢能做的是查驗這些成果:上面每一支片子都不用帳號就能播、能下載,產出它的提示詞也都在。一次生成從 37 點數起——768P 四秒,模型做得出來的最短一檔。每一次嘗試都存著,真正算數的是第二次,因為幾乎沒有人會留第一支。往上換一個方案,買到的是每個月更多點數、更長的片子也能上 2K 而不用省著用,以及每一秒更低的成本。
兩種繳法,每月點數一樣
- 免費免綁卡
一支真的 MiniMax H3 影片,帶聲音。4 秒 · 768P 之外的一切都靠點數。
$0永遠從頭到尾都不用信用卡
免費開始只驗機器人——不要 email
在 MiniMax H3 上跑 1 支
MiniMax H3 · 4 秒 · 768P · 16:9 · 帶聲音
7 天後回來看看——37 點數,再一支$9.9 起的任何一個點數包,都能解鎖 MiniMax H3 AI 影片生成器——每一種輸入方式、768P 和 2K
- 原生 2K 的 MiniMax H3只有付費
- 聲音和畫面一起生成只有付費
- 一支,不用綁卡
- 一次跑 1 支
- 跑壞的不收錢
- 生成內容不公開
- 任何一個點數包都能解鎖 MiniMax H3 AI 影片生成器的每一種輸入方式
免費層跑的是另一個引擎。看方案
速度與排隊
- 排隊
- 免費通道
- 同時任務數
- 1
- 批次
- 1
- 紀錄保留
- 24 小時 · 登入後 7 天
- 支援
- 社群
- Lite省 30%
用原生 2K 解鎖 MiniMax H3 AI 影片生成器。最小的付費方案——大多數人選的是 Pro。
$16.9/mo$24.9年繳 $202.8 · 一年省 $96
7 天退款 · 隨時取消
750 點數 / 月 · 約 20 支影片
4 秒 · 768P · 文字轉影片
或 4 秒 2K 約 13 支
月繳年繳,每月點數一樣
- 原生 2K 的 MiniMax H3——還有原生音訊
- 對白、音效與音樂在同一個檔案裡
- 最長 15 秒15 秒
- 每月約 20 支 4 秒 768P 的文字轉影片
- 跑壞的不收錢
- 點數沒動過,7 天內可退
- 一次跑 1 個任務
- 同一段提示詞批次跑 2 個版本
包含商業使用——涵蓋範圍
速度與排隊
- 排隊
- 一般
- 同時任務數
- 1
- 批次
- 2
- 紀錄保留
- 7 天
- 支援
- Email · 48 小時
- 多數人推薦Pro省 30%
比 Lite 多 $32。每月約 47 支影片,同一個 MiniMax H3 AI 影片生成器,排隊更快。
$39.9/mo$56.9年繳 $478.8 · 一年省 $204
7 天退款 · 隨時取消
1,775 點數 / 月 · 約 47 支影片
4 秒 · 768P · 文字轉影片
或 4 秒 2K 約 31 支
月繳年繳,每月點數一樣
- Lite 的全部
- 每月約 47 支 4 秒 768P 的文字轉影片
- 同時 3 個任務3×
- 影片轉提示詞
- 同一段提示詞批次跑 4 個版本
- 紀錄保留 7 天
- 點數沒動過,7 天內可退
包含商業使用——涵蓋範圍
速度與排隊
- 排隊
- 快速
- 同時任務數
- 3
- 批次
- 4
- 紀錄保留
- 7 天
- 支援
- Email · 12 小時
- Studio省 30%
整整一個月的量、排隊排在最前面,還有一個 4 小時內回覆的真人。
$99.9/mo$142.9年繳 $1,198.8 · 一年省 $516
7 天退款 · 隨時取消
4,425 點數 / 月 · 約 119 支影片
4 秒 · 768P · 文字轉影片
或 4 秒 2K 約 77 支
月繳年繳,每月點數一樣
- Pro 的全部
- 每月約 119 支 4 秒 768P 的文字轉影片
- 同時 8 個任務8×
- 同一段提示詞批次跑 4 個版本
- 紀錄保留 7 天
- 4 小時內的優先支援
- 我們給得出的最低點數消耗
- 點數沒動過,7 天內可退
包含商業使用——涵蓋範圍
速度與排隊
- 排隊
- 優先——排在最前面
- 同時任務數
- 8
- 批次
- 4
- 紀錄保留
- 7 天
- 支援
- 優先 · 4 小時
為什麼這張嘴
在原解析度下站得住
其他每一種對嘴工具,都是在你的畫面裡找到嘴,然後把它換掉。這一個從來不去找——而這一個差別,就是那張嘴不像一塊補丁的全部原因。
一張和皮膚對不上的嘴
一塊解析度和周圍臉部不同的補丁,還有一條沿著下顎線、頭一轉就在爬的接縫。看過一次就再也擺脫不掉了——而這從來不是你那張照片的錯。
一個 96 像素的方塊,貼回去
通行的做法是找到嘴,在它周圍裁一個小方塊——常見是 96×96——在那個尺寸上生成新的嘴型,再貼回你的畫面上。方塊之外的一切,從來沒有進過模型。
看一個工具怎麼描述自己
把嘴型映射到你影片裡的那張臉上。把它們融合進原本的圖像。映射、融合——不管哪一個詞,都是有東西被蓋在一張已經存在的臉上,而下顎線就是它的邊界。
一個新的影格,連聲音一起,一次做完
MiniMax H3 從來不去找你的嘴,因為它根本不是在編輯你的畫面。沒有裁切、沒有貼上、沒有邊緣要追:嘴和臉頰是同一個解析度,因為整張畫面只有一個解析度。聲音也出自同一次生成,所以你不會拿到一段激動的配音配一張平淡的臉。
你原本的畫面不會留下來。你拿到的是照著它建出來的一支新片子,不是你那支片子換了一張嘴。如果你需要拿回自己的像素——比如一門四十分鐘的課程要配西班牙文——那麼剪貼式的那種工具會比這一頁更合用。
台詞決定的事,
照片決定不了
照片決定這件事能不能成。對嘴台詞決定你拿到什麼、它跑多長、以及它多少錢——而這三件其實是同一個決定。
長度是一份預算
輸出是 4 到 15 之間的整秒。按平常的語速,大概是十到四十個詞。先寫台詞,數一遍,再挑長度——反過來做,就會得到一段追著鐘跑卻追不上的表演。
4–15 秒,整秒
有一個標記是承重的
[Language] 選定嘴型所依據的音素集,所以它是那個會改變畫面的標記。(S1) 只有在畫面裡不只一個可能的說話者時才有用——面對一張臉,它不會改變任何你看得見的東西。
(S1) … [Chinese] …
字元上限不是給台詞用的
7,000 個字元涵蓋的是整段提示詞。一句台詞是幾十個字元;其餘全是鏡頭——誰、在哪裡、怎麼打光、怎麼取景。寫不下是描述的問題,從來不是對白的問題。
7,000 字元
秒數就是帳單
768P 每一個輸出秒 8 點數,2K 是 13 點。對嘴台詞定長度,長度定帳單,所以一支十五秒差不多是四秒那支的四倍。值得聽的台詞大多都短。
8 點數 / 秒 · 768P
這些都不是對模型的猜測——長度和字元上限都是公開的限制,每秒價格就是 價格 上那些。想讓人替你把鏡頭描述好?提示詞產生器 會把剩下的 6,900 個字元寫出來。
你可以用誰的臉做對嘴
你自己的、你拿到許可的,或者因為是你生成的、所以不屬於任何人的。
- 人臉讓一個真實的人看起來說了他沒說過的話,H3 授權條款是禁止的——公眾人物不行,陌生人的照片也不行。
- 嗓音上傳的音軌如果複製的是某一個特定的人的聲音,那它必須是你自己的、拿到授權的,或者合成的。
- 檢舉檢舉入口在每一頁、每一個結果上都有。一再出現的帳號會被關掉。
- 未成年人絕對不要上傳含有未成年人的照片或片子。
- 你的上傳不會拿去訓練任何東西。你隨時可以把它們刪掉,帳號也可以。
- 商業使用權利商業使用每一個方案都包含,免費的那個也算——影片是透過 MiniMax 的 API 生成的,而 MiniMax 對你生成的產出不主張任何權利。以上是概述,不構成法律意見。
AI 對嘴常見問題
跑第一句台詞之前該知道的事
這個 AI 對嘴影片生成器免費嗎?
怎麼少花一點錢試試 AI 對嘴?
做對嘴需要音訊檔嗎?
片子自帶聲音嗎?
我已經有一支影片,可以拿來做對嘴嗎?
一支對嘴片子最長可以多久?
對嘴支援哪些語言?
我以前用的那個工具,對嘴為什麼是糊的?
出來還會像我照片裡的那個人嗎?
對嘴該用什麼樣的照片?
如果我的音訊比片子長怎麼辦?
對嘴可以用唱的,不是用說的嗎?
可以出 2K 嗎?
我需要帳號嗎?
我的成品會帶浮水印嗎?
我按下「生成」之後會發生什麼?
這些片子可以商業使用嗎?
支援哪些照片格式和尺寸?
照片裡可以有不只一個人嗎?
對嘴台詞最長可以多長?
由 MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4
