AI 對嘴影片生成器

丟一張照片進來,打上它該說的話,拿回一支會說話的影片——聲音跟著一起出來,所以不用先做音訊檔。四到十五秒,最高 2K,十一種語言。

從一張照片

生成圖片

JPG · PNG · WEBP · HEIC · ≤30MB · 一張臉

0 / 7000

說話的人全程保持同一張臉、同樣的頭髮、衣服與顏色;只有鏡頭和描述過的動作在變。

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

這一頁上的每一支片子,不用帳號就能播、也能下載。跑你自己的台詞按輸出秒計費——37 點數買到 768P 四秒這個底價。

真的 MiniMax H3 輸出 · 按「試這條對嘴」載入完整提示詞,不是摘要

一位戴耳機的 Podcast 主持人在桌上的麥克風前笑著說出她那句台詞,MiniMax H3 對嘴8 秒 · 16:9 · 768P

一張照片,一句話

對嘴對你的照片做了什麼

一張靜態照片,還有跟著它一起出來的 AI 對嘴

沒有任何東西被畫到你的照片上。這張照片變成一顆鏡頭的第一個影格,鏡頭裡那個人正在說話,而聲音在同一次生成裡做出來——所以你不用先做音訊檔。

進去的那張照片:一位女子坐在街邊咖啡座,低頭看著一杯 espresso,沒有在說話

你的照片

生成出來的——畫面和聲音一起

4 到 15 之間任何一個整秒,24 影格每秒,768P 或 2K,十一種我們從頭到尾跑過的語言。JPG、PNG、WEBP、HEIC 和 HEIF 都能直接進,這一點值得說,因為人的照片大多是手機拍的,而多數工具都會不聲不響地要你先轉檔。手機隨手拍常常比精修的形象照動得更好——修圖會把動起來所需要的那層質感抹掉。能選的話,讓牙齒露出來:閉著的嘴不帶任何關於唇後是什麼的資訊,模型只好自己編一個口腔,而編出來的口腔正是讓人一眼覺得不對的地方。

你的照片就是第一個影格
001

你的照片就是第一個影格

任何一個整秒
4–15 秒

任何一個整秒

完整跑過的語言
11

完整跑過的語言

聲音來自同一次生成
立體聲

聲音來自同一次生成

  • 不用先做音訊檔
  • 不用逐個影格對時間軸
  • 不用另外跑一遍對嘴

做好的那一支對嘴

AI 對嘴做對了是什麼樣

你看到的就是跑出來的樣子——沒有放大、沒有調色、沒有第二次生成。旁邊印的是產出它的完整提示詞,不是摘要。按「試這條對嘴」,它就直接落進上面那個框,長度和比例都照它當時的樣子,你改一句就能看出什麼跟著變。把聲音打開:你聽到的和那張嘴來自同一次生成。

更多對嘴提示詞 ↗
上面那張照片裡的女子,現在正對著鏡頭,嘴張在半句話上,身後還是同一張桌子、同一條街16:9 · 6s

完整的提示詞,不是摘要

Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.

6 秒 · 16:9

上面那張照片,和它變成的那六秒

一次生成,一段提示詞,就是模型回傳的原樣

什麼能開口說話

對嘴不一定非得是一張真人的照片

  • 一位女子坐在打了燈的梳妝鏡前舉著唇油對著鏡頭說話,每一次剪接她的臉都對得上那張參考照片16:9 · 15s
    一個人照片一張參考照片撐過了每一顆鏡頭,包括一個嘴部特寫——對嘴能不能在原尺寸下站得住,就看這裡。
  • 一男一女在客廳裡爭吵,手持鏡頭,兩個人輪流說一句16:9 · 15s
    一個畫面裡兩個人165 個字元兩個人交替開口,而整段提示詞只有一句話。說話者標記是在你需要指明誰先開口時才用的;這一次沒有用。
  • 一個戴草帽的女孩在溫室裡和一朵戴花冠的小雨雲說話,兩者都是手繪感 2D16:9 · 15s
    畫出來的角色插畫手繪感 2D,嘴和畫面其餘部分出自同一支筆。整顆鏡頭裡沒有任何寫實的東西。
  • 一隻戴軟呢帽的黑貓和一隻穿波點洋裝的老鼠,在夕照下的公園長椅上交談16:9 · 15s
    動物角色動物一隻貓和一隻老鼠,各說一句。這些臉不是人臉,嘴還是落在音節上。

這四支是別人跑的,不是我們跑的——所以它們角上帶著 Hailuo 的標,而這一頁其他片子沒有。那個標就是憑據:每一支都由 @SimplyAnnisa@heydin_ai@ManuAGI01 連同提示詞一起公開,四支的每一個字都能在那些連結裡讀到。

這裡沒有的,是我們自己沒跑過的:真的狗或貓的照片,還有油畫肖像。兩樣都沒有被擋,也都值得試——和這一頁對十一種以外的語言持的是同一個立場。沒看著它跑回來的東西,我們不寫。

整個對嘴流程

怎麼幫一張照片做對嘴,三個步驟

決定結果的是第一步,而把它做對大概要四秒鐘。前兩張卡是這一頁最上面那個生成器做到一半的樣子——它接住的檔案、打進去的那行台詞。第三張是回來的東西。

  1. 這一頁那個生成器的上傳列,照片已經被接受:街邊咖啡座那位女子的縮圖、檔名 ref-espresso.webp,還有一個綠色勾勾寫著 1280×724 · 1.77:1 · 62 KB

    放一張臉進去

    一張照片就行,2 到 15 秒的片段也行。一張臉,看著鏡頭,嘴上不要有東西擋著。iPhone 的 HEIC 直接進得來,而且那個框會把檔案讀回來給你看——尺寸、比例、大小——在你花掉任何東西之前。

    一張臉JPG · PNG · WEBP · HEIC
  2. 這一頁那個提示詞框,裡面打好了一行台詞——(S1) speaks warmly, [English] I have used this every morning for a month——計數器顯示 73 / 7000

    寫他們要說的話

    把句子和一個語言標記打進去,聲音就跟著一起到——不用先做音訊檔。框裡那行對嘴台詞是給你的 7,000 個字元裡的七十三個;其餘全都是用來描述鏡頭的。

    7,000 個字元裡的 73 個不用找配音
  3. 做好的那一支對嘴,音訊已經在檔案裡面
    音軌 · 32 kHzLIP-SYNC.MP4

    播一遍,然後改一個字

    片子到手的時候,聲音已經在檔案裡了。多數人留下的是第二支或第三支,不是第一支——每一次嘗試都存著,所以你是在改,不是從頭來過。

    4–15s · 最高 2K聲音已經混進去了

前兩張卡是這一頁最上面那個框的截圖,不是畫出來的示意圖。你上傳的照片永遠不會被改動——回來的是一個新檔案。第三張卡上的片子是 MiniMax 自己的,連同提示詞發布在 H3 發表文:靜圖定了臉,一段人聲定了唱,一段影片定了運鏡。那一次走的是音訊路線;上面那個框兩條路都收。

對嘴使用場景

大家拿 AI 對嘴 來做什麼

四個起手處。每一個都會把一支做好的片子背後的完整提示詞放進最上面那個生成器,長度和比例都照它當時的樣子。

  • 一位 Podcast 主持人在桌上的麥克風前笑著說出一句台詞,MiniMax H3 對嘴
    16:9 · 8 秒

    一句話,直接對著鏡頭

    整支片子就是一個人和一句話。六秒的話,控制在大約十二個詞以內——短長度配長句子,是第一次嘗試讓人失望的常見原因。

  • 兩個角色在昏暗的城堡內景裡進行一段緊繃的交鋒,兩個人的身份整場都守住
    9:16 · 9s

    幫一個場景配一句對白

    讓角色在你已經想好的那顆鏡頭裡說出這句話。除了台詞,也把人描述出來——衣服、頭髮、一個能認出來的特徵——臉就能在整支片子裡守住。

  • 一位女子站在麵包店外對著鏡頭講她手上那個巨大的可頌,對嘴橫跨五顆鏡頭都撐住
    9:16 · 15s

    有人在講一件商品

    人物靜圖加商品靜圖,台詞一顆鏡頭一顆鏡頭地寫。這一支跑滿十五秒,所以它也是讓你看到上限在哪的那一支。

  • 一位女子在藍色攝影棚裡跟著一段饒舌對嘴,她的臉鎖在那張參考靜圖上
    16:9 · 15s

    用唱的,不是用說的

    把語氣設成唱,或者上傳人聲讓它帶動嘴型。上傳的音軌會直接變成最後那條聲音,而不是拿來當參考,而且上傳不計費。片子的長度至少要和音軌一樣長。

從一段影片出發,而且原本的像素必須留下來?那是配音,剪貼式的工具做得比這一頁好——這裡的一切都是把鏡頭重建出來,不是在原片上改。

語言

十一種對嘴語言,以及驅動它們的台詞格式

十一種我們從頭到尾跑過——每一種裡,嘴型都是照那門語言自己的發音塑出來的,不是照英文的近似音。把台詞用它本來的語言寫,表演就落得住;用英文寫再掛一個語言標記,就落不住。對嘴台詞怎麼寫 裡有格式。

對嘴實測過十一種

11

  • 阿拉伯文
  • 中文
  • 英文
  • 法文
  • 德文
  • 義大利文
  • 日文
  • 韓文
  • 葡萄牙文
  • 俄文
  • 西班牙文

有個對照:Google 自己給 Veo 3.1 寫的文件說,英文完全支援,其他語言未經評估。要在好幾支片子裡守住同一張臉或同一把嗓音?用 參考圖生影片

跑一條對嘴多少錢

你可以查驗什麼、跑一次多少錢,以及換方案會改變什麼

先把話說在前面:這是一個付費工具。沒有聲音的對嘴不叫對嘴,所以這一頁跑的是 MiniMax H3,不是那個只出畫面的無聲引擎,也就沒有一次試跑可以交給你。不花錢能做的是查驗這些成果:上面每一支片子都不用帳號就能播、能下載,產出它的提示詞也都在。一次生成從 37 點數起——768P 四秒,模型做得出來的最短一檔。每一次嘗試都存著,真正算數的是第二次,因為幾乎沒有人會留第一支。往上換一個方案,買到的是每個月更多點數、更長的片子也能上 2K 而不用省著用,以及每一秒更低的成本。

這是怎麼計費的

計費依據
輸出秒數
生成失敗
自動退回
你上傳的音訊
不計費
這一頁上的片子
能播 · 不用帳號

完整的對嘴價格

兩種繳法,每月點數一樣

  • 免費免綁卡

    一支真的 MiniMax H3 影片,帶聲音。4 秒 · 768P 之外的一切都靠點數。

    $0永遠

    從頭到尾都不用信用卡

    免費開始

    只驗機器人——不要 email

    在 MiniMax H3 上跑 1 支

    MiniMax H3 · 4 秒 · 768P · 16:9 · 帶聲音
    7 天後回來看看——37 點數,再一支

    $9.9 起的任何一個點數包,都能解鎖 MiniMax H3 AI 影片生成器——每一種輸入方式、768P 和 2K

    • 原生 2K 的 MiniMax H3只有付費
    • 聲音和畫面一起生成只有付費
    • 一支,不用綁卡
    • 一次跑 1 支
    • 跑壞的不收錢
    • 生成內容不公開
    • 任何一個點數包都能解鎖 MiniMax H3 AI 影片生成器的每一種輸入方式

    免費層跑的是另一個引擎。看方案

    速度與排隊

    排隊
    免費通道
    同時任務數
    1
    批次
    1
    紀錄保留
    24 小時 · 登入後 7 天
    支援
    社群
  • Lite省 30%

    用原生 2K 解鎖 MiniMax H3 AI 影片生成器。最小的付費方案——大多數人選的是 Pro。

    $16.9/mo$24.9

    年繳 $202.8 · 一年省 $96

    7 天退款 · 隨時取消

    750 點數 / 月 · 約 20 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 13 支

    月繳年繳,每月點數一樣

    • 原生 2K 的 MiniMax H3——還有原生音訊
    • 對白、音效與音樂在同一個檔案裡
    • 最長 15 秒15 秒
    • 每月約 20 支 4 秒 768P 的文字轉影片
    • 跑壞的不收錢
    • 點數沒動過,7 天內可退
    • 一次跑 1 個任務
    • 同一段提示詞批次跑 2 個版本

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    一般
    同時任務數
    1
    批次
    2
    紀錄保留
    7 天
    支援
    Email · 48 小時
  • 多數人推薦
    Pro省 30%

    比 Lite 多 $32。每月約 47 支影片,同一個 MiniMax H3 AI 影片生成器,排隊更快。

    $39.9/mo$56.9

    年繳 $478.8 · 一年省 $204

    7 天退款 · 隨時取消

    1,775 點數 / 月 · 約 47 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 31 支

    月繳年繳,每月點數一樣

    • Lite 的全部
    • 每月約 47 支 4 秒 768P 的文字轉影片
    • 同時 3 個任務
    • 影片轉提示詞
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    快速
    同時任務數
    3
    批次
    4
    紀錄保留
    7 天
    支援
    Email · 12 小時
  • Studio省 30%

    整整一個月的量、排隊排在最前面,還有一個 4 小時內回覆的真人。

    $99.9/mo$142.9

    年繳 $1,198.8 · 一年省 $516

    7 天退款 · 隨時取消

    4,425 點數 / 月 · 約 119 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 77 支

    月繳年繳,每月點數一樣

    • Pro 的全部
    • 每月約 119 支 4 秒 768P 的文字轉影片
    • 同時 8 個任務
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 4 小時內的優先支援
    • 我們給得出的最低點數消耗
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    優先——排在最前面
    同時任務數
    8
    批次
    4
    紀錄保留
    7 天
    支援
    優先 · 4 小時

這條對嘴怎麼做出來的

為什麼這張嘴在原解析度下站得住

其他每一種對嘴工具,都是在你的畫面裡找到嘴,然後把它換掉。這一個從來不去找——而這一個差別,就是那張嘴不像一塊補丁的全部原因。

  • 破綻

    一張和皮膚對不上的嘴

    一塊解析度和周圍臉部不同的補丁,還有一條沿著下顎線、頭一轉就在爬的接縫。看過一次就再也擺脫不掉了——而這從來不是你那張照片的錯。

  • 成因

    一個 96 像素的方塊,貼回去

    通行的做法是找到嘴,在它周圍裁一個小方塊——常見是 96×96——在那個尺寸上生成新的嘴型,再貼回你的畫面上。方塊之外的一切,從來沒有進過模型。

  • 怎麼提前認出來

    看一個工具怎麼描述自己

    把嘴型映射到你影片裡的那張臉上。把它們融合進原本的圖像。映射、融合——不管哪一個詞,都是有東西被蓋在一張已經存在的臉上,而下顎線就是它的邊界。

  • 這裡發生的事

    一個新的影格,連聲音一起,一次做完

    MiniMax H3 從來不去找你的嘴,因為它根本不是在編輯你的畫面。沒有裁切、沒有貼上、沒有邊緣要追:嘴和臉頰是同一個解析度,因為整張畫面只有一個解析度。聲音也出自同一次生成,所以你不會拿到一段激動的配音配一張平淡的臉。

上傳之前,先看這筆代價

你原本的畫面不會留下來。你拿到的是照著它建出來的一支新片子,不是你那支片子換了一張嘴。如果你需要拿回自己的像素——比如一門四十分鐘的課程要配西班牙文——那麼剪貼式的那種工具會比這一頁更合用。

對嘴台詞

台詞決定的事,照片決定不了

照片決定這件事能不能成。對嘴台詞決定你拿到什麼、它跑多長、以及它多少錢——而這三件其實是同一個決定。

  1. 01長度是一份預算

    輸出是 4 到 15 之間的整秒。按平常的語速,大概是十到四十個詞。先寫台詞,數一遍,再挑長度——反過來做,就會得到一段追著鐘跑卻追不上的表演。

    4–15 秒,整秒

  2. 02有一個標記是承重的

    [Language] 選定嘴型所依據的音素集,所以它是那個會改變畫面的標記。(S1) 只有在畫面裡不只一個可能的說話者時才有用——面對一張臉,它不會改變任何你看得見的東西。

    (S1) … [Chinese] …

  3. 03字元上限不是給台詞用的

    7,000 個字元涵蓋的是整段提示詞。一句台詞是幾十個字元;其餘全是鏡頭——誰、在哪裡、怎麼打光、怎麼取景。寫不下是描述的問題,從來不是對白的問題。

    7,000 字元

  4. 04秒數就是帳單

    768P 每一個輸出秒 8 點數,2K 是 13 點。對嘴台詞定長度,長度定帳單,所以一支十五秒差不多是四秒那支的四倍。值得聽的台詞大多都短。

    8 點數 / 秒 · 768P

這些都不是對模型的猜測——長度和字元上限都是公開的限制,每秒價格就是 價格 上那些。想讓人替你把鏡頭描述好?提示詞產生器 會把剩下的 6,900 個字元寫出來。

負責任地使用對嘴

你可以用誰的臉做對嘴

你自己的、你拿到許可的,或者因為是你生成的、所以不屬於任何人的。

  • 人臉讓一個真實的人看起來說了他沒說過的話,H3 授權條款是禁止的——公眾人物不行,陌生人的照片也不行。
  • 嗓音上傳的音軌如果複製的是某一個特定的人的聲音,那它必須是你自己的、拿到授權的,或者合成的。
  • 檢舉檢舉入口在每一頁、每一個結果上都有。一再出現的帳號會被關掉。
  • 未成年人絕對不要上傳含有未成年人的照片或片子。
  • 你的上傳不會拿去訓練任何東西。你隨時可以把它們刪掉,帳號也可以。
  • 商業使用權利商業使用每一個方案都包含,免費的那個也算——影片是透過 MiniMax 的 API 生成的,而 MiniMax 對你生成的產出不主張任何權利。以上是概述,不構成法律意見。

完整政策:負責任使用

大家真的會問的對嘴問題

AI 對嘴常見問題

跑第一句台詞之前該知道的事

這個 AI 對嘴影片生成器免費嗎?

不——跑一次是要付費的。沒有聲音的對嘴不叫對嘴,所以這一頁跑的是 MiniMax H3,不是那個只出畫面的無聲引擎,一次生成從 37 點數起:768P 四秒。不需要帳號的是那些證據——這裡每一支做好的片子,以及它背後的完整提示詞,都原樣能播、能下載。

怎麼少花一點錢試試 AI 對嘴?

先跑四秒。計費是按輸出秒算的,所以最短的一支是最便宜的一次確認——看臉守不守得住、嘴落不落得準,37 點數對上跑滿十五秒的 125 點。在四秒上把照片和台詞調對,再去挑你真正想要的長度。

做對嘴需要音訊檔嗎?

不需要,這也是它和這一類裡多數工具最主要的差別。把台詞打進去,挑一門語言,聲音就和嘴型一起生成。如果你手上已經有錄音或一首歌,那就上傳,它會直接變成最後那條聲音。

片子自帶聲音嗎?

有——32 kHz 立體聲,和畫面在同一次生成裡做出來,裝在同一個 MP4 裡。沒有獨立的音訊步驟,也沒有什麼要混流的。

我已經有一支影片,可以拿來做對嘴嗎?

可以,但有一件事要先弄清楚:H3 是把鏡頭重新生成,不是在你的影格上重畫那張嘴。你的素材會引導結果,但它不會留在結果裡。所以當你想要同一個想法的一次新表演時,這一頁是對的;當原本的像素本身就是重點時它就不對了——比如一門四十分鐘的課程要配西班牙文,或者客戶的素材誰都不許重畫。那些情況下,剪貼式的配音工具會比我們更合用。

一支對嘴片子最長可以多久?

4 到 15 之間任何一個整秒,24 影格每秒。十五秒是模型的上限,不是方案的限制——沒有哪一檔能把它抬高。

對嘴支援哪些語言?

實測過十一種:阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。其他語言通常也能用,我們沒有擋;只是我們沒跑過,所以不做承諾。

我以前用的那個工具,對嘴為什麼是糊的?

幾乎可以確定是因為它在嘴周圍裁一小塊,在那個尺寸上生成,再貼回去。在一個 1080p 的影格上,那塊補丁是唯一穿過低解析度瓶頸的部分,所以它挨著臉頰看起來就是軟的。這跟你的照片一點關係都沒有。

出來還會像我照片裡的那個人嗎?

當提示詞除了說什麼、也把人描述出來時,臉就守得住;只描述說話內容時就會飄。正面拍的來源明顯穩得多。和圖片轉影片是同一條規律、同一個解法,外觀鎖定會替你把那一句寫好。

對嘴該用什麼樣的照片?

一張臉、正面、光線均勻、嘴上沒有東西擋著,能選的話讓牙齒露出來。手機隨手拍通常勝過精修的形象照——修圖會把動起來所需要的那層質感抹掉。

如果我的音訊比片子長怎麼辦?

它會照片子的長度被切掉;不會壓縮,也不會加速。把長度設成至少和你的音軌一樣長——生成器會把兩者比一比,並主動幫你修正。

對嘴可以用唱的,不是用說的嗎?

可以。把語氣設成唱,或者上傳人聲讓它帶動嘴型。一樣是十五秒的上限。

可以出 2K 嗎?

可以。2K 是從原本的上下文重新生成的,不是把像素放大,所以嘴部細節能撐過這一步,而不是被內插出來。

我需要帳號嗎?

在這一頁播放或下載任何東西都不需要。要跑你自己的就需要,還需要點數,因為這一頁跑的是付費的 MiniMax H3。你的每一次嘗試都存著,所以第二次是在改,不是重新上傳一遍。

我的成品會帶浮水印嗎?

不會。你下載到的就是模型產出的那一支。

我按下「生成」之後會發生什麼?

它會送到模型那邊,然後作為一個做好的 MP4 回到你的歷史紀錄裡,聲音已經在檔案裡面。你不用守在頁面上——瀏覽器再也沒回來過的那一次生成,會在伺服器端跑完;供應商弄丟的任何一次,都會被判定失敗並自動退回點數。

這些片子可以商業使用嗎?

商業使用每一個方案都包含,免費的那個也算——影片是透過 MiniMax 的 API 生成的,而 MiniMax 對你生成的產出不主張任何權利。以上是概述,不構成法律意見。

支援哪些照片格式和尺寸?

JPG、JPEG、PNG、WEBP、HEIC 和 HEIF,每個檔案最大 30 MB,每一邊在 256 到 5,760 像素之間,長寬比落在 2:5 與 5:2 之間。HEIC 和 HEIF 直接進得來,所以 iPhone 拍的照片不用先轉檔。這些是 公開的限制,上傳框會在你花掉任何東西之前拿你的檔案對一遍。

照片裡可以有不只一個人嗎?

可以,而且一行台詞就能處理。畫面裡有兩張臉的時候,你不指名,模型就自己挑一個說話者,所以幫它們打上標記:(S1) asks, [English] Did you send it? (S2) replies firmly, [English] Two hours ago. 面對一張臉,這個標記不會改變任何你看得見的東西,所以它只在你真的需要的時候才值得知道。

對嘴台詞最長可以多長?

7,000 個字元涵蓋的是整段提示詞,而一句台詞只有幾十個字元——其餘都是鏡頭。真正的上限是鐘:四到十五秒,按平常語速大概是十到四十個詞。先寫台詞,數一遍,再挑長度。寫不下是描述的問題,從來不是對白的問題。

一張照片,一句話,對嘴就做完了。

這就是全部的輸入——而上面的一切,你登不登入都能播。

免費註冊 · 送 1 支 MiniMax H3

MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4