角色一致影片生成器

沒有一個影片模型在兩次請求之間記得你的角色,而那些說自己記得的,其實是把檔案存起來、再交還給你。所以乾脆跳過那個要先訓練的身份:把靜圖、片段和聲音直接附在你正在要的那顆鏡頭上,單次請求最多十二個檔案。
你的第一支免費。不用綁卡。

把下一顆鏡頭寫出來

0 / 7000

This run spends credits — the free clip is 4s · 768P · 16:9.

Sign up free and your first MiniMax H3 clip renders 4s · 768P · 16:9, with sound. A plan raises the ceiling to 15s, 2K and four at a time — the free clip is a size, not a different model.

  • 給那個角色一個檔案,不要給他一個形容詞——一張正面靜圖每一次都贏過一整段描述
  • 說清楚每一個檔案是做什麼用的:這一個是臉、這一個是動作、這一個是聲音
  • 把不許動的那些特徵指名出來——頭髮、外套、疤。沒被指名的,就是可以被動的
  • 一場戲是一顆鏡頭一個請求,而同樣那幾份參考,每一次都要再放進去

不用綁卡:這一頁上的每一支片子都不用帳號就能播,而免費帳號可以跑一支你自己的——4 秒、768P,帶聲音,沒有浮水印,可以下載,也可以商業使用。

四種守住角色的方式,出自 MiniMax 自己公開的範例。每一張卡都能打開完整提示詞。

角色一致 AI 影片:一對情侶在廚房水槽邊互彈洗碗精泡沫,女方的臉來自一張靜圖,她的節奏來自另一段參考片段

臉來自一張靜圖,表演來自一段片子

提示詞進,角色出

左邊是提示詞。右邊是它交回來的東西。

臉來自一張靜圖,表演來自一段片子16:9 · 15 秒 · 1 張參考圖 + 1 段參考片段

兩個檔案,兩份工作。靜圖說的是這是誰;片段說的是他們怎麼動、多快、什麼節奏。沒有一個在做另一個的工作——而那段提示詞在描述任何一個動作之前,先指名了哪個檔案在回答哪個問題。

The character's actions, expressions, and performance rhythm in Image 1 strictly reference input Video 1. A boy stands at the sink on the right side of the frame and hands a washed plate to the girl on the left side of the frame, then suddenly turns and flicks dish soap foam with his right hand towards the girl at the left edge of the frame. The girl, startled, immediately counterattacks, and the two begin happily splashing foam at each other and dodging, accompanied by loud laughter.

角色一致 AI 影片:一對情侶在廚房水槽邊互彈洗碗精泡沫,女方的臉來自一張靜圖,她的節奏來自另一段參考片段
一個角色撐滿十五秒16:9 · 15 秒 · 2 張參考圖

讀第一個子句:把 Image 2 當成固定的角色參考,然後四個特徵一個一個被指名——半束起的黑髮、銀色鏤空髮冠、那件袍子、那組色票。那份清單就是全部的訣竅。你沒指名的特徵,就是模型可以自由重畫的特徵。

Use Image 2 as a fixed character reference, maintaining consistency of black half-tied long hair, silver hollow hair crown, dark blue hair ribbon, light layered Hanfu, semi-transparent blue outer robe, dark blue waist seal, silver floral buckle ornament, and long tassels. Use Image 1 as a reference for shot storyboarding and rhythm. The visuals are high-quality 4K 16:9 Guofeng 3D, with a film-grade xianxia texture,热血、庄严、宿命感强. The shots sequentially express the content in the storyboard, ensuring natural camera movement and transitions between each shot, it cannot be like a ppt. Character face reveals can only be close-ups or extreme close-ups, long shots can only be back views, side-back views, or environmental empty shots, no front-facing long shots.

角色一致 AI 影片:一位穿白袍、戴銀色髮冠的仙俠女主角穿過一段雪景,戲服從頭到尾沒變
兩位主角,一支預告9:16 · 15 秒 · 2 張參考圖

一組卡司,不是一個角色。這段提示詞在寫下第一個拍點之前,就把兩位主角都釘在他們的參考圖上,因為一場有兩個人的戲,就是兩個會各自飄走的身份——而飄的一定是你沒釘住的那一個。

Generate a 15-second, 9:16 vertical overseas real-person vampire romance short drama teaser clip. The appearance of the male and female leads references Image 1, and the scene references Image 2. Maintain the identity consistency of the male and female leads, real-person texture, and high-quality short drama texture. Overall story: The innocent human female lead mistakenly enters the forbidden area of an ancient castle and accidentally awakens the sleeping vampire noble male lead. The male lead discovers that she carries a certain aura related to an ancient war, thus developing a strong desire for control and dangerous interest in her. The female lead is afraid of him but does not completely submit, resisting his oppression. Overall style: Overseas ReelShort / DramaBox vampire romance short drama teaser feel. Dark romance, dangerous attraction, sense of fate, strong sense of control, gloomy oppression, highlight reversal. The visuals are high-end, restrained, and compact, like the hook of a hit short drama's first 15 seconds. No blood, no cheap horror, no Halloween feel, no modern street feel. Aspect ratio: 9:16 vertical composition, suitable for TikTok / ReelShort / DramaBox. Characters are mainly medium close-ups, close-ups, and extreme close-ups; the vertical screen should highlight faces, eyes, sense of oppression, and relationship tension.

角色一致 AI 影片:一支直式吸血鬼愛情前導片,同樣兩位主角撐過門口、走廊和一顆近距離雙人鏡頭
換一批演員,同一套編排16:9 · 6 秒 · 1 段參考片段

這裡被守住的身份不是一張臉——是一套編排。三個穿西裝的男人變成三隻水豚,而一套九個動作的地板序列,每一拍都活過了這次替換,因為扛著節奏的是那段片子,不是那句話。

Reference Video 1 for action imitation. Fixed wide-angle shot, replace the three men in suits in the original video with three highly realistic capybaras. The capybaras must strictly follow the original video's motion trajectory: quickly lie down on the floor in sequence, then the leftmost capybara jumps to the middle position, the middle capybara rolls to the far left, then the middle capybara rolls to the far right, the rightmost capybara jumps to the middle, and finally the middle capybara jumps onto the backs of the other two, stacking into a pyramid shape. Maintain the original fixed camera position. Ensure the capybaras' fur texture and lighting integrate with the environment.

角色一致 AI 影片:三隻穿西裝的水豚做完一整套複雜的地板動作,一拍不差地照著參考片段裡三個男人的動作走

這是什麼,又不是什麼

這裡沒有任何東西記得你的角色那既是全部的問題,也是全部的方法。

這一段放在最前面,因為它決定你到底該不該在這裡。每一個在賣「角色一致」的產品,賣的都是一個存起來的身份——Higgsfield 訓練一個 Soul ID、Vidu 保留一組多重參考、Runway 綁一個工作階段。被存起來的是一個檔案,而生成的時候發生的事,就是那個檔案被附到你的請求上。
所以問題不是一個工具記不記得。問題是它一次收得下幾個檔案,以及你為了把它們放在某個地方,付了多少錢。

那些量測對誰都不客氣,而在你編預算之前值得先知道。在 Face Consistency Benchmark 上,同一支文字轉影片片子裡的一張臉,飄移程度是同樣量法下真實素材的 2.1 到 5.7 倍——真實影片是 0.0843 的 ArcFace 餘弦距離,量到最好的模型是 0.1734,最差的是 0.4843。跨兩支不同的片子只會更難,不會更容易:ContextAnyone 的比較裡,以參考為條件的那些方法,兩支影片之間只到 0.54 到 0.59 的 ArcFace 相似度。
一張參考靜圖是最大的一根槓桿,而它不是一把鎖。它替你買到的,是一張在多數算圖上會被觀眾讀成同一個人的臉,價錢是一次算圖。

存一個身份,一個月要多少
$15–$129

存一個身份,一個月要多少

在別處每跑一次,按長度算
$0.45–$2.00

在別處每跑一次,按長度算

一個請求裡的圖片、片子、音訊
9 · 3 · 3

一個請求裡的圖片、片子、音訊

這裡一顆 8 秒的鏡頭,含聲音
約 $1.52

這裡一顆 8 秒的鏡頭,含聲音

  • 第一顆鏡頭之前沒有身份要訓練
  • 沒有要一直繳租金的角色資料庫
  • 沒有另外要買的對嘴那一趟
  • 沒有要解釋的浮水印,任何一層都沒有

你放進去什麼

四種說明「這是誰」的方式

唯一要緊的一件事:模型會把每一個像素重新算一遍,包括那張臉。它從來不會把你的參考貼進去。所以下面每一個檔案的工作,都是去約束一次重畫,不是去提供一份素材。

  • 這個角色的靜圖

    最多九張。一張乾淨的正面,勝過三張爛角度——在非正面的參考輸入上量到的身份分數,會掉超過一半。戲服和道具各自當成一張圖再加進去。

    訊號最強 · 最多 9 張圖
  • 一段他們已經在裡面的片子

    最多三段。一段影片扛得住靜圖扛不住的東西——步態、節奏、他們停頓的方式、一條運鏡路徑。這一頁四個範例裡有兩個,表演是從其中一段來的。

    動作與節奏 · 最多 3 段片子
  • 他們的聲音

    最多三個音訊檔,而身份是一把嗓音,和它是一張臉一樣多。H3 會參考音色,用它說出你的新台詞,而且和畫面在同一次生成裡。音訊必須跟著一張圖或一段片子一起走。

    音色,不是複製 · 最多 3 個音訊
  • 什麼都沒有,只有一段描述

    它在同一顆鏡頭裡有用,跨鏡頭就沒用。寫一次、把角色生成出來,然後留下你喜歡的那個影格,之後每一顆都拿它當參考。

    只夠一顆鏡頭 · 文字轉影片

四條路跑的都是同一個模型、同一個費率——768P 一秒 8 點數,2K 一秒 13 點,再加每支 5 點。參考不另外收錢。每一條限制與費率,附上各自上次變動的日期

從頭到尾

四個步驟守住一個角色

順序在這一頁比在別處都要緊,因為一組你在第一顆鏡頭沒釘住的卡司,到第六顆鏡頭就救不回來了。

  1. 一位穿白袍的仙俠角色,那個成為參考靜圖的影格

    動筆之前先定角

    挑出那些要成為這個角色的影格,而且照選角的方式挑:一張乾淨的正面、一張四分之三側、戲服、道具。光靠非正面的輸入,量到的身份分數會掉超過一半——所以正面那張不是偏好,是那個承重的檔案。

    最多 9 張圖一張乾淨的正面
  2. 一顆廚房雙人鏡頭,臉來自一張靜圖,節奏來自一段片子

    在句子裡給每一個檔案一份工作

    H3 是用語言模型讀提示詞的,所以可以告訴它哪個檔案回答哪個問題。Image 1 is the character; Video 1 is the action and the rhythm 是一句管用的話。附上四個檔案再描述一場戲,不是。

    指名檔案指名它的工作
  3. 一支直式預告裡的兩位主角,撐過了一刀

    男女主角的外形嚴格依照參考圖…… 他們的聲音沿用參考音訊的音色。

    畫面聲音

    把這組卡司帶進下一顆鏡頭

    兩次請求之間什麼都不會被記住。第二顆鏡頭用的是第一顆用過的那些參考,再加上——這是大家會跳過的部分——一個你從第一顆鏡頭裡留下來的影格。上一顆鏡頭的輸出,就是你為下一顆能拿到的最好參考。

    每一次都重新附上留一個影格
  4. 一位畫出來的男主角特寫,做好的那一次
    音軌 · 32 kHzSHOT-01.MP4

    用 768P 打草稿,留下的那一支再上 2K

    768P 一秒 8 點數,2K 是 13 點,而把一支做好的 768P 事後升上去,價錢剛好等於一開始就用 2K 算圖——所以為了把一張臉弄對而花掉的那六次,會便宜一些。生成失敗會自動退回。

    768P · 一秒 8 點數2K · 一秒 13 點數

四個步驟,不用安裝,不用綁卡。打開生成器

沒有人會告訴你的那些

它飄的是鏡頭之間,不是鏡頭裡面。那件事要花你多少,寫在這裡。

每一個在賣角色一致的頁面給你看的都是一支片子,而在一支片子裡面,這個問題幾乎已經解決了。你實際上要做的工作,是六支剪得起來的片子,而那是另一個量測——就是下面這個,量在影片之間,不是量在影片裡面。

  1. 01鏡頭之間那個數字才是真的

    以參考為條件的方法,在同一個人的兩支影片之間拿到 0.54–0.59 的 ArcFace 相似度。在同一支片子裡面,分數會更高。編預算要照那一刀編,不是照那一次算圖編。

    片子之間 0.54–0.59

  2. 02一張正面靜圖抵得上三張側面

    當參考圖不是正面時,最強的那個公開基準上的身份分數會掉超過 50%。如果你手上只有一個好影格,那就是要送的那一個——而且每一次都送它。

    非正面輸入,掉超過 50%

  3. 03上限是 9 張圖、3 段片子、3 個音訊

    單次請求總共十二個檔案,而且音訊必須跟著一張圖或一段影片走,不能自己去。那個上限是值得拿來比較的數字:多數通往這個模型的託管入口並不公布自己的。

    12 個檔案,一個請求

  4. 04把不許變的東西指名出來

    那些撐得住的公開範例,都是一個一個把特徵列出來——半束起的頭髮、銀色的冠、外套的顏色。一個你沒指名的特徵,就是那次重畫可以自由重新詮釋的特徵,而它通常在第四顆鏡頭就動手了。

    特徵,逐條列出

  5. 05一場戲是一顆鏡頭一個請求

    H3 算出來的是一顆 4–15 秒的連續鏡頭。一場六顆鏡頭的戲是六個請求,每個大約 $1.52,再加上你剪輯軟體裡的一趟——整場戲大約 $9,而那就是拿來跟一份按月的身份訂閱比的那個數字。

    6 顆鏡頭 ≈ $9

來源,讓你可以自己核:片子內部的飄移數字來自 Face Consistency Benchmark 的 ArcFace 那一欄(真實影片 0.0843、量到最好的模型 0.1734、最差 0.4843——愈低愈好);片子之間的數字和非正面那一項的掉幅,來自 ContextAnyoneFaithfulFaces。它們沒有一個測過 MiniMax H3,我們自己也沒跑過那個基準——它們放在這裡是為了把問題的尺度講清楚,不是為了替這個模型排名。

為什麼不用角色素材庫

一個角色是一把嗓音,和它是一張臉一樣多

去問任何一個在剪短劇的人。被丟掉的那些算圖裡有一半,是因為臉守住了、念法沒守住——而在多數工具上,聲音是第二件商品,另外買、再用手對。

  • 一個請求,一次生成

    聲音跟著臉一起回來

    32 kHz 立體聲和畫面一起生成,而音訊可以是你的參考之一——所以你附上去的那個音色,就是說出新台詞的那個音色。沒有對嘴那一步,也沒有另外一份配音訂閱。

  • 一次十二個檔案

    整組卡司塞得進一個請求

    九張圖、三段片子、三個音訊檔,總共十二個。一場帶戲服和場景板的雙人戲遠遠塞得下,這也是為什麼上面那支吸血鬼預告撐住的是兩個人,不是一個。

  • 什麼都不存

    沒有身份要訓練,也不用替它繳租金

    這裡沒有 Soul ID、沒有角色欄位,也沒有按身份計的費用——那些檔案住在你的硬碟上,跟著請求一起上去。如果你要的是一整份名單,這樣比較差;如果你有一個角色和六顆鏡頭,這樣比較好。

  • 一個費率,六種形狀

    直式和橫式一樣價

    21:9、16:9、4:3、1:1、3:4 和 9:16 每秒費率完全一樣,因為上游按秒收費、不看形狀。短劇是直式的,而它不會因此比較貴。

你放棄了什麼

一份保證。這是整個類別最誠實的極限:一份參考讓那張臉在多數算圖上被讀成同一個人,而在鏡頭之間,公開的數字落在 0.55 相似度附近,不是落在 1 附近。如果你的交付物需要一張臉逐格精確——一位指名的演員、一位品牌代言人、一份具法律意義的肖像——那就把那個人找來拍。改成把他周圍的鏡頭生成出來。

交得出來的工作

四件撐得過十五秒的角色工作

四件不同的工作、四支真的用這個方法做出來的片子,而每一顆按鈕後面就是做出它的那段提示詞。每一支都要你自己的檔案——片子上的徽章寫著要哪一種,而按鈕會替你開對的那扇門。

  • 角色一致 AI 影片:一群小孩跑過夏天的田野,其中一個被換成黃金獵犬、一件外套被換色,其他人一個都沒被動到
    16:9 · 6 秒 · 2 張參考圖 + 1 段參考片段

    換掉其中一個,其餘留著

    一句話兩個改動:後面那個小孩換成 Image 1 裡的那隻狗,最左邊那件外套換顏色。畫面裡其他人一個都沒被提到,也一個都沒變。這就是你會給剪輯師的那種指示的形狀,也是 H3 讀得懂的形狀。

  • 角色一致 AI 影片:一個穿同款西裝的人被加到一顆雙人鏡頭的左邊,和其他人同步移動
    16:9 · 6 秒 · 1 段參考片段

    加一個本來就該在那裡的人

    一句話,而新來的那個人繼承了制服、步態和光。模型不是在把一個去背圖層合成進去——它是把整顆鏡頭連同多出來的那個人一起重畫,這也是為什麼影子落得對,以及為什麼你拿不回原本的像素

  • 角色一致 AI 影片:一位穿皮衣的乙女遊戲男主角穿過一支夜城 PV,他的設定在每一刀之間都沒變
    16:9 · 15 秒 · 2 張參考圖

    一個畫出來的角色,守在設定上

    插畫是飄移最看得出來的地方,因為一張畫出來的臉沒有攝影的模糊空間可以躲:眼距要嘛對得上設定表,要嘛對不上。Image 2 是身份的嚴格參考,而提示詞其餘的部分是運鏡和氣氛。

  • 角色一致 AI 影片:一場直式短劇裡的爭執,發生在一間小餐館內景,同樣兩位演員撐過整段交鋒
    9:16 · 15 秒 · 2 張參考圖

    一場卡司固定的直式戲

    短劇正是這一頁存在的理由:幾十顆鏡頭、同樣兩張臉、直式。十五秒是一顆鏡頭——卡司是你重新附到下一個請求上的東西,而剪接發生在你的剪輯軟體裡,不在這裡

四支都是 MiniMax 自己公開的範例,以 CC BY 4.0 收錄——所以每一顆按鈕都能把那段提示詞照它當時被跑起來的樣子載進來。

它實際上要多少錢

一場六顆鏡頭、一個角色的戲是 414 點數大約 $9。

一支片子固定 5 點數,付的是讀懂提示詞那一趟,再加上 768P 每秒 8 點數、或 2K 每秒 13 點。參考是免費的——附九張圖和一張都不附一樣價。一點數就是 MiniMax 自己公布標價的一美分,所以整件事都能拿一個本站控制不了的頁面去核。生成失敗會自動退回,而這一點在這裡比在別處更要緊:守住一張臉是一件你會重試的工作。

一顆角色鏡頭按長度算要多少

一顆 4 秒鏡頭,768P
37 點數
一顆 8 秒鏡頭,768P
69 點數
一顆 15 秒鏡頭,768P
125 點數
六顆 8 秒鏡頭,768P
414 點數
一顆 8 秒鏡頭,2K
109 點數
六顆 8 秒鏡頭,2K
654 點數

完整價格 · 每一條限制與費率,附日期 · 一秒 2K 到底要多少錢

兩種繳法,每月點數一樣

  • 免費免綁卡

    一支真的 MiniMax H3 影片,帶聲音。4 秒 · 768P 之外的一切都靠點數。

    $0永遠

    從頭到尾都不用信用卡

    免費開始

    只驗機器人——不要 email

    在 MiniMax H3 上跑 1 支

    MiniMax H3 · 4 秒 · 768P · 16:9 · 帶聲音
    7 天後回來看看——37 點數,再一支

    $9.9 起的任何一個點數包,都能解鎖 MiniMax H3 AI 影片生成器——每一種輸入方式、768P 和 2K

    • 原生 2K 的 MiniMax H3只有付費
    • 聲音和畫面一起生成只有付費
    • 一支,不用綁卡
    • 一次跑 1 支
    • 跑壞的不收錢
    • 生成內容不公開
    • 任何一個點數包都能解鎖 MiniMax H3 AI 影片生成器的每一種輸入方式

    免費層跑的是另一個引擎。看方案

    速度與排隊

    排隊
    免費通道
    同時任務數
    1
    批次
    1
    紀錄保留
    24 小時 · 登入後 7 天
    支援
    社群
  • Lite省 30%

    用原生 2K 解鎖 MiniMax H3 AI 影片生成器。最小的付費方案——大多數人選的是 Pro。

    $16.9/mo$24.9

    年繳 $202.8 · 一年省 $96

    7 天退款 · 隨時取消

    750 點數 / 月 · 約 20 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 13 支

    月繳年繳,每月點數一樣

    • 原生 2K 的 MiniMax H3——還有原生音訊
    • 對白、音效與音樂在同一個檔案裡
    • 最長 15 秒15 秒
    • 每月約 20 支 4 秒 768P 的文字轉影片
    • 跑壞的不收錢
    • 點數沒動過,7 天內可退
    • 一次跑 1 個任務
    • 同一段提示詞批次跑 2 個版本

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    一般
    同時任務數
    1
    批次
    2
    紀錄保留
    7 天
    支援
    Email · 48 小時
  • 多數人推薦
    Pro省 30%

    比 Lite 多 $32。每月約 47 支影片,同一個 MiniMax H3 AI 影片生成器,排隊更快。

    $39.9/mo$56.9

    年繳 $478.8 · 一年省 $204

    7 天退款 · 隨時取消

    1,775 點數 / 月 · 約 47 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 31 支

    月繳年繳,每月點數一樣

    • Lite 的全部
    • 每月約 47 支 4 秒 768P 的文字轉影片
    • 同時 3 個任務
    • 影片轉提示詞
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    快速
    同時任務數
    3
    批次
    4
    紀錄保留
    7 天
    支援
    Email · 12 小時
  • Studio省 30%

    整整一個月的量、排隊排在最前面,還有一個 4 小時內回覆的真人。

    $99.9/mo$142.9

    年繳 $1,198.8 · 一年省 $516

    7 天退款 · 隨時取消

    4,425 點數 / 月 · 約 119 支影片

    4 秒 · 768P · 文字轉影片

    或 4 秒 2K 約 77 支

    月繳年繳,每月點數一樣

    • Pro 的全部
    • 每月約 119 支 4 秒 768P 的文字轉影片
    • 同時 8 個任務
    • 同一段提示詞批次跑 4 個版本
    • 紀錄保留 7 天
    • 4 小時內的優先支援
    • 我們給得出的最低點數消耗
    • 點數沒動過,7 天內可退

    包含商業使用——涵蓋範圍

    速度與排隊

    排隊
    優先——排在最前面
    同時任務數
    8
    批次
    4
    紀錄保留
    7 天
    支援
    優先 · 4 小時

你到底能不能拿去用

可以,商業使用——而肖像那個問題是你的

這是本站唯一一頁,真正要緊的那些權利不在我們手上。上傳一張臉和上傳一個 Logo 是不一樣的,所以在你花任何錢之前,先把立場寫在這裡。

  • 商業使用免費那一支也算。任何一層都沒有浮水印,不按支收授權費,也沒有另外要買的授權。MiniMax 對你生成的產出不主張任何權利,而本站也不自己加上任何一條。
  • 一張不屬於你的臉在這一頁上,這一條才是要緊的。這一頁沒有任何東西會賦予你別人的肖像權,而一個真實的人的臉,不會因為你手上有一張他的照片,就變成你可以放進廣告裡的東西。去拿你拍片時會拿的那份肖像授權書。
  • 你自己的演員一張已經同意過的人的參考靜圖,還是你的。那次上傳是拿來跑你的請求的;回來的東西是你的,可以拿去播,而且你在素材上會做的同一套權利檢核,一樣適用。
  • 被擋下的東西血腥暴力和性內容在輸入這一關就會被擋下,在任何一秒被計費之前;把一個生成出來的人冒充成真實公眾人物的素材也一樣。那道檢查同時跑在提示詞上和你附上去的東西上。

完整的負責任使用

在你花任何錢之前

角色一致 AI 影片常見問題

在把一個角色交給一場戲之前,大家會問的八個問題,連背後的數字一起答。

這個角色一致影片生成器免費嗎?

第一支是,而且跑的是真的模型——4 秒、768P,帶聲音,沒有浮水印,不用綁卡,而且永遠不過期。這一頁上的所有東西完全不用帳號就能播。之後,一顆 8 秒的 768P 鏡頭是 69 點數,一顆 15 秒的是 125 點;點數從 $9.9 起賣,所以一場六顆鏡頭的戲大約 $9。生成失敗不用你付錢。

那個角色在每一顆鏡頭裡真的會長得一樣嗎?

被讀成同一個人,會,在多數算圖上。逐格一模一樣,不會——而且這個類別裡沒有任何工具做得到。已公開的量測把以參考為條件的身份相似度放在兩支片子之間大約 0.54–0.59,而真實素材的基準比那緊得多。做計畫的時候,抓六次留四次,而且每一個請求都重新附上同樣那些參考。

我可以附上幾個參考檔案?

單次請求最多 9 張圖、3 段影片和 3 個音訊檔,總共 12 個檔案。音訊必須跟著一張圖或一段片子一起走,不能自己去。附參考不另外收錢——你付的是你算出來的那些秒。

照片還是一段影片——哪一個比較守得住角色?

它們守的是不同的東西。靜圖對臉和戲服來說是最強的訊號;片段扛的是步態、節奏和運鏡。兩個都用,並且在提示詞裡說清楚哪個是哪個。如果你只有一個檔案,就讓它是一張乾淨的正面靜圖:在非正面的輸入上,量到的身份分數會掉超過一半。

這個角色可以維持同一把嗓音嗎?

可以——把音訊當參考附上去,H3 就會用那個音色說出你的新台詞,而且和畫面在同一次生成裡,不是事後配上去的。它是一份音色參考,不是一把你可以存起來的複製嗓音,而且它旁邊需要一張圖或一段片子。

這和 Soul ID 或角色素材庫差在哪裡?

那些替你把一個身份存起來,並且為那份名單收訂閱費——例如 Higgsfield 是每月 $15 到 $129。這裡什麼都不存:你的檔案跟著每一個請求上去,而你付的是秒數。如果你在管二十個角色,這樣比較差;如果你有一個角色、六顆鏡頭要做,這樣比較好。

我可以一次做完一整場戲嗎?

不行。H3 算出來的是一顆 4 到 15 整秒、24 影格每秒的連續鏡頭,所以一場戲是一顆鏡頭一個請求,而剪接發生在你的剪輯軟體裡。長度會落在 17n+5 的影格格線上,所以 192 個影格——正好 8.000 秒——是這個區間裡唯一的整秒,如果你的鏡頭必須對上音樂,就用它。

我可以拿別人的臉當參考嗎?

只有在你有那個權利的時候可以。這裡沒有任何東西會賦予你一個人的肖像權,而生成一位真實的公眾人物會在輸入那一關就被擋下。至於你自己的演員,去拿你拍片時會拿的那份肖像授權書;回來的東西那時就是你的,可以商業使用,每一個方案都可以,免費那個也算。

別再描述你的角色了。把他定下來。

一張靜圖、一句說明每個檔案是做什麼的話,大約九十秒後拿回一顆鏡頭。你的第一支免費——不用綁卡、沒有浮水印,而且可以拿去商業使用。

免費註冊 · 送 1 支 MiniMax H3

MiniMax H3 AI Video Generator 編輯團隊撰寫與維護發布於 最後更新 工具版本 2026.09.4