Guides

用 MiniMax H3 做一支 AI 電影預告(並且拿到一張真的看得懂的字卡)

一次 H3 呼叫就有剪接、配樂和七張字卡。短字卡由模型自己排;設計過的那組主標來自你的參考靜態圖。

11 分鐘讀完編輯部編輯部
用 MiniMax H3 做一支 AI 電影預告(並且拿到一張真的看得懂的字卡)

如果你試過做 AI 電影預告,你已經知道它會在哪裡垮掉。鏡頭都還好。 然後你要一張字卡,拿回來的是 THE LAST FLEEF LFFT EARTH, 配上一套沒有人選過的字體。

一般的建議是放棄生成的字——算成無聲的,拿進剪輯軟體,自己排標題。 在接受這個建議之前,我把 MiniMax 那兩支官方預告範例一格一格拆開來看。 兩支加起來帶著十二張字卡,而只要動畫停下來,那十二張全部拼寫正確。

這不是在保證你的也會;展示影片是挑過的。但它確實說明天花板比截圖看起來高, 而且它剛好解釋了那些截圖裡有很大一部分是哪裡來的。

十五秒、七張字卡、一段配樂,全部來自一次呼叫。做法如下。

一次 MiniMax H3 呼叫做出來的 AI 電影預告長什麼樣

這是 H3 在單次呼叫裡產出的一支預告。十五秒、五個機位、硬切、 從頭到尾同一個角色、一段配樂,還有張字卡:

它開場停在 THE LAST FLEET LEFT EARTH,底下排著 SHE WAS NOT ON BOARD,接著切開,然後依序跑 THE FINAL DEPARTUREEARTH SENT THE LAST FLEETFINAL COUNTDOWNWITHOUT HERSHE KNEW WHYTHE MISSION WAS A LIE, 最後回到開場那組主標,停在上面收尾。

每一個字都對。沒有剪輯軟體、沒有字幕外掛、沒有第二次處理。

值得停下來看看那裡沒有發生什麼。目前做 AI 電影預告的建議是一套五個工具的組合: 一個對話模型寫節拍表、一個圖片模型做定格、一個影片模型做運動、 一個服務做配樂、另一個做旁白,然後一個剪輯軟體把它們組起來。 那套組合之所以存在,是因為多數影片模型交給你的是無聲的鏡頭。

H3 在同一次運算裡生出畫面和 32 kHz 立體聲,而且它預設就會在鏡頭之間切, 所以配樂落切點上,不是落在切點附近。五個工具的組合塌成一次呼叫加一張靜態圖。

那份 MiniMax H3 預告提示詞,以及它裡面缺了什麼

全文就是這樣:

Faster rhythm, grand but not dragging. Quick hard cuts, bridge
vibrations, intense light flashes, short black screens, jump shock
transitions. Text is movie trailer-style wide letter-spacing title
packaging, font not pure white, should have restrained glow and
texture, faint edge glow. Text animations include fading in from deep
space darkness, being swept by starlight, letter-spacing expansion,
motion trails, faint glow, black screen flashes.

再讀一遍,注意缺了什麼。沒有角色。沒有場景。沒有鏡頭表, 那七串字裡也一個都沒有。MiniMax 給整份東西標的是 (Not a complete prompt, details can be added independently), 所以把它當成一份片段——那幾行裡有些很可能被打進了他們沒有公布的那一部分。

但其中有一張字卡不可能是任何地方打出來的,而那正是值得你注意的那一張。

那一張該放在參考圖裡、而不是提示詞裡的字卡

這次請求帶了一張參考圖。就是這張:

一張主視覺靜態圖:一個身影站在觀景窗前,標題 THE LAST FLEET LEFT EARTH 已經排在星空上

那是一張標題已經排好的完成主視覺。現在看它在片子裡出現在哪裡。

最前面八個影格——0.000 秒到 0.292 秒——就是那張圖,帶著一次緩慢的推進。 然後硬切到黑。到 12.5 秒它回來,而預告停在它上面結束。

所以那組兩行的主標不是 H3 拼出來的。它就是那張靜態圖本身, 在頭尾兩端出現在畫面上,攝影機在它上面移動。那行拉開字距的副標、 它用的那個灰白色、那個字距——沒有一樣是被生成出來的, 所以沒有一樣有機會出錯。

這給你的規則

在下那個顯而易見的結論之前,先看看另一支範例,因為它切向相反的方向。 MiniMax 第二支預告片帶著五張字卡,而它的標題就在提示詞裡—— 明明白白寫出來,還附帶一條顏色指示:

A large title fades in from the dark edge, blurry first then clear: "THE STARS WERE LISTENING" font extremely narrow, heavy, all caps, dark red mixed with rust red

它回來是對的,而且回來就是它要的那個暗鏽色。同一支片子還交出了 NO ONE WAS MEANT TO HEAR IT——兩行七個字——一個錯都沒有。

所以兩支官方片子加起來的成績是十二張字卡,全對, 描述的和提供的都一樣。把標題打進提示詞是有效的。 真正要緊的分別不是「描述」對「提供」:

打進提示詞排在參考圖裡
出來是對的是,兩支官方片子都是是,而且它不可能出來是錯的
下一次再算它是一次生成——每次都重擲一遍一模一樣;模型從來沒有算過它
顏色照辦——要暗鏽色,就給暗鏽色精確——#bcc0c6,直接來自你的檔案
成本沒有一個參考素材的位子
附帶好處它可以當片頭片尾的括號

所以你的過場字卡照寫。不會有壞事發生,而且你留住了那個參考位子。 但是那一張每一次都必須正確的字卡——一個品牌、一個產品名、真正的片名—— 根本就不該是一次生成。 把它放進圖片裡,就是把它拿出這場樂透。

而如果你把那張圖當成一個完成的畫面、而不是一張情緒板來構圖,你就拿到它兩次。 注意這是你交出去的東西的性質,不是 Ref2VA 本身的性質: 另一支片子的參考素材是一張氣氛板和一張角色肖像,而它開場哪一張都不是。

這件事把工作順序翻了過來。你不是先寫一支預告再加上標題。 你先設計最後一格,再去要那到達它的十五秒——而它同時兼任你的開場閃格。

不是設計師,那主視覺怎麼做

這是每個人都跳過去的一步,所以講具體一點。你需要一張靜態圖, 用你最後的畫面比例,裡面有四樣東西:

  1. 標題,照你要的方式排好。 字距拉寬、全大寫,而且不要純白。 我在官方那張靜態圖上取樣了字的那一列,峰值是 #bcc0c6—— 一個微微偏冷的灰,大約 78% 亮度。這一個選擇就佔了「這張卡看起來像設計過 而不是打上去的」的大半,也是為什麼 MiniMax 自己的提示詞寫 「font not pure white」。把你的標題從 #ffffff 往回壓一點, 它就不再像一行字幕了。
  2. 想要的話,加一行副標。 SHE WAS NOT ON BOARD 做的是實事; 它把一個標題變成一個前提。
  3. 你要的、頭尾兩端都成立的構圖。 字後面的那個東西, 既是你的預告開場的那一格,也是它落下的那一格, 所以把你的主體放進去,當成一個完成的鏡頭來構圖,不是當成背景。
  4. 氣氛。 調色、顆粒和光線都會跟著圖片一起過去。

任何圖片工具都做得到,Figma 或 Canva 裡的一張投影片也可以—— 那些字不必是生成的,它們必須是可讀而且定稿的。長邊 1280 或更高輸出。

在你做這張圖之前,有一件事值得知道:一張參考圖會帶著它自己的光線過來。 如果那張靜態圖冷而陰鬱,整支預告回來就是冷而陰鬱,不管提示詞怎麼寫。 挑你要在成品裡看到的那個光,不是在海報上最好看的那個光。

十五秒是一支前導,而那正是值得做的格式

在你規劃任何東西之前先大聲說一次:一支 MiniMax H3 片子的上限是 15 秒。 一支戲院預告是 90 到 150 秒。如果你是來一次做出一支兩分鐘預告的, 今天沒有任何模型做得到。

十五秒確切是什麼,是那個社群版的縮短剪—— 在 TikTok、Reels 和 Shorts 上跑的前導格式, 而那才是現在預告真正被看的地方。它同時也是那套五工具組合最不擅長的格式, 因為組一支十五秒的東西,前置成本跟九十秒的一樣。

如果你需要長度,做法不是一次更長的生成。是做好幾支這種東西, 每一支到達它自己的字卡,再剪在一起——而每一支仍然是一次呼叫,不是十二次。

要八秒或十五秒,中間的都別要

小事,很容易搞錯,而且它只在一個地方現形:最後那一拍。

H3 以固定區塊算圖——24 fps 下的 17n + 5 個影格—— 所以你打進去的長度會被吸附到最近的合法值。 兩支官方預告片回來都是 362 影格,也就是 15.083 秒,不是 15。

那個小數在一般鏡頭裡無害。在預告裡你是在算一張字卡落在哪一拍上, 所以它有影響。8.000 秒是唯一可用的整秒,而 15.083 是這個範圍的頂。 挑這兩個其中一個,照它寫你的時間點,最後那張卡就會落在你放的地方。

你要你拿到
約 8 秒8.000 秒(192 影格)
約 10 秒10.125 秒
約 12 秒12.250 秒
約 15 秒15.083 秒(362 影格)

那一格讓我以為 H3 不會拼字的畫面

我從另一支範例裡抓了一格出來檢查字,拿到的是這個:

THE STARS W RE LISTEN

缺字母、尾巴掉了。看起來完全就是大家在警告的那種失敗—— 直到我去看隔壁幾格。一秒之後,同一張卡讀起來是 THE STARS WERE LISTENING,連副標都在,完美。

那些字卡是靠拉開字距做動畫的,所以每一張都有幾十分之一秒是處在半成形的狀態。 沒有任何東西壞掉。我是拿一張還在到達途中的卡的截格去下判斷。

這件事值得多想一下,因為那幾乎肯定是「H3 不會拼字」那些截圖裡 有一部分的來源。一張半成形的卡,看起來跟一張壞掉的卡一模一樣, 而在時間軸上拖曳,落在那些畫面上的機率遠高於隨機—— 它們正是那些看得出有事情在發生的畫面。

由此推出兩件事。 從穩定下來的那一格判斷字,不要從拖曳判斷。 還有,當你要抓一張縮圖,等卡鎖定之後再抓—— 不然你就是自己把那個瑕疵交了出去,然後被別人截圖。

追這件事追出了另外一篇:跨六支片子, 每一串提示詞真的點名過的字都拼對了,而有趣的是那些沒人點名的字。 MiniMax H3 拿你沒指定的文字怎麼辦 有那些影格計數。

提示詞那一半管的是什麼:剪接節奏和字的處理

一旦圖片扛起了主標,那段文字就做兩件事,而兩件都值得照抄:

它定剪接節奏。 「Quick hard cuts, bridge vibrations, intense light flashes, short black screens, jump shock transitions」是一張五項的菜單, 而模型五項都用。我不會拿掉的是 short black screens—— 一支預告需要一個地方在最後那張卡之前喘一口氣,而黑畫面是最便宜的買法。 把它拿掉,十五秒的切就讀起來像雜訊。

它一次定下每一張卡的字處理。 從黑暗中淡入、被星光掃過、字距拉開、 運動殘影、黑畫面閃爍。就是這一半讓那六張生成的卡看起來跟那一張設計過的卡 屬於同一個東西——同樣的輝光、同樣的字距、同樣的入場。 換參考圖的時候把它一字不動留著,你自己的六張就會跟你自己的主標對上。

跑一支 MiniMax H3 預告要多少錢

一支十五秒的預告,768P 是 62 點數,2K 是 122。 八秒的版本是 3466。你的參考靜態圖免費——前五張都是。 每一個方案的燒法都一樣,所以換檔次這些數字都不會動。

這筆帳裡有兩個部分是預告特有的。

解析度花的錢比比例多。 從 768P 換到 2K,每秒的燒法翻倍; 從 16:9 換到 21:9,多加一半。十五秒的 2K 寬銀幕是 182 點數, 同一顆鏡頭在 768P 寬銀幕是 92。寬銀幕是預告這個格式的家常樣式, 所以要有意識地設它——但如果一定要讓步,比較便宜的那根槓桿是解析度,不是形狀。

草稿是第二次執行,不是折扣。 沒有升級按鈕——一條 768P 和一條 2K 是兩次生成、兩筆錢。所以讓草稿把它的錢賺回來:八秒、768P、16:9, 也就是 34 點數,不到一條 2K 全長 21:9 的五分之一。 你的切有沒有落在拍子上,在 768P 完全聽得出來, 而那個拍子是唯一值得反覆調的東西。等節奏站住了,再去花那條長的。

完整的表在價格頁上。

試試看

上面那份提示詞、那張參考靜態圖,還有做完的片子,全部在同一頁: MiniMax H3 科幻預告提示詞

帶著你自己的主視覺,把那套語法貼進參考圖生影片。 如果你想在做圖之前先摸一摸剪接節奏, 文字轉影片 用八秒就能給你節奏,只是沒有那張卡。

範例片段、提示詞和參考圖都是 MiniMax 自己的,以 CC BY 4.0 發布於 awesome-minimax-h3-prompts。 上面的影格計數、時間點和標題字串是從檔案上讀出來的。

編輯部

作者

編輯部

minimax-h3ai.video

發布於 MiniMax H3 AI Video Generator,一個基於 MiniMax H3 的獨立第三方介面。

所有文章