Guides

用 MiniMax H3 做 AI 电影预告片:标题卡不再拼错

剪辑、配乐和七张标题卡,都出自一次 H3 调用。短卡由模型自己排版;唯一那张设计好的主标题版来自你的参考图,而且首尾各出现一次。

11 分钟读完编辑部编辑部
用 MiniMax H3 做 AI 电影预告片:标题卡不再拼错

要是你试过用 AI 做电影预告片,你已经知道它是在哪一步散架的。镜头都还行。然后你要一张标题卡,拿回来的是 THE LAST FLEEF LFFT EARTH,配一副没人挑过的字体。

通常的建议是干脆放弃生成的文字——出片时不带字,拉进剪辑软件,标题自己打。在照做之前,我把 MiniMax 官方那两条预告片样片逐帧拆了一遍。两条加起来一共十二张标题卡,而且只要动画走完,十二张全都拼对了。

这不等于你的也会对;样片是挑出来的。但它说明天花板比那些截图给人的印象要高,而且顺带解释了那些截图大多是从哪儿来的。

十五秒,七张卡,一条配乐,全部出自一次调用。下面是做法。

一次 MiniMax H3 调用做出来的 AI 电影预告片长什么样

这是 H3 在单次调用里出的一条预告片。十五秒,五个机位,硬切,人物从头到尾是同一个,有配乐,还有七张标题卡:

它开场先托住 THE LAST FLEET LEFT EARTH,下面压着一行 SHE WAS NOT ON BOARD,切走,然后依次走 THE FINAL DEPARTUREEARTH SENT THE LAST FLEETFINAL COUNTDOWNWITHOUT HERSHE KNEW WHYTHE MISSION WAS A LIE,最后回到开场那张主标题版收尾。

每一个词都是对的。没有剪辑软件,没有字幕插件,没有第二遍。

值得停下来看看没有发生的事。眼下做 AI 预告片的通行办法是一套五个工具:一个对话模型写分场表,一个图像模型出锚点帧,一个视频模型做运动,一个服务做配乐、另一个做配音,最后再用剪辑软件拼起来。这套东西之所以存在,是因为大多数视频模型交给你的是无声的镜头。

H3 在同一次前向传播里生成画面和 32 kHz 立体声,而且默认就会在镜头之间切,所以配乐是落切点上的,不是落在切点附近。五个工具那一套,坍缩成一次调用加一张图。

MiniMax H3 的预告片提示词,以及它里面没有的东西

全文就这么多:

Faster rhythm, grand but not dragging. Quick hard cuts, bridge
vibrations, intense light flashes, short black screens, jump shock
transitions. Text is movie trailer-style wide letter-spacing title
packaging, font not pure white, should have restrained glow and
texture, faint edge glow. Text animations include fading in from deep
space darkness, being swept by starlight, letter-spacing expansion,
motion trails, faint glow, black screen flashes.

再读一遍,注意缺了什么。没有人物。没有场景。没有镜头表,那七串文字一串都没有。MiniMax 给整段打的标签是 (Not a complete prompt, details can be added independently),所以把它当成一个片段来看——那几行里有一些,多半是被打进了他们没有公开的那部分。

但有一张卡,它不可能是在任何地方打进去的,而那张恰恰是值得你留意的。

那张该放进参考图、而不是提示词里的标题卡

这次请求只带了一张参考图。就是这张:

主视觉定帧:一个人影站在舷窗前,标题 THE LAST FLEET LEFT EARTH 已经排在星空上

这是一张做完的主视觉,标题已经排在上面了。现在看它在片子里出现在哪儿。

开头八帧——0.000 秒到 0.292 秒——就是这张图,带一个缓慢推近。然后硬切到黑。到 12.5 秒它又回来,预告片托着它结束。

所以那个两行的主标题版,根本不是 H3 拼出来的。它就是那张图本身,首尾两次出现在画面上,摄影机在它上面移动。那行拉开字距的副标题、它用的那个灰白、字与字之间的间距——没有任何一样是被生成出来的,所以也没有任何一样可能出错。

由此得到的规则

在下那个显而易见的结论之前,先看看另一条样片,因为它是往反方向切的。MiniMax 的第二条预告片带五张卡,而它的标题写在提示词里的——一字一句写出来,还挂了一条颜色指令:

A large title fades in from the dark edge, blurry first then clear:
"THE STARS WERE LISTENING" font extremely narrow, heavy, all caps,
dark red mixed with rust red

它回来是对的,而且回来就是它要的那个暗锈色。同一条片子还稳稳地放下了 NO ONE WAS MEANT TO HEAR IT——两行七个词——一处错都没有。

所以两条官方样片加起来的战绩是十二张卡全对,描述的和提供的都一样。把标题打进提示词是行得通的。 真正要紧的分界不是「描述」对「提供」:

打进提示词排在参考图里
这次出得对不对对,两条官方样片都对对,而且不可能不对
下一次出片它是一次生成——每次都重掷一遍一模一样;模型压根不渲染它
颜色照办——要锈红,给锈红精确——#bcc0c6,直接来自你的文件
成本不花钱一个参考位
附赠它能给片子做首尾书挡

所以中间那些卡,照写。不会出什么事,参考位也还留在你手上。但那张每一次出片都必须对的卡——一个品牌、一个产品名、片名本身——就不该是一次生成。 把它放进图里,等于把它从抽奖池里拿出来。

而如果你是把那张图当成一个做完的画面、而不是一块情绪板来排,你会白得它两次。注意这是你交出去的东西的属性,不是 Ref2VA 本身的属性:另一条样片给的参考是一块气氛板和一张人物肖像,而它开场用的哪一张都不是。

这把工作顺序整个翻了过来。你不是先写一条预告片、再往上加标题。你先把最后一帧设计出来,然后去要那十五秒,让它走到这一帧——而它顺带就是你的开场闪现。

不是设计师,怎么把主视觉做出来

这一步是所有人都会跳过去的,所以这里讲具体。你需要一张定帧,用你最终的画面比例,上面有四样东西:

  1. 标题,按你要的样子排好。 字距拉开,全大写,而且不要纯白。我在官方那张定帧上取过那一行字的色值,峰值落在 #bcc0c6——一种偏冷的灰,亮度大约 78%。这一个选择,就是这张卡读起来像「设计过」而不是「打上去」的绝大部分原因,也是 MiniMax 自己的提示词里要写 "font not pure white" 的原因。把标题从 #ffffff 上往回收一点,它就不再像一条字幕了。
  2. 想要副标题就加一行。 SHE WAS NOT ON BOARD 是在真干活的:它把一个片名变成了一个前提。
  3. 首尾你想要的那个构图。 文字后面是什么,那就是你的预告片开场的那一帧,也是它落下的那一帧,所以把你的主体放进去,按一个做完的镜头去构图,不要当背景板。
  4. 氛围。 调色、颗粒和光,都会跟着这张图一起过去。

任何图像工具都能做,Figma 或者 Canva 里的一页幻灯片也行——文字不需要是生成的,它需要的是清楚、而且是定稿。长边导出 1280 或者更高。

动手做之前有一件事值得先知道:参考图会把它自己的光一起带过来。如果这张定帧是冷的、暗的,整条预告片回来就是冷的、暗的,提示词怎么写都没用。挑你想要出现在成片里的那种光,不是在海报上最好看的那种光。

十五秒是一条 teaser,而这恰好是值得做的那个规格

规划任何东西之前先把这句说出来:一条 MiniMax H3 的片子上限是 15 秒。 院线预告片是 90 到 150 秒。如果你是奔着一次做出一条两分钟的预告片来的,今天没有模型能做到。

十五秒什么呢,它正好是社媒的短版——跑在抖音、Reels 和 Shorts 上的那种 teaser,而这也正是今天人们真正看预告片的地方。它同时还是五个工具那一套最吃亏的规格,因为拼一条十五秒的片子,前期搭建的成本和拼一条九十秒的一样多。

如果你需要长度,办法不是生成得更长。是做好几条这样的,每一条走到它自己的那张卡,再剪到一起——而每一条仍然只是一次调用,不是十二次。

要 8 秒或者 15 秒,中间的别要

小事,但很容易弄错,而且它只在一个地方现形:最后那一拍。

H3 是按固定块出片的——24 fps 下 17n + 5 帧——所以你填的时长会被吸附到最近的合法值上。两条官方预告片回来都是 362 帧,也就是 15.083 秒,不是 15。

这个小数在一条普通镜头里无关紧要。在预告片里,你要让一张卡落在一个节拍上,所以它要紧。8.000 秒是唯一一个能拿到的整秒,而 15.083 是这个区间的上限。在这两个里挑一个,按它去写你的时间点,最后那张卡就会落在你放的地方。

你要你拿到
~8 秒8.000 秒(192 帧)
~10 秒10.125 秒
~12 秒12.250 秒
~15 秒15.083 秒(362 帧)

那一帧让我以为 H3 不会拼字

我从另一条样片里抽了一帧来核对文字,拿到的是这个:

THE STARS W RE LISTEN

缺字母,尾巴还断了。看上去就是所有人警告过的那种失败——直到我去看了相邻的几帧。一秒之后,同一张卡读作 THE STARS WERE LISTENING,连副标题都在,完美。

这些卡的动画方式是把字距撑开,所以每一张都会有几十毫秒到几百毫秒处在「还没走完」的状态。什么都没坏。是我拿一张还在入场途中的帧,去给一张卡下了判决。

这件事值得多待一会儿,因为「H3 不会拼字」那一批截图里,有相当一部分几乎肯定就是这么来的。一张正在入场的卡,看上去和一张坏掉的卡一模一样,而在时间轴上拖动,落在这些帧上的概率远高于随机——它们正是画面上明显有事情在发生的那些帧。

由此有两条。 判断文字要看稳定之后的那一帧,不要在拖动的时候看。还有,你抽封面图的时候,要在卡锁定之后再抽——不然这个瑕疵就是你自己发出去的,然后被别人截图。

顺着这条线追下去,追成了单独一篇:六条片子里,提示词点过名的字串,最后全都拼对了;真正有意思的是那些没人点过名的字。H3 会拿你没点名的文字做什么里有逐帧的数。

提示词那一半管什么:切的节奏,和文字的处理

一旦图承担了主标题版,文字就只干两件事,而这两件都值得照抄:

它定切的节奏。 "Quick hard cuts, bridge vibrations, intense light flashes, short black screens, jump shock transitions" 是一份五项的菜单,模型五项全用上了。我不会去掉的那一项是 short black screens——一条预告片需要一个地方在最后一张卡之前喘一口气,而黑场是买到这口气最便宜的办法。把它拿掉,十五秒的切就读成噪音了。

它一次性定下所有卡的文字处理。 从黑暗中淡入、星光扫过、字距撑开、拖影、微弱辉光、黑场闪。就是这一半,让那六张生成的卡看起来和那一张设计过的卡是一套的——同样的辉光,同样的字距,同样的入场。换参考图的时候把这一半原样留着,你自己那六张就会和你自己的主标题版对上。

跑一条 MiniMax H3 预告片要多少钱

十五秒的预告片 768P 是 62 积分,2K 是 122。八秒的版本分别是 3466。参考静帧不收费——前五张都不收。所有档位的消耗速率一样,所以换档位这些数字都不会变。

这笔账里有两点是预告片特有的。

分辨率比画幅更贵。 从 768P 上到 2K,每秒消耗翻倍;从 16:9 换成 21:9,再加一半。十五秒的 2K 宽银幕是 182 积分,同一个镜头用 768P 宽银幕只要 92。宽银幕是预告片这个体裁的默认长相,所以这一项值得专门定一次——但真要省,更便宜的那根杠杆是分辨率,不是画幅。

草稿是第二次生成,不是打折。 这里没有「升级」这个按钮——一条 768P 和一条 2K 是两次生成、两次扣费。所以让草稿把活干足:八秒、768P、16:9,一共 34 积分,不到一条完整 21:9 2K 的五分之一。剪点有没有踩在拍子上,768P 就完全听得出来,而拍子是唯一值得反复调的东西。等节奏稳了再去跑那条长的。

完整的表在定价页

去试试

上面那条提示词、那张参考定帧和成片,都在同一页上:MiniMax H3 科幻预告片提示词

带上你自己的主视觉,把那套语法粘进参考生视频。要是想在做图之前先摸一摸切的节奏,用文生视频跑 8 秒,能让你拿到节奏,只是没有卡。

样片、提示词和参考图都是 MiniMax 自己的,以 CC BY 4.0 发布在 awesome-minimax-h3-prompts。上面的帧数、时间点和标题字串,都是从文件里读出来的。

编辑部

作者

编辑部

minimax-h3ai.video

发布于 MiniMax H3 AI Video Generator,一个基于 MiniMax H3 的独立第三方界面。

所有文章