MiniMax H3 提示词生成器
一句话说清想法,拿回 H3 受训时就在读的那三个字段——先画面,后声音。
你的结构化提示词
integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music
检查项12 条规则,复制之前先跑一遍
- 字段顺序与官方序列一致
- [Shot 1] 上不带时间戳
- 运镜句点了动作,但没写幅度和速度
the camera pushes in
灰色的骨架就是真实格式——基础模式三个字段,参考模式六个。
0 / 7,000 characters
你在本站的第一条片子免费——不用绑卡。
MiniMax H3 提示词生成器
会回给你什么
一条 H3 能直接执行的提示词,不是一段它得先去猜的话。
MiniMax H3 提示词生成器 接过一句大白话的想法,照这个模型受训时读到的样子重写一遍:先是一镜一镜的画面描述,然后是场景的声音,最后是配乐,顺序固定。市面上多数 AI 视频提示词生成器给你的还是一整块默片式的散文,要么就是一张二十格的表单,逼你自己去做结构化。这一个只要一句话,结构它替你写,再照官方规则查一遍,而且从头到尾不问你要账号。
- 输入
- 1
- 输出字段
- 3 / 6
- 校验规则
- 12
- 字符上限
- 7,000
输入
输出字段
校验规则
字符上限
- 没有二十格表单
- 不用注册
- 不扣积分
三字段提示词结构,按 H3 期待的顺序
这个格式不是我们定的。它来自 MiniMax 2026 年 8 月发布在 H3 GitHub 仓库里的 h3-prompt-writing skill,附带的参考文件把字段、顺序和规则都钉死了。在 MiniMax 自己的管线里,有一个叫 Context-IR 的托管环节会先把你打的任何字改写成这个结构,模型才看到它——而官方给「不走那个 API」的人的建议是:预处理自己搭。这一页就是那个自己搭的,跑在浏览器里。
integrated_multimodal_description画面,一镜一镜写。overall_soundscape这个场景本身听起来是什么样。non_diegetic_music配乐,没有就写「N/A」。
[Shot 1]、时间戳和对白
镜头要编号,从第二个镜头起每一个切点都要带时间戳,第一个镜头永远不带。每个镜头内部的官方顺序是:构图、主体、环境、动作、运镜、声音。对白也住在这里:身份和语气写在标签外面,原话写在标签里面。写成「她说了句动人的话」,H3 就自己编一句——很少是你想要的那句。这个字段大约会占掉整条提示词的六成,也占掉大部分被打回的原因。
(S1) says: <d>[English] Follow the wind.</d>
overall_soundscape 与 non_diegetic_music
结尾这两个字段,是那些围着无声模型做的工具从来不写的。环境声是场景自己发出来的声音——雨打在布上、马克杯放下、两条街外的车流——带着距离和落点时间。音乐字段是只有观众听得见的配乐:乐器、速度、从哪儿进来、在哪儿收住。一个判断办法:片子里的人听得见吗?听得见就归环境声,听不见就归音乐。
non_diegetic_music: N/A
运镜写法:动作、幅度、速度
H3 把运镜当成镜头描述里的一句普通英文来读,由三部分拼起来。
- 动作推进
- 幅度小
- 速度慢
slow push-in, small amplitudestatic hold throughoutcinematic camera work里面没有任何可执行的东西。[Push in][Truck left]这是 Hailuo 02 的写法。H3 不认。
「The camera pushes in with small amplitude at slow speed」是可执行的,「Cinematic camera work」不是。幅度和速度想用中等和正常,那就干脆别写。要是你学的是 Hailuo 02,那套方括号得忘掉:叠标签没有了,方括号现在只用来标镜头编号,运镜由 MiniMax H3 提示词生成器写进句子里。
想要机位锁死就明写 static——一个你从不提起的镜头,模型有权自己动它。另外在纯文字出片上,别导演过度:社群测试的结论是,一段自然的文字胜过一堆技术指令。
一个 MiniMax H3 提示词生成器,五种输入模式
模式决定骨架,所以先选模式。
文字
T2VA
整条时间线都由文字搭出来。
必须给画幅——adaptive 会被拒
首帧
I2VA
你的图打开这个镜头,片子从那里往前长。
首帧+尾帧
FL2VA
两张图,中间那段路交给模型生成。
尾帧
L2VA
描述一段说得通的前情,让片子收束到你那张图上。
真实存在,而且几乎没人写过
参考素材
Ref2VA
素材定义主体;场景照着它们搭。
三种图片模式比基础模式多一句话:一句对齐声明,把每张图钉到它该出现的那一刻。图片模式不看你选的画幅——画幅由图决定。
Ref2VA:六个段落与八个保留标记
参考模式把三个字段换成六个。每份素材都有一个标签,只要有一个标签用了却没定义,整条提示词就作废。summary 段以方括号里的任务类型开头,retention_analysis 给每份参考分配八个标记之一,分成固定的两套——四个视觉,四个音频。两套之间从不交叉。这是整个格式里最难手写的那五分之一,所以表单按素材逐个替你搭。完整的标记说明在参考生视频那一页。
MiniMax H3 提示词生成器在你复制之前跑的那些检查
官方那份 skill 的结尾是一组输出规则,大部分被打回的提示词都是踩了其中一条。所以每一份输出都先查一遍。
- 字段顺序与官方序列一致
- 第一个镜头不带时间戳[Shot 1]
- 每个切点都落在请求的时长里8 秒的片子里出现 00:09.000
- 总长度不超过 API 上限7,000 字符
- 文字模式给了明确画幅adaptive 会被拒
- 每个参考标签都有定义subject_definitions
- 保留标记不跨集合视觉 ≠ 音频
- 描述部分用英文写对白保留自己的语种
- 对白写出原话
- 运镜句三要素齐全
- 图片模式开头有对齐句
- 文字读起来像镜头,不像剧情梗概
校验器给出的一条判定,原样
"the camera pushes in" — names a move but not its amplitude or speed.
这三样 H3 都会执行。试试:slow push-in, small amplitude。
把任何已有的提示词粘进「校验」页签,MiniMax H3 提示词生成器会照同一套规矩过一遍,出错那一行原样引出来,并给出改法。
一条写坏的提示词,通常要花掉一次付费生成才发现。在这儿发现它不花钱。
把 H3 提示词搬到 Veo、Seedance 或者可灵
提示词归你,结构也基本搬得动——但先说那条硬限制。
MiniMax H37,000 字符
Veo 3.11,024 token —— 一份完整的 H3 分镜表塞不下
留一个镜头的描述,去掉字段标签,运镜那句重写。Seedance 读的是 @AssetName 这样的引用,不是标签定义。可灵和其余多数模型要的是一整段描述性文字,所以只把视觉那个字段发过去。
两个声音字段哪儿都去不了——没有第二个主流模型把声音当带标签的字段来收,而这恰恰是 MiniMax H3 提示词生成器大半的用处所在。
是在几个模型之间做选择,不是搬提示词?从MiniMax H3 对比 Veo 3看起。
怎么搭一条 MiniMax H3 提示词
写提示词从不扣积分,所以在生成任何东西之前,这些检查都值得先跑一遍。
选输入模式
T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。模式决定 H3 期待哪些字段、按什么顺序。
五种模式用大白话把想法打进去
一行就够。它会被改写成官方字段顺序,两个音频字段都算上。
不花钱,不用注册读那十二条检查
每条没过的规则都会把踩坏它的那一行引出来,你能看见 H3 本来会忽略掉什么。
出错那行原样引出复制走,或者直接送进文生视频
你改的时候,字符计数器一直盯着 7,000 字符的 API 上限。
7,000 字符上限
已经在别处写好了提示词?「校验」页签会照同样这十二条规则查它,一个字都不改写。
MiniMax H3 提示词生成器常见问题
十一个回答 · 全部摊开 · 一条都不折叠