MiniMax H3 提示词生成器

一句话说清想法,拿回 H3 受训时就在读的那三个字段——先画面,后声音。

你打算在哪儿用?模式一换,字段骨架就跟着换。

不用注册。从不扣积分。

从哪起步 , , , , , 或者载入一个写好的例子: , ,

不花钱。不用注册。从不扣积分。

你的结构化提示词

  • integrated_multimodal_description
  • overall_soundscape
  • non_diegetic_music

检查项12 条规则,复制之前先跑一遍

  • 字段顺序与官方序列一致
  • [Shot 1] 上不带时间戳
  • 运镜句点了动作,但没写幅度和速度the camera pushes in

灰色的骨架就是真实格式——基础模式三个字段,参考模式六个。

0 / 7,000 characters

你在本站的第一条片子免费——不用绑卡。

你会拿到什么

MiniMax H3 提示词生成器 会回给你什么

一条 H3 能直接执行的提示词,不是一段它得先去猜的话。

MiniMax H3 提示词生成器 接过一句大白话的想法,照这个模型受训时读到的样子重写一遍:先是一镜一镜的画面描述,然后是场景的声音,最后是配乐,顺序固定。市面上多数 AI 视频提示词生成器给你的还是一整块默片式的散文,要么就是一张二十格的表单,逼你自己去做结构化。这一个只要一句话,结构它替你写,再照官方规则查一遍,而且从头到尾不问你要账号。

输入
1

输入

输出字段
3 / 6

输出字段

校验规则
12

校验规则

字符上限
7,000

字符上限

  • 没有二十格表单
  • 不用注册
  • 不扣积分

格式

三字段提示词结构,按 H3 期待的顺序

这个格式不是我们定的。它来自 MiniMax 2026 年 8 月发布在 H3 GitHub 仓库里的 h3-prompt-writing skill,附带的参考文件把字段、顺序和规则都钉死了。在 MiniMax 自己的管线里,有一个叫 Context-IR 的托管环节会先把你打的任何字改写成这个结构,模型才看到它——而官方给「不走那个 API」的人的建议是:预处理自己搭。这一页就是那个自己搭的,跑在浏览器里。

  1. integrated_multimodal_description画面,一镜一镜写。
  2. overall_soundscape这个场景本身听起来是什么样。
  3. non_diegetic_music配乐,没有就写「N/A」。

[Shot 1]、时间戳和对白

镜头要编号,从第二个镜头起每一个切点都要带时间戳,第一个镜头永远不带。每个镜头内部的官方顺序是:构图、主体、环境、动作、运镜、声音。对白也住在这里:身份和语气写在标签外面,原话写在标签里面。写成「她说了句动人的话」,H3 就自己编一句——很少是你想要的那句。这个字段大约会占掉整条提示词的六成,也占掉大部分被打回的原因。

(S1) says: <d>[English] Follow the wind.</d>

overall_soundscape 与 non_diegetic_music

结尾这两个字段,是那些围着无声模型做的工具从来不写的。环境声是场景自己发出来的声音——雨打在布上、马克杯放下、两条街外的车流——带着距离和落点时间。音乐字段是只有观众听得见的配乐:乐器、速度、从哪儿进来、在哪儿收住。一个判断办法:片子里的人听得见吗?听得见就归环境声,听不见就归音乐。

non_diegetic_music: N/A

运镜写法

运镜写法:动作、幅度、速度

H3 把运镜当成镜头描述里的一句普通英文来读,由三部分拼起来。

  • 动作推进
  • 幅度
  • 速度
  • slow push-in, small amplitude
  • static hold throughout
  • cinematic camera work里面没有任何可执行的东西。
  • [Push in][Truck left]这是 Hailuo 02 的写法。H3 不认。

「The camera pushes in with small amplitude at slow speed」是可执行的,「Cinematic camera work」不是。幅度和速度想用中等和正常,那就干脆别写。要是你学的是 Hailuo 02,那套方括号得忘掉:叠标签没有了,方括号现在只用来标镜头编号,运镜由 MiniMax H3 提示词生成器写进句子里。

想要机位锁死就明写 static——一个你从不提起的镜头,模型有权自己动它。另外在纯文字出片上,别导演过度:社群测试的结论是,一段自然的文字胜过一堆技术指令。

五种输入模式

一个 MiniMax H3 提示词生成器,五种输入模式

模式决定骨架,所以先选模式。

  • 文字

    T2VA
    一个完全由文字搭起来的镜头

    整条时间线都由文字搭出来。

    必须给画幅——adaptive 会被拒

  • 首帧

    I2VA
    一张当作开场帧用的照片

    你的图打开这个镜头,片子从那里往前长。

  • 首帧+尾帧

    FL2VA
    两张图,中间那段路由模型生成

    两张图,中间那段路交给模型生成。

  • 尾帧

    L2VA
    一条片子收束到你给的最后一帧

    描述一段说得通的前情,让片子收束到你那张图上。

    真实存在,而且几乎没人写过

  • 参考素材

    Ref2VA
    用来定义主体的参考素材

    素材定义主体;场景照着它们搭。

三种图片模式比基础模式多一句话:一句对齐声明,把每张图钉到它该出现的那一刻。图片模式不看你选的画幅——画幅由图决定。

Ref2VA:六个段落与八个保留标记

参考模式把三个字段换成六个。每份素材都有一个标签,只要有一个标签用了却没定义,整条提示词就作废。summary 段以方括号里的任务类型开头,retention_analysis 给每份参考分配八个标记之一,分成固定的两套——四个视觉,四个音频。两套之间从不交叉。这是整个格式里最难手写的那五分之一,所以表单按素材逐个替你搭。完整的标记说明在参考生视频那一页。

  1. subject_definitions
  2. summary
  3. retention_analysis
  4. detailed_description
  5. overall_soundscape
  6. non_diegetic_music

校验器

MiniMax H3 提示词生成器在你复制之前跑的那些检查

官方那份 skill 的结尾是一组输出规则,大部分被打回的提示词都是踩了其中一条。所以每一份输出都先查一遍。

  • 字段顺序与官方序列一致
  • 第一个镜头不带时间戳[Shot 1]
  • 每个切点都落在请求的时长里8 秒的片子里出现 00:09.000
  • 总长度不超过 API 上限7,000 字符
  • 文字模式给了明确画幅adaptive 会被拒
  • 每个参考标签都有定义subject_definitions
  • 保留标记不跨集合视觉 ≠ 音频
  • 描述部分用英文写对白保留自己的语种
  • 对白写出原话
  • 运镜句三要素齐全
  • 图片模式开头有对齐句
  • 文字读起来像镜头,不像剧情梗概

校验器给出的一条判定,原样

"the camera pushes in" — names a move but not its amplitude or speed.

这三样 H3 都会执行。试试:slow push-in, small amplitude。

把任何已有的提示词粘进「校验」页签,MiniMax H3 提示词生成器会照同一套规矩过一遍,出错那一行原样引出来,并给出改法。

一条写坏的提示词,通常要花掉一次付费生成才发现。在这儿发现它不花钱。

反过来走

视频反推提示词:片子已经有了的时候

上面讲的都是从想法到提示词。这一段是同一条路反着走。

  • 这一页

    一行大白话三个字段,按顺序

  • 视频反推提示词

    分镜表、运镜路径、两个声音字段你手上已经有的一条片子

手上有一条片子,想要那条能做出同类片子的提示词——分镜表、运镜路径和两个声音字段,全部从素材里读回来。倒挡是另一个工具:去视频反推提示词粘个链接,再把结果拿回这边改。

如果目标是留住原来的取景或者配乐,那就别写提示词了,把片子直接喂给参考模式

拿去别处用

把 H3 提示词搬到 Veo、Seedance 或者可灵

提示词归你,结构也基本搬得动——但先说那条硬限制。

  • MiniMax H37,000 字符

  • Veo 3.11,024 token —— 一份完整的 H3 分镜表塞不下

留一个镜头的描述,去掉字段标签,运镜那句重写。Seedance 读的是 @AssetName 这样的引用,不是标签定义。可灵和其余多数模型要的是一整段描述性文字,所以只把视觉那个字段发过去。

两个声音字段哪儿都去不了——没有第二个主流模型把声音当带标签的字段来收,而这恰恰是 MiniMax H3 提示词生成器大半的用处所在。

是在几个模型之间做选择,不是搬提示词?从MiniMax H3 对比 Veo 3看起。

完整流程

怎么搭一条 MiniMax H3 提示词

写提示词从不扣积分,所以在生成任何东西之前,这些检查都值得先跑一遍。

  1. 选输入模式

    T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。模式决定 H3 期待哪些字段、按什么顺序。

    五种模式
  2. 用大白话把想法打进去

    一行就够。它会被改写成官方字段顺序,两个音频字段都算上。

    不花钱,不用注册
  3. 读那十二条检查

    每条没过的规则都会把踩坏它的那一行引出来,你能看见 H3 本来会忽略掉什么。

    出错那行原样引出
  4. 复制走,或者直接送进文生视频

    你改的时候,字符计数器一直盯着 7,000 字符的 API 上限。

    7,000 字符上限

已经在别处写好了提示词?「校验」页签会照同样这十二条规则查它,一个字都不改写。

大家真会问的问题

MiniMax H3 提示词生成器常见问题

十一个回答 · 全部摊开 · 一条都不折叠

MiniMax H3 提示词生成器是什么?

它把一句大白话的想法变成 MiniMax H3 期待的那种结构化、带标签的提示词——基础模式三个字段,参考模式六个——并在你复制之前照官方输出规则校验一遍。

这是官方格式吗?

是。MiniMax H3 提示词生成器照的是官方那份 h3-prompt-writing skill 和它的参考文件。工具本身是独立的;我们不是 MiniMax。

Context-IR 是什么,我还需要它吗?

Context-IR 是 MiniMax 托管的一个环节,负责把输入改写成这个结构,按 token 计费。这一页就是官方建议里说的「自己搭」的那个替代方案。走大批量 API 管线的人可能还是更愿意用它。

一条 H3 提示词该写多长?

通常越长越具体越占便宜,上限是 API 的 7,000 字符。MiniMax 自己的 Context-IR 示例就是把很短的想法扩成好几千 token。

必须用英文写吗?

描述部分是的。对白、歌词和画面上出现的文字保留原来的语种——这是官方规则。

对白怎么写?

说话人编号、语气,然后把原话放进语种标签里:(S1) says: <d>[English] your line here.</d> 身份写在标签外面。有十一种语言的支持是稳定的。

运镜怎么写?

三部分写进一句话:动作类型、幅度、速度。「The camera pushes in with small amplitude at slow speed」能执行;「dynamic camera work」不能。

环境声字段和音乐字段怎么分?

看片子里的人听不听得见。场景里真实存在的声音归环境声;只有观众听得见的配乐归音乐。

我的时间戳为什么被打回?

与请求时长矛盾的时间安排,违反的是一条明写的官方规则。校验器会在你复制之前标出来——包括那个经典错误:第一个镜头上带了时间戳。

它能把视频变成提示词吗?

这一页不行——那是视频反推提示词,反向的那个工具。把片子粘到那边,它会把分镜表和两个声音字段读回来。

是免费的吗,提示词能带走吗?

不花钱,不用注册,写提示词从不扣积分。提示词归你:粘进我们的文生视频、MiniMax API、Hailuo、ComfyUI,哪儿都行。有合理使用的速率限制,保证它一直快。

一行话进去,官方字段顺序出来。

不花钱,不用注册,提示词带到哪儿都归你。

免费生成 · 排队

由 MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新