MiniMax H3 视频反推提示词
看一条片子,拿回一条能做出同类片子的提示词——三个字段齐全,顺序照 H3 的规矩排。
你的结构化提示词
integrated_multimodal_description分镜 · 运镜 · 对白overall_soundscape这个场景自己发出的声音non_diegetic_music没有就写 None。
拆成字段,不是一段散文——时间戳已经重排好了。
拿一条样片试试: , , ,
你在本站的第一条片子免费——不用绑卡。
MiniMax H3 视频反推提示词
到底反推出什么
给的是一条提示词,不是一句配文。

你的片子
按字段读出来,不是一段散文
MiniMax H3 视频反推提示词 会把你的片子看一遍——画面和声音都看——再写回一条能做出同类片子的结构化提示词:一份带编号、带运镜和时间戳的分镜表,场景本身的声音,还有配乐,装进 H3 会读的那三个带标签的字段里。通用工具回给你的是一段关于画面的话。H3 不吃整段话,而且你这条片子有一半的内容是听出来的。粘个链接或者拖个文件进来;每周第一次反推不用注册。
- 通读遍数
- 7
- 输出字段数
- 3
- 可读源片长度
- ≤ 60 秒
- 时间戳重排到
- 4–15 秒
通读遍数
输出字段数
可读源片长度
时间戳重排到
- 不抽关键帧
- 不给一段散文
- 不用注册
大家从参考片里拿走的五样东西
先说清你要哪一样,才知道哪一遍通读最要紧、措辞要精确到什么程度,以及一条写出来的提示词是不是根本就不该是答案。
风格
调色
调色、光、质感——东西还没动之前的那个样子。
构图
取景
取景与走位:东西摆在哪儿,眼睛沿着什么路线走。
运动
路径
调度与运镜路径,写成类型、幅度、速度三样。
声音
混音
让它听起来很贵的那套混音,分三层写。
人物
是谁
画面里的是谁——也是唯一一个要先拿到同意的目标。
肖像界线见下
一条舞蹈片和一支香水广告可能共用同一套调色,但你反推它们的理由正好相反——前者要的是运动,后者要的是光。在反推器里选好目标,重点就跟着挪。
从素材到字段:七遍通读
这次反推读一个镜头的顺序,和官方提示词指南要求你写一个镜头的顺序是一样的:构图、主体、环境、动作、运镜、声音——以及每样被提到的东西究竟在哪一秒出现。
切点
一共几个镜头,切在哪里。
[Shot n] · At 00:0x.xxx
构图
景别与机位高度,逐个镜头读。
每个镜头的开头
主体
具体到一个陌生人照着能画出来——「三十出头的女性,黑色齐耳短发,宽大的灰色风衣」,而不是「一个女人」。
主体描述
环境
地点、天气,还有光从哪个方向来。H3 把光当物理量处理,所以「窗光从画面左侧进来」比「光影很美」有用得多。
环境描述
动作
到底发生了什么,按先后顺序写。
动作描述
运镜
按 H3 执行它的方式写:类型、幅度、速度。「缓慢推进,小幅度」能活着走完全程;「流畅的电影感运动」不行——里面没有任何可执行的东西。
运镜描述
声音
下面那三层,也是别的工具全都跳过的那一遍。
两个声音字段 + 对白
你这条片子正在发出的三种声音
关键帧工具抽的是静帧,等于把你的片子静音之后再分析。
这里的反推是真在听,而且把听到的东西分成三份,因为 H3 对每一层的处理位置都不一样。后两层怎么区分,只需要问一句:片子里的人听得见吗?

对白
人真正说出口的话,逐句转写,带说话人编号、语气和语种标签,落在镜头描述里面。
(S1) says warmly, [English] …
环境声
场景自己产生的一切:雨打在雨棚上、刀落在砧板上、两条街外的车流——每个声源都带一个距离和一个落点时间。
overall_soundscape
配乐
只有观众听得见的那一层:乐器、速度、在哪儿推起来、在哪儿停。片子里没有配乐,这一格就写 None——这本身也是 H3 会照办的一条指令。
non_diegetic_music
这一刀切下去,就是为什么 MiniMax H3 视频反推提示词的结果末尾会挂着两个声音字段,也是为什么少了它们的结果等于把这个模型浪费掉一半。
30 秒的片子塞不进 15 秒的表
H3 只出 4 到 15 秒,而你的参考片多半不在这个区间里。
你的参考片30 秒 —— 掐掉水词,节拍重新分布
H3 出片4–15 秒,24 fps
把它的时间戳原样搬过去,会直接违反一条明写的官方规则——与请求时长矛盾的时间安排会被打回——所以反推器改成重排。选一个目标时长,要紧的节拍(切点、动作峰值、声音事件)留下并重新分布。或者干脆从源片里拖出一段,只取那一段;紧凑的四秒通常比松垮的三十秒更好反推。
测试里得出两个能直接用的数:一个带真实动作变化的镜头大约要三秒,一个静态的情绪镜头两秒就够——所以八秒装得下大约两个镜头,十五秒大约三个。选段器会把它留下的节拍和丢掉的节拍都标出来,机器的品味你可以一票否决。
帧按 H3 的 17n+5 网格在 24 fps 上对齐,每一个重排过的时间戳都会在你复制之前跟你选的时长核对一遍。
什么时候 MiniMax H3 视频反推提示词是错的工具
要留住就交文件,要重做才写提示词。
想学它
这条片子为什么好看?就这一页
想做一条像它的
一条带着它那股劲儿的新片子就这一页
想留住
留住原来的取景、光或者配乐参考生视频
想改它
给真实素材换声音,或者接着往下拍视频转绘
传不上去
别人的素材,或者不能外传的内容只有这一页走得通
提示词是一段描述,而描述是故意有损的。目标要是搞懂这条片子为什么好看,或者做一条带着它那股劲儿的新片,这份损耗正是你要的。目标要是留住原来的取景、打光或者配乐,就别再描述了,直接把片子交给 H3——参考模式是保住原物,重写只能逼近;给真实素材换声音或者接着往下拍,那是视频转绘的活。
提示词是唯一出路的情况只有一种:源片根本传不上去——别人的素材、不能外传的内容——因为你自己写出来的描述归你,一份拷贝永远做不到这一点。
复刻别人的片子:界线画在哪里
风格不受保护,某一部具体作品受保护。
- 风格看出这条片子吃的是黄昏光加一个缓慢推进,没问题。
- 某一部具体作品把一部认得出来的作品一个镜头一个镜头复刻出来,不行。
- 真实的人把一个真实、能认出来的人描述给模型,也不行。
- 音乐写情绪和配器;不要去重建某一首具体的歌。
- 商标与产品不管视频是怎么做出来的,它们都受保护。你的成片要是会被认成别人的东西,先去问对方。
怎么把一条参考片变成 MiniMax H3 提示词
它读的是画面和声音,不是抽出来的关键帧——所以声音才能自己成一组字段回来。
粘链接,或者传一条片子
60 秒、50 MB 以内。直链和文件一样好使。
≤60 秒,≤50 MB让七遍通读跑完
切点、构图、主体、环境、动作、运镜、声音,分开读。
七遍通读看分镜表和那两个声音字段
对白会带着说话人编号、语气和语种标签转写回来;环境声与配乐各自独立。
官方字段顺序把重排好的提示词拿走
时间戳会从你片子的长度重排到 4–15 秒的目标上,所以结果拿去就能跑。
重排到 4–15 秒
不注册每周 1 次反推,登录后 3 次,之后每次 5 积分。
MiniMax H3 视频反推提示词常见问题
十二个回答 · 全部摊开 · 一条都不折叠