MiniMax H3 参考生视频
把最多九张图、三段视频和三把嗓音丢给 MiniMax H3,它造出一条新片子,看起来和听起来还是你那一套,4 到 15 秒,768P 或 2K。你不特别说的话,参考图不会变成首帧。
20 条真提示词 · 点「试这条」直接载进来
2 张静图 · 9:16 · 768P两张静图,四个空间
MiniMax H3 参考生视频
到底拿你的素材做了什么
你上传素材,模型造出一个听你话的场景。
MiniMax H3 参考生视频收最多九张图、三段视频和三段音频,总共十二个文件,把每一个都当成约束,而不是起点。你的角色可以带着自己的脸,出现在他从没去过的地方。回来的是 4 到 15 秒、768P 或 2K 的成片,声音已经在 MP4 里。
- 图片 · 视频 · 音频
- 9 + 3 + 3
- 单次请求的文件数
- 12
- 保留标记
- 8
- 768P 或 2K
- 4–15 秒
图片 · 视频 · 音频
单次请求的文件数
保留标记
768P 或 2K
- 你不说就不会当首帧
- 没有风格强度滑块
- 不用每个镜头重传一次
文件不等于主体,这是最多人栽的地方
同一个演员的四张照片不是四个参考,是一个主体、被四个文件描述。
role · frameAnchor<Picture 1>帧锚点标成帧锚点,这张照片就还是它自己那个文件,镜头会从它开场。
role · character<Subject 1>身份标成一个身份,同一张照片描述的就是一个人,模型接着把他放到别处去。
MiniMax H3 把这两层分得很清。文件是 `Picture 1`、`Video 1` 或 `Audio 1`,按上传顺序编号;主体是这些文件描述的那个人、那件产品、那个地方。把四张人像归进 `Subject 1`,模型守的是一个身份;不归组,它看到的是四个长得像的人,脸会飘就是从这儿来的。
有个例外几乎人人都栽:某张图确实要当一帧用的话,标成帧锚点,它就保持自己的 `Picture 1` 身份,不并进任何主体。上面两条片子都出自同一张照片。镜头必须从你那张图开始的话,用 图片生视频(英文)。
能传什么,以及那道 12 个文件的墙
三类素材能进来,每类各有上限:九张图、三段视频、三段音频。
九加三加三是十五,但一次请求只收十二个。你不可能三样都塞满。早点决定谁来扛身份,通常是图片,剩下的额度再围着它花。
参考片可以比你要做的视频长,自己挑好用哪一段就行。什么都不传,这次请求会悄悄变成纯文字生成。提示词框上面那个计数器会按文件数和花费同时盯着。
照抄、迁移,还是只做参考?八个保留标记
关于这个模式的抱怨,几乎全出在这儿。你定义的每个标签都有一个归宿,而归宿由你声明。MiniMax H3 参考生视频读两组共八个标记,伸手拿错组就是一个错误。
视觉
给一切看得见的东西,图片和视频。
fully_preserved原样保留
脸、戏服、瓶子上的标签。
同一张脸,同一件大衣,换个城市。
partially_preserved保留大部分
还是这个主体,但某些特征变了。
同一个人,换件大衣。
attribute_transfer把它挪到别人身上
把某个特征挪给另一个人:参考片里的那种走路方式,由你的角色来走。
你的吉祥物,那个舞者的走姿。
weak_reference只借那个感觉
配色、质感、构图语言。
只要那个调,别的都不要。
音频
给声音用。一张图片卡上出现这些选项,那是 bug。
fully_copy整条音轨都用
源音轨原封不动成为成片的音轨。
你那条底噪,不变。
partially_copy只用其中一层
保下一层,压在新对白下面。
留房间声,去掉人声。
reference对上这把嗓音,但一点都不照抄
音色、节奏和念法,不复制任何信号。这一个会克隆嗓音。
新台词,同一个人的嗓子。
weak_reference只借那个氛围
只要大致的氛围,别的都不要。
一个听起来像这样的地方。
标错,就是结果看起来像复印件的原因。把构图标成 `fully_preserved`,模型就把你的构图保下来,这是听话,不是 bug。把身份标成 `fully_preserved`、其余标成 `weak_reference`,场景才打得开。
在每张卡上设好,它会自己写进你的提示词。想给已有的片子换风格?那是 视频改视频(英文)。
参考标签,和那套六字段提示词
结构不是审美偏好。模型是照六个固定顺序的字段训练出来的,其中两个的存在,纯粹因为你带了素材过来。
subject_definitions一个主体一行,给它命名并引用它的上传文件。你写下来的那些特征,就是模型会去守的那些。
<Subject 1> is the woman in <Picture 1> and <Picture 2>, short dark hair, grey wool coat.
retention_analysis一个标签一行,用上面那些标记,并写清它出现在哪些镜头里。这个字段留空,模型就替你决定。
<Subject 1>: fully_preserved. <Picture 3>: weak_reference, palette only.
summary · overall_soundscape · non_diegetic_music系统替你填好、并折叠起来。它们和你的参考素材没关系:文生视频(英文) 那一页才是讲它们的地方。
写 Image 1,别写 @image1
Image 1 · Video 1 · Audio 1MiniMax H3@image1Seedance
这条会实打实浪费你的生成次数。`@image1` 是 Seedance 的写法;好几篇教程把它照搬给 MiniMax H3,而 H3 根本不认。素材按上传顺序编号,重排一次,你发出的就是另一个请求。
同一个标签在每个字段里必须写得一模一样,引用没定义过的标签会让请求直接失败。不想自己写?提示词工具(英文) 能从一句话把六个字段都填好。
点生成之前,先看这五件事
参考模式是唯一一个连输入都要花钱的模式,所以白跑一次要疼两遍。生成按钮上面那块面板会读你的配置,直接告诉你接下来会发生什么。
顺序
你的上传是按丢进来的先后编号的,而这个编号是请求的一部分。
顺序:Image 1 · Image 2 · Video 1
原声会跟着一起进来
参考片默认连它自己的音频一起被参考,除非你关掉,这就是为什么会冒出你根本没传过的声音。
视频 1 会连同它自己的原声一起被参考。
音频会被切掉
片子比嗓音参考短的话,多出来那段直接丢掉。把长度对齐,或者把参考裁短。
音频有 12 秒,但你的片子是 5 秒,多的会被丢掉。
自适应不是承诺
它是让模型从你的素材里挑个画幅。要竖屏就明写 9:16。
adaptive 让模型自己挑。你的参考看起来是 16:9。
十二
你还剩几个文件额度。
12 个文件里已用 7 个。
打算自己跑开放权重?有些规则不一样,见 开放权重指南(英文)。
一条 MiniMax H3 参考生视频要多少钱
参考素材不是白送的,其中一样贵得出乎意料。前五张图不要钱,之后每张四美分;音频不要钱。参考片按它自己的长度、以你的输出档位计费:在一条 8 秒 2K 上挂 10 秒参考,参考比生成本身还贵。把参考片裁到刚好能说明意思的最短一段。在 MiniMax 官方 API 上,先出 768P 再升级也省不到钱,八美分加五美分,正好十三。
跑一次,按你在这儿花的积分算
- 输出 · 8 秒 2K
- 480 积分
- 参考图 · 6 张(前 5 张免费)
- 每张 4¢
- 参考片 · 10 秒 2K
- 按它自己的长度计费
- 参考音频 · 2 段
- 0 积分
- 你的第一条
- 免费 · 768P
标准消耗速率 · 2K 每秒 20 积分 · 积分数印在每个套餐上 · 套餐费率更低。完整价格
两种付法每月积分一样多
- 免费不用绑卡
不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。
$0永久全程不需要信用卡
免费开始只做机器人校验,不要邮箱
1 条,不用账号
Agnes Video V2.0 · 16:9 · 5 秒 · 无声
登录仍然免费,Agnes 引擎每天 3 条,无声$9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K
- MiniMax H3 原生 2K仅付费
- 声音与画面一起生成仅付费
- 一条,不用账号
- 同时跑 1 个任务
- 失败的片子不花钱
- 生成内容私有
- 任意积分包都能解锁 MiniMax H3 的全部模式
免费档是另一个引擎。看套餐
速度与排队
- 队列
- 免费通道
- 同时任务数
- 1
- 批量
- 1
- 历史保留
- 24 小时 · 登录后 7 天
- 支持
- 社区
- Lite省 50%
解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。
$24.9/mo$49.9按年扣 $298.8 · 一年省 $300
7 天退款 · 随时取消
每月 1,290 积分 · 约 22 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 17 条
月付年付,每月积分一样多
- MiniMax H3 原生 2K:音画同生
- 对白、音效与配乐在同一个文件里
- 最长 15 秒15s
- 每月约 22 条 4 秒 768P 文生视频
- 失败的片子不花钱
- 积分未使用可 7 天退款
- 同时跑 1 个任务
- 同一条提示词可批量出 2 个版本
仅限个人与评估用途:为什么
速度与排队
- 队列
- 标准
- 同时任务数
- 1
- 批量
- 2
- 历史保留
- 7 天
- 支持
- 邮件 · 48 小时
- 多数人推荐Pro省 50%
比 Lite 多 $50。每月约 125 条,同样的 MiniMax H3,队列更快。
$49.9/mo$99.9按年扣 $598.8 · 一年省 $600
7 天退款 · 随时取消
每月 4,990 积分 · 约 125 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 84 条
月付年付,每月积分一样多
- 包含 Lite 的全部
- 每月约 125 条 4 秒 768P 文生视频
- 同时跑 3 个任务3×
- 视频反推提示词
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 积分未使用可 7 天退款
仅限个人与评估用途:为什么
速度与排队
- 队列
- 快速
- 同时任务数
- 3
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 邮件 · 12 小时
- Studio省 50%
一整个月的产量,排队最优先,还有 4 小时内回你的真人。
$99.9/mo$199.9按年扣 $1,198.8 · 一年省 $1,200
7 天退款 · 随时取消
每月 12,990 积分 · 约 325 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 217 条
月付年付,每月积分一样多
- 包含 Pro 的全部
- 每月约 325 条 4 秒 768P 文生视频
- 同时跑 8 个任务8×
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 优先支持,4 小时内响应
- 我们能给到的最低积分消耗
- 积分未使用可 7 天退款
仅限个人与评估用途:为什么
速度与排队
- 队列
- 优先,排在最前面
- 同时任务数
- 8
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 优先 · 4 小时
人脸、嗓音和角色:这几条别踩
参考素材是法律风险真正待着的地方。
- 人脸用真人的影像要本人同意,公众人物不行,陌生人的照片也不行。
- 嗓音音色参考会克隆某个具体的人的声音。用你自己的、拿到授权的,或者合成的。
- 角色受版权保护的角色,不会因为被模型重新生成一遍就变成你的。
- 未成年人任何涉及未成年人的参考素材,一律不要上传。
- 内容审核MiniMax 会自动筛查提交的媒体;误判和漏判都可能发生。
怎么让同一个角色贯穿好几条片子
把文件传上去是简单的那一半。决定身份守不守得住的,是打标签。
上传你的参考素材
最多九张图、三段视频、三段音频:单次请求 12 个文件、64 MB。
≤12 个文件,≤64 MB说清每个文件是干什么的
主体、图片、帧锚点,还是音色。多个文件可以通过归组来描述同一个身份。
角色与主体分组设定要保留它多少
视觉与音频两组共八个保留标记,每一份参考都由你决定它被照做到什么程度。
8 个保留标记写提示词,然后生成
4 到 15 秒,24 帧,768P 或 2K,32 kHz 立体声与画面一起生成。
参考素材的顺序有影响
每次请求含五张参考图;超出的每张扣 20 积分。
MiniMax H3 参考生视频常见问题
十个答案 · 全部展开 · 没有折叠
