MiniMax H3 参考生视频

把最多九张图、三段视频和三把嗓音丢给 MiniMax H3,它造出一条新片子,看起来和听起来还是你那一套,4 到 15 秒,768P 或 2K。你不特别说的话,参考图不会变成首帧。

用你自己的素材来造

上传 1–12 个文件 · 视频合计 ≤15 秒 · 音频合计 ≤15 秒

0 / 12 个文件

9 + 3 + 3 是 15,但请求只收 12 个。

还什么都没传,这次请求会悄悄变成纯文字生成。点右边载一套素材包,看看打好标签是什么样。

0 / 7000
免费登录 · 每天 3 条

参考生视频跑在 MiniMax H3 上,免费引擎收不了参考片。要用 H3 跑自己的提示词,$24.9/月 起。

20 条真提示词 · 点「试这条」直接载进来

穿条纹针织衫的金发女人,作为展厅广告两张静图中的第一张2 张静图 · 9:16 · 768P

两张静图,四个空间

你的素材会被怎么用

MiniMax H3 参考生视频到底拿你的素材做了什么

你上传素材,模型造出一个听你话的场景。

MiniMax H3 参考生视频收最多九张图、三段视频和三段音频,总共十二个文件,把每一个都当成约束,而不是起点。你的角色可以带着自己的脸,出现在他从没去过的地方。回来的是 4 到 15 秒、768P 或 2K 的成片,声音已经在 MP4 里。

图片 · 视频 · 音频
9 + 3 + 3

图片 · 视频 · 音频

单次请求的文件数
12

单次请求的文件数

保留标记
8

保留标记

768P 或 2K
4–15 秒

768P 或 2K

  • 你不说就不会当首帧
  • 没有风格强度滑块
  • 不用每个镜头重传一次

文件与主体

文件不等于主体,这是最多人栽的地方

同一个演员的四张照片不是四个参考,是一个主体、被四个文件描述。

  • 一条从参考照片本身开场的片子role · frameAnchor
    <Picture 1>帧锚点标成帧锚点,这张照片就还是它自己那个文件,镜头会从它开场。
  • 同一个人出现在他从没被拍过的场景里role · character
    <Subject 1>身份标成一个身份,同一张照片描述的就是一个人,模型接着把他放到别处去。

MiniMax H3 把这两层分得很清。文件是 `Picture 1`、`Video 1` 或 `Audio 1`,按上传顺序编号;主体是这些文件描述的那个人、那件产品、那个地方。把四张人像归进 `Subject 1`,模型守的是一个身份;不归组,它看到的是四个长得像的人,脸会飘就是从这儿来的。

有个例外几乎人人都栽:某张图确实要当一帧用的话,标成帧锚点,它就保持自己的 `Picture 1` 身份,不并进任何主体。上面两条片子都出自同一张照片。镜头必须从你那张图开始的话,用 图片生视频(英文)

能传什么

能传什么,以及那道 12 个文件的墙

三类素材能进来,每类各有上限:九张图、三段视频、三段音频。

九加三加三是十五,但一次请求只收十二个。你不可能三样都塞满。早点决定谁来扛身份,通常是图片,剩下的额度再围着它花。

图片
≤ 9 · 每张 ≤ 30 MB · JPG · JPEG · PNG · WEBP · HEIC · HEIF
官方
视频
≤ 3 · ≤ 50 MB · 每段 2–15 秒 · 合计 ≤ 15 秒 · MP4 · MOV
官方
音频
≤ 3 · ≤ 15 MB · 每段 2–15 秒 · 合计 ≤ 15 秒 · WAV · MP3
官方
全部类型
≤ 12 个文件 · 单次请求 ≤ 64 MB
官方
输出
4–15 秒,24 帧 · 768P 或 2KMiniMax 自己的 API 接受 4–15 整秒。fal 列的是 5–15。开放权重那条路下限是 5。
官方

参考片可以比你要做的视频长,自己挑好用哪一段就行。什么都不传,这次请求会悄悄变成纯文字生成。提示词框上面那个计数器会按文件数和花费同时盯着。

保留标记

照抄、迁移,还是只做参考?八个保留标记

关于这个模式的抱怨,几乎全出在这儿。你定义的每个标签都有一个归宿,而归宿由你声明。MiniMax H3 参考生视频读两组共八个标记,伸手拿错组就是一个错误。

视觉

给一切看得见的东西,图片和视频。

  • fully_preserved

    原样保留

    脸、戏服、瓶子上的标签。

    同一张脸,同一件大衣,换个城市。

  • partially_preserved

    保留大部分

    还是这个主体,但某些特征变了。

    同一个人,换件大衣。

  • attribute_transfer

    把它挪到别人身上

    把某个特征挪给另一个人:参考片里的那种走路方式,由你的角色来走。

    你的吉祥物,那个舞者的走姿。

  • weak_reference

    只借那个感觉

    配色、质感、构图语言。

    只要那个调,别的都不要。

音频

给声音用。一张图片卡上出现这些选项,那是 bug。

  • fully_copy

    整条音轨都用

    源音轨原封不动成为成片的音轨。

    你那条底噪,不变。

  • partially_copy

    只用其中一层

    保下一层,压在新对白下面。

    留房间声,去掉人声。

  • reference

    对上这把嗓音,但一点都不照抄

    音色、节奏和念法,不复制任何信号。这一个会克隆嗓音。

    新台词,同一个人的嗓子。

  • weak_reference

    只借那个氛围

    只要大致的氛围,别的都不要。

    一个听起来像这样的地方。

标错,就是结果看起来像复印件的原因。把构图标成 `fully_preserved`,模型就把你的构图保下来,这是听话,不是 bug。把身份标成 `fully_preserved`、其余标成 `weak_reference`,场景才打得开。

在每张卡上设好,它会自己写进你的提示词。想给已有的片子换风格?那是 视频改视频(英文)

参考标签

参考标签,和那套六字段提示词

结构不是审美偏好。模型是照六个固定顺序的字段训练出来的,其中两个的存在,纯粹因为你带了素材过来。

  • Field 01subject_definitions

    一个主体一行,给它命名并引用它的上传文件。你写下来的那些特征,就是模型会去守的那些。

    <Subject 1> is the woman in <Picture 1> and <Picture 2>, short dark hair, grey wool coat.

  • Field 02retention_analysis

    一个标签一行,用上面那些标记,并写清它出现在哪些镜头里。这个字段留空,模型就替你决定。

    <Subject 1>: fully_preserved. <Picture 3>: weak_reference, palette only.

  • Fields 03–06summary · overall_soundscape · non_diegetic_music

    系统替你填好、并折叠起来。它们和你的参考素材没关系:文生视频(英文) 那一页才是讲它们的地方。

写 Image 1,别写 @image1

  • Image 1 · Video 1 · Audio 1MiniMax H3
  • @image1Seedance

这条会实打实浪费你的生成次数。`@image1` 是 Seedance 的写法;好几篇教程把它照搬给 MiniMax H3,而 H3 根本不认。素材按上传顺序编号,重排一次,你发出的就是另一个请求。

同一个标签在每个字段里必须写得一模一样,引用没定义过的标签会让请求直接失败。不想自己写?提示词工具(英文) 能从一句话把六个字段都填好。

生成之前

点生成之前,先看这五件事

参考模式是唯一一个连输入都要花钱的模式,所以白跑一次要疼两遍。生成按钮上面那块面板会读你的配置,直接告诉你接下来会发生什么。

  1. 01顺序

    你的上传是按丢进来的先后编号的,而这个编号是请求的一部分。

    顺序:Image 1 · Image 2 · Video 1

  2. 02原声会跟着一起进来

    参考片默认连它自己的音频一起被参考,除非你关掉,这就是为什么会冒出你根本没传过的声音。

    视频 1 会连同它自己的原声一起被参考。

  3. 03音频会被切掉

    片子比嗓音参考短的话,多出来那段直接丢掉。把长度对齐,或者把参考裁短。

    音频有 12 秒,但你的片子是 5 秒,多的会被丢掉。

  4. 04自适应不是承诺

    它是让模型从你的素材里挑个画幅。要竖屏就明写 9:16。

    adaptive 让模型自己挑。你的参考看起来是 16:9。

  5. 05十二

    你还剩几个文件额度。

    12 个文件里已用 7 个。

打算自己跑开放权重?有些规则不一样,见 开放权重指南(英文)

价格 · 每个付费档都出 2K · 音画同生

一条 MiniMax H3 参考生视频要多少钱

参考素材不是白送的,其中一样贵得出乎意料。前五张图不要钱,之后每张四美分;音频不要钱。参考片按它自己的长度、以你的输出档位计费:在一条 8 秒 2K 上挂 10 秒参考,参考比生成本身还贵。把参考片裁到刚好能说明意思的最短一段。在 MiniMax 官方 API 上,先出 768P 再升级也省不到钱,八美分加五美分,正好十三。

跑一次,按你在这儿花的积分算

输出 · 8 秒 2K
480 积分
参考图 · 6 张(前 5 张免费)
每张 4¢
参考片 · 10 秒 2K
按它自己的长度计费
参考音频 · 2 段
0 积分
你的第一条
免费 · 768P

标准消耗速率 · 2K 每秒 20 积分 · 积分数印在每个套餐上 · 套餐费率更低。完整价格

两种付法每月积分一样多

  • 免费不用绑卡

    不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。

    $0永久

    全程不需要信用卡

    免费开始

    只做机器人校验,不要邮箱

    1 条,不用账号

    Agnes Video V2.0 · 16:9 · 5 秒 · 无声
    登录仍然免费,Agnes 引擎每天 3 条,无声

    $9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K

    • MiniMax H3 原生 2K仅付费
    • 声音与画面一起生成仅付费
    • 一条,不用账号
    • 同时跑 1 个任务
    • 失败的片子不花钱
    • 生成内容私有
    • 任意积分包都能解锁 MiniMax H3 的全部模式

    免费档是另一个引擎。看套餐

    速度与排队

    队列
    免费通道
    同时任务数
    1
    批量
    1
    历史保留
    24 小时 · 登录后 7 天
    支持
    社区
  • Lite省 50%

    解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。

    $24.9/mo$49.9

    按年扣 $298.8 · 一年省 $300

    7 天退款 · 随时取消

    每月 1,290 积分 · 约 22 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 17 条

    月付年付,每月积分一样多

    • MiniMax H3 原生 2K:音画同生
    • 对白、音效与配乐在同一个文件里
    • 最长 15 秒15s
    • 每月约 22 条 4 秒 768P 文生视频
    • 失败的片子不花钱
    • 积分未使用可 7 天退款
    • 同时跑 1 个任务
    • 同一条提示词可批量出 2 个版本

    仅限个人与评估用途:为什么

    速度与排队

    队列
    标准
    同时任务数
    1
    批量
    2
    历史保留
    7 天
    支持
    邮件 · 48 小时
  • 多数人推荐
    Pro省 50%

    比 Lite 多 $50。每月约 125 条,同样的 MiniMax H3,队列更快。

    $49.9/mo$99.9

    按年扣 $598.8 · 一年省 $600

    7 天退款 · 随时取消

    每月 4,990 积分 · 约 125 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 84 条

    月付年付,每月积分一样多

    • 包含 Lite 的全部
    • 每月约 125 条 4 秒 768P 文生视频
    • 同时跑 3 个任务
    • 视频反推提示词
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 积分未使用可 7 天退款

    仅限个人与评估用途:为什么

    速度与排队

    队列
    快速
    同时任务数
    3
    批量
    4
    历史保留
    7 天
    支持
    邮件 · 12 小时
  • Studio省 50%

    一整个月的产量,排队最优先,还有 4 小时内回你的真人。

    $99.9/mo$199.9

    按年扣 $1,198.8 · 一年省 $1,200

    7 天退款 · 随时取消

    每月 12,990 积分 · 约 325 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 217 条

    月付年付,每月积分一样多

    • 包含 Pro 的全部
    • 每月约 325 条 4 秒 768P 文生视频
    • 同时跑 8 个任务
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 优先支持,4 小时内响应
    • 我们能给到的最低积分消耗
    • 积分未使用可 7 天退款

    仅限个人与评估用途:为什么

    速度与排队

    队列
    优先,排在最前面
    同时任务数
    8
    批量
    4
    历史保留
    7 天
    支持
    优先 · 4 小时

负责任使用

人脸、嗓音和角色:这几条别踩

参考素材是法律风险真正待着的地方。

  • 人脸用真人的影像要本人同意,公众人物不行,陌生人的照片也不行。
  • 嗓音音色参考会克隆某个具体的人的声音。用你自己的、拿到授权的,或者合成的。
  • 角色受版权保护的角色,不会因为被模型重新生成一遍就变成你的。
  • 未成年人任何涉及未成年人的参考素材,一律不要上传。
  • 内容审核MiniMax 会自动筛查提交的媒体;误判和漏判都可能发生。

完整政策:负责任使用

完整流程

怎么让同一个角色贯穿好几条片子

把文件传上去是简单的那一半。决定身份守不守得住的,是打标签。

  1. 上传你的参考素材

    最多九张图、三段视频、三段音频:单次请求 12 个文件、64 MB。

    ≤12 个文件,≤64 MB
  2. 说清每个文件是干什么的

    主体、图片、帧锚点,还是音色。多个文件可以通过归组来描述同一个身份。

    角色与主体分组
  3. 设定要保留它多少

    视觉与音频两组共八个保留标记,每一份参考都由你决定它被照做到什么程度。

    8 个保留标记
  4. 写提示词,然后生成

    4 到 15 秒,24 帧,768P 或 2K,32 kHz 立体声与画面一起生成。

    参考素材的顺序有影响

每次请求含五张参考图;超出的每张扣 20 积分。

大家真正会问的问题

MiniMax H3 参考生视频常见问题

十个答案 · 全部展开 · 没有折叠

MiniMax H3 参考生视频是什么?

它按你上传的素材造出一个新场景,九张图、三段视频、三段音频,总共十二个,而不是让一张图动起来。

能用几张参考图?为什么我的角色还是崩了?

九张。崩掉通常是因为没归组:同一个人的好几张照片是一个主体,不是好几个参考。

为什么片子里有我根本没传过的声音?

参考片默认连同它自己的原声一起被参考。在那张卡上关掉,它就只用运动。

@image1 能用吗?参考顺序有讲究吗?

不能用,以及有讲究。素材按上传顺序是 Image 1、Video 1、Audio 1,这个顺序是请求的一部分。

只用音频当参考行吗?

在这儿行,一段音频就是一个合法请求。在开放权重上,音频必须和一张图或一段视频一起走。

能克隆嗓音吗?

音色参考可以让一个角色用那把嗓音念新台词。只用你有权使用的嗓音。

输出带声音吗?

带,32 kHz 立体声,与画面一起生成,不管你有没有提供音频参考。

怎么计费?

按输出秒数,再加参考素材:前五张之后每张图四美分,参考片按它自己的长度算,音频免费。

需要注册吗?出来的片子有声音吗?

参考生视频跑在 MiniMax H3 上。免费登录送 30 积分,然后在 /pricing 解锁 H3。免费引擎出的片是无声的;H3 会把音频和画面一起做出来。

这些视频能商用吗?

在本站生成的不能。这里生成的一切仅限个人与评估用途,所有档位包括免费档都是如此。我们是独立第三方界面,没有立场把输出的商用权利授予你。要用于商业项目,请到 MiniMax 自己的海螺产品或官方 API 上生成,那两条路带商用条款。以上是概述,不构成法律意见。

带一个角色过来,试出答案。

参考生视频跑在 MiniMax H3 上。免费登录送 30 积分,然后在 /pricing 解锁 H3。

免费生成 · 排队

由 MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新