MiniMax H3 图片生视频
丢一张照片进来,说清楚接下来该发生什么。你拿回一条 4 到 15 秒、最高 2K 的成片,声音已经在文件里。而且你不只能定它从哪开始,还能定它在哪结束。
20 条真提示词 · 点「试这条」直接载进来
首帧 · 21:9 · 768P围着一张静态图螺旋运镜
MiniMax H3 图片生视频
拿你的照片做了什么
你的照片会成为真正的第一帧,不是拿来参考画风,就是这条镜头的开头本身。

第 001 帧 · 你的
按你描述的内容生成
从这一帧开始,MiniMax H3 图片生视频照你写的方式移动镜头和主体,时长 4 到 15 秒任意整秒,24 帧,768P 或 2K。JPG、PNG、WEBP、HEIC 都收,手机里直接拿出来的照片就能用。
- 你的照片就是第一帧
- 001
- 任意整秒
- 4–15 秒
- 帧率
- 24 fps
- 分辨率
- 768P / 2K
你的照片就是第一帧
任意整秒
帧率
分辨率
- 不做风格迁移
- 没有强度滑块
- 不用把照片再描述一遍
从这儿开始、在这儿结束,还是两头都定?
三种跑法怎么挑
多数工具给你一个上传框就叫图片生视频。这里给三个,而且第二个几乎没人做。按你的确定性挑:知道怎么开场,给首帧;知道落在哪,给尾帧;两头都知道,就都给,中间交给 H3 接。
从这里开始
I2VA
一张照片当首帧,视频从它开场往前走。想让产品在展台上转起来、让人像开口说话、让风景动起来,用这个。
该怎么写
写「接下来发生什么」,别写「画面里有什么」,模型自己看得见那张图。把照片内容重列一遍,等于把唯一那次下指令的机会浪费了。
- 少见
在这里结束
L2VA
一张照片当尾帧。把结局交给它,H3 会自己推一个说得通的开头,最后一帧正好收在你这张图上。做「揭晓」就靠这个:盖子掀开,稳稳落在你手上那张产品图。
该怎么写
倒着写:要让这张图当最后一帧,前面各样东西得是什么状态,然后让动作收进去。
开始 → 结束
FL2VA

两张照片,一头一尾,中间那段路 H3 帮你补。前后对比、变形、换场都行。两张图在主体、构图和光线上越接近,中间就越干净。
该怎么写
两张差太远的话,把中间发生了什么写清楚,否则 H3 会自己编一个你没要的过渡。
更多跑通过的配置在 提示词灵感(英文),每一条都带着完整的结构化提示词。提示词工具(英文) 还能从一句话把三个官方字段都写出来。
它会不会把我的脸改了?
一句话锁住你的主体
这是大家问的第一个问题。用同一张照片跑两次,答案自己就出来了。
这问题问得有道理。提示词只写运动的话,你没描述的一切都是敞开的,模型可以在第三秒前后随手重新发明。脸会飘,logo 会糊,一个红瓶子会变成另一个略微不同的红瓶子。
解法是一句话,而且它写在提示词里,不在某个设置里。像对一个看不见它的人那样描述你的主体:头发、衣服、材质、颜色、logo 在哪,然后说这些整条都不许变。锁住外观会照你输入的内容替你写好这句。粘在任何提示词末尾,漂移就明显降下来,三种定帧方式都管用。

大衣的织法变了,发际线也挪了。提示词里没有一句说它们不该变。

同样的运镜、同样的时长、同样的条件。唯一的变量就是那一句。
两次之间唯一的差别
The subject — red wool coat, dark fringe, silver ring on the left hand — keeps the same face, hair, clothing and colours throughout; only the camera and the described motion change.
把不许变的东西打进来。下面那句就是会接到你提示词后面的内容。
会接在你提示词的末尾
The subject keeps the same face, hair, clothing and colours throughout; only the camera and the described motion change.
如果你要的是同一个人出现在好几条独立的片子里,而不是在同一条里保持不变,那首帧就用错工具了。那是身份问题,不是构图问题,参考生视频(英文) 才是干这个的。
什么样的图片能用,什么样的会被打回
下面每个数值都链到一手来源,而这一页顶部那个上传框会在你花钱之前先把五项全查一遍。
iPhone 照片直接传。HEIC 和 HEIF 直接进,这一点值得单说,因为多数工具都会不声不响地要你先转格式。
丢个文件进来,尺寸、比例、大小会先对着上面这些限制查一遍,然后才轮到花钱。不合格的上传应该只花你一秒,不该花掉一次生成。超过 30 MB,降画质导出,别缩像素。比例超范围,裁掉而不是加黑边,黑边会变成画面的一部分,也跟着动。要自己发请求的话,完整教程(英文) 讲了 API 的 first_frame 与 last_frame 字段。
为什么这儿的画幅它自己就定了
图片生视频的画幅是自适应,直接从你的图读出来,所以竖图给你竖片,什么都不用碰。这和 文生视频(英文) 正好相反:那边没有图可读,必须你自己选。
图片生视频 · 本页
ratio: adaptive
从你上传的图片读出来。可以改,但它已经知道了。
文生视频
ratio: required
adaptive 会被直接拒绝,没有图可以用来推断画幅。
想覆盖也行,要 9:16 就给你 9:16,按需裁剪。片子有固定去处时值得这么干。一张 4:3 的照片留着自适应就出一条 4:3,放进手机信息流就是一大块加了黑边的方砖。
一条 MiniMax H3 图片生视频要多少钱
按输出秒数计费,不是按次数。4 秒试片比 15 秒成片便宜,2K 比 768P 贵,跑砸了自动退回。免费登录送 30 积分,跑的是 Agnes Video V2.0。MiniMax H3 和 2K 要从套餐或积分包里来。
两种付法每月积分一样多
- 免费不用绑卡
不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。
$0永久全程不需要信用卡
免费开始只做机器人校验,不要邮箱
1 条,不用账号
Agnes Video V2.0 · 16:9 · 5 秒 · 无声
登录仍然免费,Agnes 引擎每天 3 条,无声$9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K
- MiniMax H3 原生 2K仅付费
- 声音与画面一起生成仅付费
- 一条,不用账号
- 同时跑 1 个任务
- 失败的片子不花钱
- 生成内容私有
- 任意积分包都能解锁 MiniMax H3 的全部模式
免费档是另一个引擎。看套餐
速度与排队
- 队列
- 免费通道
- 同时任务数
- 1
- 批量
- 1
- 历史保留
- 24 小时 · 登录后 7 天
- 支持
- 社区
- Lite省 50%
解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。
$24.9/mo$49.9按年扣 $298.8 · 一年省 $300
7 天退款 · 随时取消
每月 1,290 积分 · 约 22 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 17 条
月付年付,每月积分一样多
- MiniMax H3 原生 2K:音画同生
- 对白、音效与配乐在同一个文件里
- 最长 15 秒15s
- 每月约 22 条 4 秒 768P 文生视频
- 失败的片子不花钱
- 积分未使用可 7 天退款
- 同时跑 1 个任务
- 同一条提示词可批量出 2 个版本
仅限个人与评估用途:为什么
速度与排队
- 队列
- 标准
- 同时任务数
- 1
- 批量
- 2
- 历史保留
- 7 天
- 支持
- 邮件 · 48 小时
- 多数人推荐Pro省 50%
比 Lite 多 $50。每月约 125 条,同样的 MiniMax H3,队列更快。
$49.9/mo$99.9按年扣 $598.8 · 一年省 $600
7 天退款 · 随时取消
每月 4,990 积分 · 约 125 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 84 条
月付年付,每月积分一样多
- 包含 Lite 的全部
- 每月约 125 条 4 秒 768P 文生视频
- 同时跑 3 个任务3×
- 视频反推提示词
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 积分未使用可 7 天退款
仅限个人与评估用途:为什么
速度与排队
- 队列
- 快速
- 同时任务数
- 3
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 邮件 · 12 小时
- Studio省 50%
一整个月的产量,排队最优先,还有 4 小时内回你的真人。
$99.9/mo$199.9按年扣 $1,198.8 · 一年省 $1,200
7 天退款 · 随时取消
每月 12,990 积分 · 约 325 条
4 秒 · 768P · 文生视频
或 4 秒 2K 约 217 条
月付年付,每月积分一样多
- 包含 Pro 的全部
- 每月约 325 条 4 秒 768P 文生视频
- 同时跑 8 个任务8×
- 同一条提示词可批量出 4 个版本
- 历史保留 7 天
- 优先支持,4 小时内响应
- 我们能给到的最低积分消耗
- 积分未使用可 7 天退款
仅限个人与评估用途:为什么
速度与排队
- 队列
- 优先,排在最前面
- 同时任务数
- 8
- 批量
- 4
- 历史保留
- 7 天
- 支持
- 优先 · 4 小时
怎么用 MiniMax H3 让一张静图动起来
决定结果的是第二步:你这张照片是这条片子的哪一头。
上传你的静图
一张就够。它会变成输出里真实的一帧,不是一个风格提示。
JPG 或 PNG选首帧、尾帧,或者两者
首帧从这张照片往前走。尾帧是走到它。两者都给,模型就把两头接起来。
三种模式写清楚什么在动、听起来什么样
提示词描述的是你定死的那些帧之间的运动,外加对白和音效。
声音写在同一个字段里设长度和分辨率,然后生成
4 到 15 秒整秒,24 帧,768P 或 2K,作为一个 MP4 返回,音频在里面。
最高 2K
上传的照片本身永远不会被改动,输出的是一个新文件。
MiniMax H3 图片生视频常见问题
十四个答案 · 全部展开 · 没有折叠
