MiniMax H3 文生视频

把你想看到的画面打出来就行。不用找素材,也不用开剪辑软件。MiniMax H3 文生视频直接还你一条 4 到 15 秒的成片,画面、对白和配乐都在同一个 MP4 里,最高 2K。

把这个镜头写出来

0 / 7000
免费登录 · 每天 3 条
  • 纯文字生成必须选画幅,这里没有自适应这一档
  • 时长会吸到 24 帧的 17n+5 网格上,所以要 7 秒可能回来 6.9 秒

不用卡、不用账号:右边这些片子直接看,再用 Agnes Video V2.0 免费跑一条你自己的想法(16:9、5 秒、无声,仅此一次)。之后登录依然不花钱,每天 3 条。要用 MiniMax H3 跑自己的提示词,$24.9/月 起。

13 条真片 · 点「试这条」直接载进输入框

一位说唱歌手在摩天楼之间坠落,仰角拍摄11s · 16:9 · 768P

四个场景,同一个人

一句话能换来什么

一句话进去,MiniMax H3 文生视频还你什么

多数人第一次跑文生视频都栽在同一处:写了一句话,剩下的全靠模型猜,回来的东西跟脑子里那个完全是两回事。

你写的是

一个女人走在街上。

剩下的全靠模型自己补

  • 什么时间?
  • 穿什么?
  • 镜头怎么动?
  • 什么天气?
  • 有什么声音?
  • 什么镜头?
黄昏时分,一个人影走进霓虹街道,镜头缓慢推近MiniMax H3 · 16:9 · 768P · 8s
回来的东西:画面、雨声和那句台词,都在一个 MP4 里

MiniMax H3 文生视频给你把话说完的空间,最多 7,000 字符。然后还你 4 到 15 秒之间任意整秒、24 帧、768P 或 2K 的成片,对白、音效和配乐已经和画面在同一个文件里。不用原图,不用分镜,不用剪辑软件。

你能写多少字符
7,000

你能写多少字符

任意整秒
4–15 秒

任意整秒

帧率
24 fps

帧率

分辨率
768P / 2K

分辨率

画面、对白、音效与配乐
1 个 MP4

画面、对白、音效与配乐

  • 不用原图
  • 不用分镜
  • 不用剪辑软件

提示词阶梯

从一句话到一个镜头:提示词的三种写法,效果差多少

同一个想法写三遍,每遍都配它跑出来的片子。三条都跑一遍,你就知道 MiniMax H3 文生视频到底在读什么。

  • 第 1 档

    6 个词

    由六个词的提示词生成的、细节很少的结果

    A woman walks down a street.

    会飘

    主体一帧一个样,镜头自己乱动。

  • 第 2 档

    30 个词

    霓虹街道里的一个背影,镜头停在他身上30 个词

    A woman in a red coat walks down a wet Tokyo alley at night, neon reflected in puddles, slow push-in with small amplitude, rain on metal and distant traffic.

    能用了

    镜头照你说的动,雨也真下起来了。

  • 模型是照这个结构训练出来的

    第 3 档

    官方字段

    一个背影走在霓虹街道上,镜头缓慢推近官方字段
    integrated_multimodal_description
    [Shot 1] Red coat, wet Tokyo alley, slow push-in.
    overall_soundscape
    Rain on metal, distant traffic, footsteps.
    non_diegetic_music
    Low synth pad, slow pulse, under the dialogue.

    可以交付

    对白压在音乐前面,因为你写了。

更多跑通过的例子在 提示词灵感(英文),每一条都带着完整的结构化提示词。

提示词构建器

MiniMax H3 文生视频的提示词结构,拆开给你看

填三个框,看着提示词自己拼出来,一键送进生成工具。

这个真不用你猜。H3 就是照一套三字段结构训练出来的,你照着写,它就不再替你瞎补。

每句话该放哪

01

integrated_multimodal_description画面

决定你拿到的是你的镜头,还是它随手编的。

  1. 景别
  2. 主体
  3. 环境
  4. 动作
  5. 运镜
  6. 画面内的声音

按这个顺序写:景别、主体、环境、动作、运镜,最后是画面里发出的声音。每个镜头用 [Shot 1][Shot 2] 编号。

02

overall_soundscape这个房间听起来什么样

防止配乐把你的台词盖掉。

按时间顺序描述环境音、拟音,以及一支立在现场的话筒能收到的一切。如果某句台词重要,就说它在前面、其余都压在下面。

03

non_diegetic_music配乐

角色听不见的那层音乐。最短的一个字段。

给风格、乐器、速度和情绪走向就够,别给曲名。一两句话足够。写太满,是很多人跟自己的声音设计打架的原因。

实时拼出来的提示词

integrated_multimodal_description

[Shot 1] Wide shot of a woman in a red coat, wet alley at night, slow push-in, small amplitude.

overall_soundscape

Rain on metal, distant traffic, footsteps in standing water.

non_diegetic_music

Low synth pad, slow pulse, sitting under the dialogue.

0 / 7000

这三个字段就按这个顺序走,不能对调。

官方的输出规则

  1. 01看得见,或者听得见
  2. 02描述用英文,台词用本语言
  3. 03保持上面这个顺序
  4. 04不要写剧情梗概,不要留多余标签
  5. 05永远不要调换字段顺序

一个字都不想写?提示词工具(英文) 能从一句话填满这三个字段,完整教程(英文) 还讲了 API 那条路。

运镜与分镜

运镜怎么写才有用,多镜头怎么卡点

只写 camera moves 是白写。H3 要看到三样才肯动镜头:类型、幅度、速度

push-in / pull-out / pan / tilt / orbit / handheld / crane / static

small / medium / strong

slow / steady / fast

它动了

slow push-in, small amplitude

camera moves

被忽略
  • 沿着霓虹小巷缓慢推近
    slow push-in, small amplitude画面朝主体收拢,别的什么都不动。
  • 沿海岸线的大幅航拍推进
    fast aerial push-in, large amplitude大幅度买到的是走过的距离,不是切镜头的快慢。
  • 手持跟拍穿过一个街边小吃摊
    medium handheld follow, medium amplitude手持是一种质感。你不说,镜头就会像装在轨道上一样稳。

多镜头卡点

超出片长,整次生成作废

[Shot 1]
[Shot 2] 在 00:04.500
这一刀
00:0000:0200:0400:0600:08

8 秒片长到此结束

给镜头编号,给这一刀打时间戳。最后一个时间戳一定要落在你选的片长以内。

已经有素材、比起重写更想换个风格?那条路是 视频改视频(英文)

对白与声音

让角色开口说话:对白和声音写在同一条提示词里

你的角色可以说话。声音和画面出自同一次生成,不另外收费。

一句台词是怎么组成的

同一次生成 · 不额外收费

(S1)speaks softly,[English]Follow the wind, live free.

(S2)replies firmly,[Japanese]分かった。

同一个镜头里两个人对话,每句台词都标了说话人(S1) / (S2) · 768P · 8s
两个标了说话人的角色,一条长镜头:点开听声音

十一种稳定的语言

11

  • 阿拉伯语
  • 中文
  • 英语
  • 法语
  • 德语
  • 意大利语
  • 日语
  • 韩语
  • 葡萄牙语
  • 俄语
  • 西班牙语

这条规则最多人漏

提示词里描述的部分用英文写,但每句台词要用它本来的语言写。

  • (S2) replies firmly, [Japanese] 分かった。
  • (S2) replies firmly, [Japanese] Understood.

把一句日语台词写成英文,是念出来不对味的头号原因。

需要在好几条片子里保持同一张脸或同一把嗓音?用 参考生视频(英文)

参数与限制

参数、限制,以及三个最容易踩的坑

下面每个数都来自官方 API 文档。其中三行是大家最常栽的地方。

同一个镜头重新生成到 2K 的样子
同一个镜头在 768P 下生成的样子
768P2K
同一条提示词,同样没有种子 · 2K 是重新生成的,不是放大
时长
4–15 秒,整秒好几个站点写 5–15。API 文档接受 4。
帧率
24 fps
分辨率
768P 或 2K
01画幅
21:9 · 16:9 · 4:3 · 1:1 · 3:4 · 9:16,必填
提示词上限
7,000 字符
02帧网格
24 帧下的 17n+5
03种子 / 反向提示词
不开放
输出
一个 MP4,H.264 + AAC,音频已封装

Source: 官方 · MiniMax API reference

三个最容易踩的坑

  • 01

    画幅留空,这次调用直接报错。

    • 21:9
    • 16:9
    • 4:3
    • 1:1
    • 3:4
    • 9:16
    • adaptive

    图片生视频(英文) 可以用 adaptive,因为它有你的图可以推断画幅。

  • 02

    你要 7 秒,回来可能是 6.9 秒。

    24 帧下 17n + 5 帧

    你要的
    7.0 秒
    回来的
    6.9 秒

    时长会吸到最近的合法区块上。这是模型的规则,不是 bug。

  • 03

    没有种子,也没有反向提示词。

    这里 7,000 字符
    Veo 3.1 是 1,024 token

    条形长度 = 提示词额度

    控制力来自把想要的东西说得更准。Veo 3.1(英文) 只给你 1,024 token。

价格 · 每个付费档都出 2K · 音画同生

一条 MiniMax H3 文生视频要多少钱

按输出秒数计费,不是按次数。所以跑一条 4 秒试片比 15 秒成片便宜,跑砸了完全不扣费。下面是在这儿出一条 8 秒要多少钱,旁边是大家常拿来比的两个模型。

一条 8 秒,按各家标价

本页 · 8 秒 768P
$0.64
Veo 3.1 Standard · 1080p
$3.20
Seedance 2.5 · 720p
$1.85

各家标价,核对于 2026-08-13。完整价格

两种付法每月积分一样多

  • 免费不用绑卡

    不用账号出一条,跑的是免费引擎。MiniMax H3 本身是付费的。

    $0永久

    全程不需要信用卡

    免费开始

    只做机器人校验,不要邮箱

    1 条,不用账号

    Agnes Video V2.0 · 16:9 · 5 秒 · 无声
    登录仍然免费,Agnes 引擎每天 3 条,无声

    $9.9 起的任意积分包都能解锁 MiniMax H3,所有模式,768P 与 2K

    • MiniMax H3 原生 2K仅付费
    • 声音与画面一起生成仅付费
    • 一条,不用账号
    • 同时跑 1 个任务
    • 失败的片子不花钱
    • 生成内容私有
    • 任意积分包都能解锁 MiniMax H3 的全部模式

    免费档是另一个引擎。看套餐

    速度与排队

    队列
    免费通道
    同时任务数
    1
    批量
    1
    历史保留
    24 小时 · 登录后 7 天
    支持
    社区
  • Lite省 50%

    解锁 MiniMax H3 原生 2K。最小的付费档,大多数人选的是 Pro。

    $24.9/mo$49.9

    按年扣 $298.8 · 一年省 $300

    7 天退款 · 随时取消

    每月 1,290 积分 · 约 22 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 17 条

    月付年付,每月积分一样多

    • MiniMax H3 原生 2K:音画同生
    • 对白、音效与配乐在同一个文件里
    • 最长 15 秒15s
    • 每月约 22 条 4 秒 768P 文生视频
    • 失败的片子不花钱
    • 积分未使用可 7 天退款
    • 同时跑 1 个任务
    • 同一条提示词可批量出 2 个版本

    仅限个人与评估用途:为什么

    速度与排队

    队列
    标准
    同时任务数
    1
    批量
    2
    历史保留
    7 天
    支持
    邮件 · 48 小时
  • 多数人推荐
    Pro省 50%

    比 Lite 多 $50。每月约 125 条,同样的 MiniMax H3,队列更快。

    $49.9/mo$99.9

    按年扣 $598.8 · 一年省 $600

    7 天退款 · 随时取消

    每月 4,990 积分 · 约 125 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 84 条

    月付年付,每月积分一样多

    • 包含 Lite 的全部
    • 每月约 125 条 4 秒 768P 文生视频
    • 同时跑 3 个任务
    • 视频反推提示词
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 积分未使用可 7 天退款

    仅限个人与评估用途:为什么

    速度与排队

    队列
    快速
    同时任务数
    3
    批量
    4
    历史保留
    7 天
    支持
    邮件 · 12 小时
  • Studio省 50%

    一整个月的产量,排队最优先,还有 4 小时内回你的真人。

    $99.9/mo$199.9

    按年扣 $1,198.8 · 一年省 $1,200

    7 天退款 · 随时取消

    每月 12,990 积分 · 约 325 条

    4 秒 · 768P · 文生视频

    或 4 秒 2K 约 217 条

    月付年付,每月积分一样多

    • 包含 Pro 的全部
    • 每月约 325 条 4 秒 768P 文生视频
    • 同时跑 8 个任务
    • 同一条提示词可批量出 4 个版本
    • 历史保留 7 天
    • 优先支持,4 小时内响应
    • 我们能给到的最低积分消耗
    • 积分未使用可 7 天退款

    仅限个人与评估用途:为什么

    速度与排队

    队列
    优先,排在最前面
    同时任务数
    8
    批量
    4
    历史保留
    7 天
    支持
    优先 · 4 小时

完整流程

怎么用 MiniMax H3 把一句话做成视频

四步,没有一步要开剪辑软件。声音就在画面那个文件里。

  1. 把画面和声音描述出来

    一个输入框两样都收。先写镜头看到什么,再写它听到什么:对白、音效、配乐。

    最多 7,000 字符
  2. 设画幅、长度和分辨率

    六种画幅,4 到 15 秒之间任意整秒,768P 或 2K。

    24 帧,4–15 秒
  3. 生成

    画面和 32 kHz 立体声在同一次生成里做出来,不是事后拼上去的。

    一次生成
  4. 下载 MP4

    一个文件,声音已经在里面。任务失败不扣积分,所有档位包括免费档。

    付费档不加任何标记

免费档跑的是 Agnes Video V2.0,16:9,无声。MiniMax H3 本身,连同 2K 和音画同生,从付费档开始。

大家真正会问的问题

MiniMax H3 文生视频常见问题

十二个答案 · 全部展开 · 没有折叠

MiniMax H3 文生视频是什么?

把一句写出来的话变成 4 到 15 秒的 24 帧视频,768P 或 2K,不需要任何原图。声音就在同一个 MP4 里。

画幅一定要选吗?

一定要。和图片生视频不一样,这里没有自适应这一档:没有输入图,就没法推断你要的画幅。

片子最长能多久?

4 到 15 秒之间任意整秒。好几个站点写 5 到 15;API 文档接受 4。

我要 7 秒,怎么回来是 6.9 秒?

24 帧下帧数落在 17n+5 这个网格上,所以时长会吸附到最近的合法区块。

提示词能写多长?

最多 7,000 字符。在 H3 上,写长写细通常比写短管用。

能用种子或反向提示词吗?

都不行,两个都没开放。改成把你想要的东西说得更准。

能出 2K 吗?

能。2K 是带着你原来的上下文重新生成,不是把像素放大,所以画面里的小字留得住。

声音真的是生成的吗?

是在同一次生成里做出来的:对白、音效、配乐。没有开关,也不额外收费。

角色能说哪些语言?

十一种是稳定的。每句台词要用它自己的语言写。

一定要注册才能试吗?

不用。先免费跑一条 Agnes Video V2.0 的片子,不用账号、不用手机号。之后登录依然不花钱,免费引擎每天 3 条,无声。

免费出来的片子有声音吗?

没有。免费引擎只渲染画面,所以免费成片是无声的。MiniMax H3 是把音频和画面在同一次生成里一起做出来的,那在付费档。我们不给任何档位加水印。

这些视频能商用吗?

在本站生成的不能。这里生成的一切仅限个人与评估用途,所有档位包括免费档都是如此。我们是独立第三方界面,无法授予输出的商用权利。要用于商业项目,请到 MiniMax 自己的海螺产品或官方 API 上生成。

一句话,就够你试出答案。

跑一条 Agnes 不用卡、不用账号。之后登录依然不花钱,每天 3 条。

免费生成 · 排队

由 MiniMax H3 AI Video Generator 编辑团队撰写与维护发布于 最后更新