MiniMax H3 和 M3 区别:一个出视频,一个写代码
它们不是竞品。同一家公司,相隔两个月发布,API 字符串里只差一个字母——这基本就是大家搞混的原因。

这一篇比的是两个并不竞争的模型。H3 是一个全模态视频模型:文字、图片、视频、音频进去,出来的是 4–15 秒带声音的视频,画面和声音在同一次传播里。M3 是一个 428B 的混合专家语言模型,1M token 上下文,它能读视频,但写出来的是文字。
M3 生成不了视频。H3 写不了代码。如果你在这两个之间纠结,说明你还没定下自己要做什么——而如果你做的是视频,M3 仍然值得留着,理由在本文最后。
一个出视频,一个写代码
MiniMax H3 2026 年 7 月 31 日发布,8 月 2–3 日放出开源权重。它吃文字、图片、视频和音频,回给你一个 24 fps、4 到 15 秒、最高 2K 的 MP4。调用点是 /v2/video_generation,异步:建任务、轮询 id、下载文件。按输出秒计费。
MiniMax M3 早两个月,2026 年 6 月 1 日发布,6 月 12 日放权重。它是 428B 的混合专家,每 token 激活 23B,建在 MiniMax Sparse Attention 上,窗口 1,048,576 token。它读图片和视频,写出来的是文字。调用点是 /v1/chat/completions,同步。按 token 计费。
同一个宿主,同一个账号,模型字符串里只差一个字母。
你到底在找哪一个?
搜这个词的人多数并不是在做对比——他们是走错了模型,想找出口。一个问题就能了结。
你想让什么东西出来?
| 如果答案是 | 你要的是 | 模型字符串 | 接口 | 计费 |
|---|---|---|---|---|
| 带声音的视频 | MiniMax H3 | MiniMax-H3 | /v2/video_generation | 按输出秒 |
| 文字、代码、方案 | MiniMax M3 | MiniMax-M3 | /v1/chat/completions | 按 token |
如果你手上只有一个名字或者一个数字,分不清它属于谁,下面那两节查表就是给你的。
数字并排看
两行几乎就决定了一切。
输出什么是多数读者唯一需要的那一行。计费单位是会在采购环节咬人的那一行:一份按错的模型做出来的报价,不是「有点偏」,而是单位都不一样。H3 是 768P 每输出秒 $0.08,2K $0.13。M3 是每百万输入 token $0.30、每百万输出 token $1.20,输入超过 512K 之后翻倍。
有一行值得再看一眼。两个都收视频——但 H3 收它是当参考来模仿,M3 收它是为了描述。同样的输入,相反的目的。
两份许可证卡的方向正相反
两份都叫 Community License。它们是不同的文件,限制的也是不同的东西。
H3 那份把欧盟、英国、韩国和美国排除在适用地域之外,而且 §V.4 把这条限制延伸到产出物上——一条在别处合法渲染出来的片子,在那四个市场里没有展示授权。年营收超过两千万美元,需要事先取得书面授权。
M3 那份完全没有地域限制。它的基础授权是非商用的;要商用就得显著展示「Built with MiniMax M3」,同样是两千万美元这条线触发书面授权,线以下走一次性告知。
所以这是两个不同的问题。H3 问你在哪儿。M3 问你赚多少。一个伦敦的开发者可以合法自部署 M3。他不能自部署 H3。
还有一处对照值得知道:H3 的文本编码器是 Qwen3-VL-32B,一个第三方模型,而 M3 的稀疏注意力完全是自研。同一家公司在两款旗舰上走了相反的路。另外值得一提,M2 在 2025 年 10 月是以 MIT 发布的——限制是从 M2.7 开始的。
这是摘要,不是法律意见。H3 许可证完整拆解里有条文;如果那四个市场里有你,托管 API 是另一套安排。
MiniMax 发过的每一个名字
这只是一个更大的命名问题的一部分。MiniMax 在一年之内发过一个叫 H3 的视频模型、一个叫 M3 的语言模型,还有一个叫 Music-3.0 的音乐模型——所以「MiniMax 那个新的 3 模型」现在有三个指代对象。
写 Hailuo 03 不算写错;那是一次被 MiniMax 自己作废掉的外推。视频这条线四代用了四套命名:T2V-01-Director,然后 MiniMax-Hailuo-02,然后 MiniMax-Hailuo-2.3,然后是 MiniMax H3。任何一个照着 2025 年那套规律推的人,都会推出 Hailuo-03。
而这个猜测接着会撞上 Kling O3——那不是 MiniMax 的产品。它是快手的,厂商自己叫它 Video 3.0 Omni,两个字符串在搜索框里几乎一模一样。
| 你看到的名字 | 它实际上是什么 |
|---|---|
| Hailuo 3、Hailuo 3.0、Hailuo 03 | MiniMax H3,当前这个视频模型 |
| Hailuo AI | 那个消费级应用,不是模型 |
| Hailuo 2.3 | 上一代视频模型 |
| MiniMax M3 | 文字、编码与智能体模型 |
| Music-3.0 | MiniMax 的音乐模型 |
| Kling O3 | 快手的 Video 3.0 Omni。不是 MiniMax |
| H3-Base | H3 里唯一能下载的那一段 |
你看到的那个数字——先查它属于哪个模型
很多混淆是以一个数字的形式来的。SWE-Bench Pro 59.0%、Terminal-Bench 66.0%、MCP Atlas 74.2%——这些是 M3 的,是厂商自报的,而且没有任何视频模型能在这些榜上被打分。你要是看见它们挨着 H3 出现,那一页把线接错了。
反过来也一样。Elo 分、每秒价格和 42.47 GB 的 ComfyUI 下载量属于 H3,不属于 M3。两个方向都要紧,因为一份采购文档里的错数字,比一个错名字活得久多了。
有一个数字纯粹是过期了:M3 那个 Artificial Analysis 55 分是 Index v4.1 之前的,现在读数是 44。
「vs」问错了问题
H3 要的不是一句话。它要的是一份又长又有结构的描述——一镜一镜,带运镜、时间点和声音,装进三个具名字段里。MiniMax 用一段叫 Context-IR 的托管环节来生成这份描述,而它不在开源发布的范围里。官方自己的说明反过来邀请开发者自建预处理。
M3 恰好非常适合这份活,而且它出自同一家厂商。它有一百万 token 的窗口,所以一份品牌风格指南加一张分镜表塞得进去。它读图片和视频,所以能从你的参考素材里推出一份描述。而它输出文字,正好是 H3 要吃的东西。这不是什么绕路方案。这是 MiniMax 自己留下的空缺,被 MiniMax 自己的模型填上了。
所以这条管线是:M3 写提示词,H3 渲染它,M3 再审一遍结果并修订。 让 M3 吐出 H3 格式的 system prompt:
You are a MiniMax H3 prompt writer. Convert the user's idea into H3's structured
prompt format, following MiniMax's official h3-prompt-writing skill.
Rules:
- Output exactly three fields, in this order:
integrated_multimodal_description, overall_soundscape, non_diegetic_music.
- Write the descriptive sections in English. Keep dialogue, lyrics and on-screen
text in their original language.
- Break the clip into shots using [Shot 1], [Shot 2]. Mark cuts with timestamps
like "At 00:04.500".
- Describe each shot in this order: composition, subjects, environment, actions,
camera, sound.
- Describe camera movement with all three parts: motion type, amplitude, speed.
("slow push-in, small amplitude" — not "camera moves".)
- Write dialogue as: (S1) speaks softly, [English] the line here.
- Every detail must correspond to something visible or audible. No plot
summaries. No unresolved reference tags.
- All timing must fit within the requested duration.
- Stay under 7,000 characters.
Target duration: {duration} seconds. Aspect ratio: {ratio}.这次交接实际要花多少
几乎不要钱,而这正是它可行的原因。一次典型交接送进去约 1,500 token,拿回约 2,500 token——按 M3 的标价大约 $0.0035。它描述的那条五秒 768P 片子要 $0.40。写提示词的成本大约是生成片子的 1%,所以没有任何理由为了省钱丢给 H3 一句粗糙的话。按 2026 年 8 月 14 日的官方标价估算。
提示词生成器是这套东西的产品化版本,参考生视频是图片、视频和人声进去的地方。
混淆背后的那些问题
MiniMax M3 是视频模型吗? 不是。它读视频并描述它,但输出的是文字。要视频,用 H3。
M3 比 H3 更新或者更好吗? 都不是。两条不同的线,相隔两个月。那些数字之间没有可比性。
M3 有多少参数? 按模型卡,总计约 428B,激活 23B。Hugging Face 的元数据写的是 427,040,140,160。
Hailuo 3.0 和 H3 是一回事吗? 是。三种写法指的都是 MiniMax H3。Hailuo AI 是那个应用,不是模型。
能用 M3 来写 H3 的提示词吗? 能。MiniMax 自己的说明就邀请开发者自建提示词预处理。
两个都是开源权重吗? 都是,但许可证都有限制。H3 排除四个地域;M3 一个都不排除,但默认非商用。
我该为哪个付钱? 看你要哪种输出。视频按秒计费,文字按 token 计费。
我搜视频的时候,M3 为什么会冒出来?
它的模型卡打了 video 标签——那是指理解视频。这个标签加上一个字母之差,就够了。
Kling O3 是 MiniMax 的模型吗? 不是。快手做的,它自己叫它 Video 3.0 Omni。只是看起来像。
我就想做条视频,从哪儿开始? 这儿——用不上 M3。所有进得去的路,看MiniMax H3 怎么用。
哪些东西可能变。 MiniMax 发得很快:去发布说明里找有没有比 M3 和 H3 更新的东西。M3 现在的费率被标注为「永久 5 折」,所以那个折扣一旦结束,成本对比就会变。另外 BrowseComp 83.5 是第三方报的,我们没能在 MiniMax 自己的文字里找到它。
作者
编辑部
minimax-h3ai.video


