Alternatives

MiniMax H3 和 M3 区别:一个出视频,一个写代码

它们不是竞品。同一家公司,相隔两个月发布,API 字符串里只差一个字母——这基本就是大家搞混的原因。

7 分钟读完编辑部编辑部
MiniMax H3 和 M3 区别:一个出视频,一个写代码

这一篇比的是两个并不竞争的模型。H3 是一个全模态视频模型:文字、图片、视频、音频进去,出来的是 4–15 秒带声音的视频,画面和声音在同一次传播里。M3 是一个 428B 的混合专家语言模型,1M token 上下文,它能读视频,但写出来的是文字。

M3 生成不了视频。H3 写不了代码。如果你在这两个之间纠结,说明你还没定下自己要做什么——而如果你做的是视频,M3 仍然值得留着,理由在本文最后。

一个出视频,一个写代码

MiniMax H3 2026 年 7 月 31 日发布,8 月 2–3 日放出开源权重。它吃文字、图片、视频和音频,回给你一个 24 fps、4 到 15 秒、最高 2K 的 MP4。调用点是 /v2/video_generation,异步:建任务、轮询 id、下载文件。按输出秒计费。

MiniMax M3 早两个月,2026 年 6 月 1 日发布,6 月 12 日放权重。它是 428B 的混合专家,每 token 激活 23B,建在 MiniMax Sparse Attention 上,窗口 1,048,576 token。它读图片和视频,写出来的是文字。调用点是 /v1/chat/completions,同步。按 token 计费。

同一个宿主,同一个账号,模型字符串里只差一个字母。

你到底在找哪一个?

搜这个词的人多数并不是在做对比——他们是走错了模型,想找出口。一个问题就能了结。

你想让什么东西出来?

如果答案是你要的是模型字符串接口计费
带声音的视频MiniMax H3MiniMax-H3/v2/video_generation按输出秒
文字、代码、方案MiniMax M3MiniMax-M3/v1/chat/completions按 token

如果你手上只有一个名字或者一个数字,分不清它属于谁,下面那两节查表就是给你的。

数字并排看

两行几乎就决定了一切。

输出什么是多数读者唯一需要的那一行。计费单位是会在采购环节咬人的那一行:一份按错的模型做出来的报价,不是「有点偏」,而是单位都不一样。H3 是 768P 每输出秒 $0.08,2K $0.13。M3 是每百万输入 token $0.30、每百万输出 token $1.20,输入超过 512K 之后翻倍。

有一行值得再看一眼。两个都收视频——但 H3 收它是当参考来模仿,M3 收它是为了描述。同样的输入,相反的目的。

两份许可证卡的方向正相反

两份都叫 Community License。它们是不同的文件,限制的也是不同的东西。

H3 那份把欧盟、英国、韩国和美国排除在适用地域之外,而且 §V.4 把这条限制延伸到产出物上——一条在别处合法渲染出来的片子,在那四个市场里没有展示授权。年营收超过两千万美元,需要事先取得书面授权。

M3 那份完全没有地域限制。它的基础授权是非商用的;要商用就得显著展示「Built with MiniMax M3」,同样是两千万美元这条线触发书面授权,线以下走一次性告知。

所以这是两个不同的问题。H3 问你在哪儿。M3 问你赚多少。一个伦敦的开发者可以合法自部署 M3。他不能自部署 H3。

还有一处对照值得知道:H3 的文本编码器是 Qwen3-VL-32B,一个第三方模型,而 M3 的稀疏注意力完全是自研。同一家公司在两款旗舰上走了相反的路。另外值得一提,M2 在 2025 年 10 月是以 MIT 发布的——限制是从 M2.7 开始的。

这是摘要,不是法律意见。H3 许可证完整拆解里有条文;如果那四个市场里有你,托管 API 是另一套安排。

MiniMax 发过的每一个名字

这只是一个更大的命名问题的一部分。MiniMax 在一年之内发过一个叫 H3 的视频模型、一个叫 M3 的语言模型,还有一个叫 Music-3.0 的音乐模型——所以「MiniMax 那个新的 3 模型」现在有三个指代对象。

Hailuo 03 不算写错;那是一次被 MiniMax 自己作废掉的外推。视频这条线四代用了四套命名:T2V-01-Director,然后 MiniMax-Hailuo-02,然后 MiniMax-Hailuo-2.3,然后是 MiniMax H3。任何一个照着 2025 年那套规律推的人,都会推出 Hailuo-03。

而这个猜测接着会撞上 Kling O3——那不是 MiniMax 的产品。它是快手的,厂商自己叫它 Video 3.0 Omni,两个字符串在搜索框里几乎一模一样。

你看到的名字它实际上是什么
Hailuo 3、Hailuo 3.0、Hailuo 03MiniMax H3,当前这个视频模型
Hailuo AI那个消费级应用,不是模型
Hailuo 2.3上一代视频模型
MiniMax M3文字、编码与智能体模型
Music-3.0MiniMax 的音乐模型
Kling O3快手的 Video 3.0 Omni。不是 MiniMax
H3-BaseH3 里唯一能下载的那一段

你看到的那个数字——先查它属于哪个模型

很多混淆是以一个数字的形式来的。SWE-Bench Pro 59.0%、Terminal-Bench 66.0%、MCP Atlas 74.2%——这些是 M3 的,是厂商自报的,而且没有任何视频模型能在这些榜上被打分。你要是看见它们挨着 H3 出现,那一页把线接错了。

反过来也一样。Elo 分、每秒价格和 42.47 GB 的 ComfyUI 下载量属于 H3,不属于 M3。两个方向都要紧,因为一份采购文档里的错数字,比一个错名字活得久多了。

有一个数字纯粹是过期了:M3 那个 Artificial Analysis 55 分是 Index v4.1 之前的,现在读数是 44。

「vs」问错了问题

H3 要的不是一句话。它要的是一份又长又有结构的描述——一镜一镜,带运镜、时间点和声音,装进三个具名字段里。MiniMax 用一段叫 Context-IR 的托管环节来生成这份描述,而它不在开源发布的范围里。官方自己的说明反过来邀请开发者自建预处理。

M3 恰好非常适合这份活,而且它出自同一家厂商。它有一百万 token 的窗口,所以一份品牌风格指南加一张分镜表塞得进去。它读图片和视频,所以能从你的参考素材里推出一份描述。而它输出文字,正好是 H3 要吃的东西。这不是什么绕路方案。这是 MiniMax 自己留下的空缺,被 MiniMax 自己的模型填上了。

所以这条管线是:M3 写提示词,H3 渲染它,M3 再审一遍结果并修订。 让 M3 吐出 H3 格式的 system prompt:

You are a MiniMax H3 prompt writer. Convert the user's idea into H3's structured
prompt format, following MiniMax's official h3-prompt-writing skill.

Rules:
- Output exactly three fields, in this order:
  integrated_multimodal_description, overall_soundscape, non_diegetic_music.
- Write the descriptive sections in English. Keep dialogue, lyrics and on-screen
  text in their original language.
- Break the clip into shots using [Shot 1], [Shot 2]. Mark cuts with timestamps
  like "At 00:04.500".
- Describe each shot in this order: composition, subjects, environment, actions,
  camera, sound.
- Describe camera movement with all three parts: motion type, amplitude, speed.
  ("slow push-in, small amplitude" — not "camera moves".)
- Write dialogue as: (S1) speaks softly, [English] the line here.
- Every detail must correspond to something visible or audible. No plot
  summaries. No unresolved reference tags.
- All timing must fit within the requested duration.
- Stay under 7,000 characters.

Target duration: {duration} seconds. Aspect ratio: {ratio}.

这次交接实际要花多少

几乎不要钱,而这正是它可行的原因。一次典型交接送进去约 1,500 token,拿回约 2,500 token——按 M3 的标价大约 $0.0035。它描述的那条五秒 768P 片子要 $0.40。写提示词的成本大约是生成片子的 1%,所以没有任何理由为了省钱丢给 H3 一句粗糙的话。按 2026 年 8 月 14 日的官方标价估算。

提示词生成器是这套东西的产品化版本,参考生视频是图片、视频和人声进去的地方。

混淆背后的那些问题

MiniMax M3 是视频模型吗? 不是。它读视频并描述它,但输出的是文字。要视频,用 H3。

M3 比 H3 更新或者更好吗? 都不是。两条不同的线,相隔两个月。那些数字之间没有可比性。

M3 有多少参数? 按模型卡,总计约 428B,激活 23B。Hugging Face 的元数据写的是 427,040,140,160。

Hailuo 3.0 和 H3 是一回事吗? 是。三种写法指的都是 MiniMax H3。Hailuo AI 是那个应用,不是模型。

能用 M3 来写 H3 的提示词吗? 能。MiniMax 自己的说明就邀请开发者自建提示词预处理。

两个都是开源权重吗? 都是,但许可证都有限制。H3 排除四个地域;M3 一个都不排除,但默认非商用。

我该为哪个付钱? 看你要哪种输出。视频按秒计费,文字按 token 计费。

我搜视频的时候,M3 为什么会冒出来? 它的模型卡打了 video 标签——那是指理解视频。这个标签加上一个字母之差,就够了。

Kling O3 是 MiniMax 的模型吗? 不是。快手做的,它自己叫它 Video 3.0 Omni。只是看起来像。

我就想做条视频,从哪儿开始? 这儿——用不上 M3。所有进得去的路,看MiniMax H3 怎么用


哪些东西可能变。 MiniMax 发得很快:去发布说明里找有没有比 M3 和 H3 更新的东西。M3 现在的费率被标注为「永久 5 折」,所以那个折扣一旦结束,成本对比就会变。另外 BrowseComp 83.5 是第三方报的,我们没能在 MiniMax 自己的文字里找到它。

编辑部

作者

编辑部

minimax-h3ai.video

所有文章