Alternatives

MiniMax M3 能生成视频吗?出视频的是 H3

M3 吃视频、吐文字,一帧都出不来。MiniMax 家真正出视频的是 H3;这篇顺带讲清 M3 对着一段素材到底看得见什么。

8 分钟读完编辑部编辑部
MiniMax M3 能生成视频吗?出视频的是 H3

MiniMax M3 不生成视频,从来也没有过。 它是把视频吃进去——单次请求最多约三十分钟素材——然后吐出文字:描述、点评、分镜表、代码。MiniMax 家真正出视频的那个模型是 H3,比 M3 晚两个月发布,API 字符串里只差一个字母。

走到这一页有两条路,而这两条路要的是相反的答案。

如果你是奔着「MiniMax M3 视频生成」来的,你要的那个模型叫 H3,现在就能生成一条片子——同一家公司,换对字母就行。如果你说的就是 M3,想知道它对着一段素材能干什么,继续往下读。答案比「什么都干不了」具体得多,而且真正卡住你的那道限制,不是规格表上写的那道。

MiniMax M3 能生成视频吗

不能。我第一个去看的是 pipeline tag,因为它一次查询就能把这事定死,而且你一分钟之内就能自己复现。

MiniMax M3MiniMax H3
Hugging Face pipeline tagimage-text-to-textimage-text-to-video
API 模型字符串MiniMax-M3MiniMax-H3
接口/v1/chat/completions/v2/video_generation
怎么调对话,同步建任务、轮询 id、取文件
计费单位token输出秒
回给你的是文字一个 MP4

pipeline tag 是最快的那一行。它是模型仓库上一个明写的字段,声明的就是输出模态——M3 那一栏写着 text。一个 task tag 以 -to-text 结尾的模型,请求怎么写都变不出一个视频文件。

计费那一行咬的是团队,不是个人。按错模型报的价不是「有点偏」,是单位就错了——token 对着输出秒——后面任何环节都对不平。

喂它一段片子,M3 到底看得见什么

就算你只做视频,这段也值得知道,因为 M3 真正有用的地方在入口那一侧。

M3 是原生多模态:文字、图片、视频走同一个对话接口,从一开始就一起训,不是在文本模型上后挂一个视觉适配器。NVIDIA 的部署卡把长素材上限标在单次请求约 30 分钟,MiniMax 报的是 Video-MME 512 帧下 84.6——它自己的评测,按厂商自报看待。

有三件事比那个分数更要紧。

视频是以帧的形式进去的,不是一个文件。 你自己把片子抽帧,按顺序传一串图片进去。MiniMax 公开的那份评测抽的是 1 FPS

所以那个上限是一件套着时长外衣的 token 预算。 你抽的每一帧都在花 1,048,576 token 的上下文窗口。这也是为什么同一个限制在部署页上是分钟、在评测配置里是:512 帧、1 FPS,换算过来是八分半左右的真实素材。半小时只有在你愿意一秒看一帧的前提下才是半小时——换成两分钟的片子按 12 FPS 抽,同样的预算只覆盖了十二分之一的时长。帧率对着镜头定,不是对着文件长度定。

M3 听不见你的片子。 视频这条路是一串静止帧,声轨不跟着走。破绽在 MiniMax 自己那份 Video-MME 配置里:它每 30 秒插一段字幕文本,而不是把音频喂进去。所以 M3 跟你说的任何关于对白、音乐或环境声的话,都是它从画面和你给的文字里推出来的。对白要紧的话,把文字稿一起贴进去。

这留下一个很干净的倒影,用来记住这一对:H3 是靠它产出的声音定义的,M3 是靠它接不进去的声音定义的。 同一家公司,相隔两个月。

如果你真正要做的事是描述手头已有的素材,我们的视频反推提示词做的是 H3 那一版:它读一条片子,回给你一份可以直接拿去出片的结构化提示词,而不是一段还要你自己再转换一遍的散文。

现在有四个名字答应「MiniMax 3」

你看到的名字它是什么出视频吗
MiniMax H3视频模型。文字、图片、视频、音频进;4–15 秒出,最高 2K
MiniMax H3 Maxfal 后训练出来的 H3——更快,封顶 768p,两个接口,但天花板更低
MiniMax M3文本、代码与 agent 模型。读视频,写文字不出
Music-3.0MiniMax 的音乐模型不出

2026 年一口气来了三个名字里带 3 的产品,其中两个的 API 字符串只差一个字符,而 MiniMax 自己在拿 M3 的百万 token 窗口卖「长视频理解」——这话没错,而且快速扫一眼跟视频生成分不出来。

H3 Max 是最新的一种走错门的方式。它是 MiniMax 认可的真模型,在 MiniMax 自己的文档里与 H3 并列,但它不是一个可以随手替换的版本:只有托管、没放权重、768p 而不是 2K。「Max」到底 Max 了什么、又让掉了什么把这笔账整个走了一遍。

你这活该用哪个模型

要出来的东西用哪个模型去哪做
一条有声音的视频,从一个写好的想法出发MiniMax H3文生视频
一条从你手头照片出发的视频MiniMax H3图片生视频
一条跨镜头保住同一个人物、声音或风格的视频MiniMax H3参考生视频
从已有素材里得到一份提示词或描述都行视频反推提示词
文字、代码、agent、长上下文阅读MiniMax M3MiniMax 自己的 M3 页面

让 M3 写提示词,H3 出片

M3 在视频流程里确实有一份活,只是那份活不是出片。

H3 要的不是一句话。它要的是一段很长的结构化描述——一个镜头一个镜头,运镜、时间点和声音都写进具名字段里。MiniMax 是用一个叫 Context-IR 的托管环节生成这段描述的,那个环节不在开源包里,而它自己的指引也邀请开发者自建预处理。

M3 合这个缺口合得几乎过头:百万 token 的窗口能同时装下一份品牌风格指南和一张分镜表;原生的图片与视频输入让它读得懂你的参考素材;而它的输出是文字——恰好就是 H3 吃的东西。所以这条流程是 M3 写提示词,H3 出片——把你带到这儿的那次搜索,离一条真实的工作流只差一个字母,而不是一个错误。

这套交接的完整版——让 M3 直接吐出 H3 三字段格式的那段系统提示词、这一轮对话相对于出片本身值多少钱、以及两边许可证在哪儿分岔——写在 MiniMax H3 和 M3 区别里。不想自己搭,提示词生成器在浏览器里给你同一套结构。

MiniMax M3 和视频:常见问题

MiniMax M3 是视频模型吗? 它是一个能读视频的多模态模型,不是一个视频生成模型——它的 pipeline tag 是 image-text-to-text

MiniMax M3 能做文生视频吗? 不能。H3 能,而且它就是 MiniMax 为这件事造的那个模型。

那些打着「MiniMax M3 视频生成」在投的到底是什么? 基本都是一个 MiniMax H3 的界面,用 M3 这个拼法来接这个搜索。出片能力是真的,挂在上面的模型名是错的。

H3 Max 和 M3 是同一个东西吗? 不是,而且这两个是最容易顺手搞反的一对。H3 Max 出视频,是 H3 的后训练版本;M3 出文字。共用那个字母是巧合。

我上传的视频,M3 听得懂里面的声音吗? 听不懂。进去的是帧,声轨不进去。对白要紧的时候,把文字稿当文本一起贴给它。

MiniMax M3 有多少参数? 总参数约 428B,每 token 激活约 23B,128 个专家、每 token 激活 4 个。Hugging Face 的 safetensors 元数据给的精确数是 427,040,140,160。

MiniMax M3 和 MiniMax H3 都是开放权重吗? 两个都放了权重,但许可证都带限制、都不是 OSI 意义上的开源,而且限制的形状还不一样:M3 没有地域限制,H3 排除了四个市场。H3 许可证真正卡的是什么把这一侧拆开了。

我就是想做条视频。 从 MiniMax H3 文生视频开始——不需要 M3,而且声音在同一次生成里就出来了。


最后核对于 2026 年 8 月 31 日。 三十分钟这个上限是 NVIDIA 公布的部署数字,不是 MiniMax 的 API 承诺;Video-MME 那个分数是 MiniMax 自报的——两个都标了出处,你可以自己回去核,而不是选择相信。MiniMax 出货够快,再来一个带 3 的名字是完全可能的。

编辑部

作者

编辑部

minimax-h3ai.video

发布于 MiniMax H3 AI Video Generator,一个基于 MiniMax H3 的独立第三方界面。

所有文章