MiniMax H3 本地部署还是走线上:没人报的那个门槛是分钟数
每张配置表回答的都是「加载要多少内存」。真正劝退人的是:同一个 480p 任务在一台机器上 182 秒,在另一台上 90 分钟。

要不要自部署,归结成三个数:你有多少内存、一条片子花掉你多少分钟,以及许可证覆不覆盖你住的地方。
不存在一份诚实的最低配置,谁报一个数谁就是在猜。需求随 checkpoint、画布,以及有多少东西溢到主机内存而变。固定的是:最小的下载包是 42.47 GB,你拿到的是 H3-Base,也就是 768 档的产出、没有 2K,而且许可证排除美国、欧盟、英国和韩国。托管产出是每秒 $0.08。
卡住人的往往是主机内存而不是显存:那些文件超过任何一张消费级卡,所以总有东西要溢出去,而两个同样 32 GB 的人报出过完全相反的结果。一旦你知道自己在哪一档,这就不再是硬件问题,而是一道算术题。
计量单位是「每条几分钟」,不是 GB
GB 告诉你它加不加载得进去。分钟告诉你你会不会真的去用它。
同一个 480p 任务,在一张 16 GB 的笔记本显卡加 SageAttention 上跑了 182 秒,在一台 128 GB 的 Mac Studio 上跑了 90 分钟——三十倍的落差,而每一张配置表都把这两台机器叫作「够用」。托管生成是 30 到 90 秒。
这些我们自己一个都没跑过;每个数字都是别人公布的结果。十四份带出处的配置在 ComfyUI 那一篇里。
官方那个数字要单独读:559.67 秒是另一套运行时里两张卡跑五十步的成绩,不是单卡 ComfyUI 的基线。那次记录的峰值是每张卡 26.3 GiB,而那台主机恰好有 377 GiB——「要 384 GB」这个传闻就是从这儿来的,那是测试机的配置,不是门槛。
你在哪儿,比成本更早定下结论
对英语市场的很大一部分人来说,这道算术题根本没机会开始。
MiniMax 的社区许可证排除美国、欧盟、英国和韩国,而且这条排除跟着产出物走,不只跟着权重:在允许的国家渲染、发布到被排除的国家,仍然在授权之外。申请走 platform.minimax.io/h3-license。这条条款管的是权重,不管托管 API——MiniMax 声明后者全球可用——不过那个 API 有它自己的条款,不是一个自动成立的合规答案。许可证逐条读里有其余部分。这是摘要,不是法律意见。
如果你被排除在外,而自部署又恰恰是你真正需要的,诚实的答案不是我们:市面上存在没有地域排除的开源权重模型,而且它 16 GB 就能跑。
两个门槛,再好的显卡也满足不了
H3 分三段跑,下载包是中间那一段。H3-Context-IR 把你的提示词和参考素材重写成一份结构化镜头描述。H3-Base 一次前向传播里生成 768 档的画面和它的声音。H3-Regenerate-2K 把那个结果连同原始上下文再送回模型跑一遍,这就是小字能活下来的原因。放出来的只有 H3-Base。
没有哪张卡能解决这件事:一整机架的 H200 上限也还是 768。所以诚实的对照物是每输出秒 $0.08,不是 $0.13——拿 2K 的费率去对比本地渲染,等于把托管那一侧凭空抬高 62%。少掉的 Context-IR,你还能靠自己写结构化提示词补回一部分;少掉的 2K,补不了。
说到成本,划线的是使用率
一周两条和一周两百条不是同一个问题,而分开它们的并不是每小时的机时价。
每一张「本地 vs 托管」的表都漏掉的那笔账,是持久化存储。精简包 42.47 GB,完整仓库约 498.5 GB,而云盘不管你生不生成,每个月都照收。
| 精简套件 | 完整仓库 | |
|---|---|---|
| 体积 | 42.47 GB | ~498.5 GB |
| 按每 GB-月 $0.07 算存储 | ~$3 / 月 | ~$35 / 月 |
| 摊到每月 30 条片子上 | ~$0.10 一条 | ~$1.17 一条 |
第二列比直接托管这条片子还贵。这就是为什么这个决定取决于使用率而不是机时价,也是为什么一个不含这一行的计算器,一定会把本地那一侧算得更好看。
另外两个数字是你的,不是我们的。云 GPU 的价格每周都在动,也分区域,所以去查今天的,别信一份缓存下来的报价。还有「留一条要抽几次」:创作者普遍报的是三到四次,而它会把上面所有的数字乘一遍。
说到隐私:到底什么东西离开了你的机器
「本地就等于私密」这句话成立,但有一个没人写出来的前提。
权重下完之后,你自己显卡上的 H3-Base 确实是离线的。可一旦你去调 Context-IR 改提示词,或者调 Regenerate-2K 拿一个能交付的分辨率,你的素材就被上传了——那两段都是托管的,从一个本地界面去调它们,并不会让它们变成本地的。
所以那个真正离线的配置,恰恰是放弃了提示词理解和 2K 的那个。这是一次真实的交换,不是白捡的便宜。另外说清楚:在我们这儿生成,同样会上传你的素材。
你是哪一行
自部署是对的,如果你的素材不能离开你的网络、如果你想做微调,或者如果你有一张快卡而且每天都在生成。这些在这儿知道,比付完我们的钱再知道要好。
微调是唯一一个花钱租不到的优势。MiniMax 放出完整权重就是为了支持它,而任何托管界面——包括我们——都做不到。托管接入擅长的是另外那一半:不用下载、不用装驱动、有 2K,以及那两段从来没放出来过的东西。
大家下载之前会问的
最低配置是多少? 没有公布过通用的最低配置;诚实的答案是一个区间,不是一个数。有一次跑完的记录是 12 GB 显存加 32 GB 主机内存、大量换页;16 GB 有一个 182 秒的结果;再往上,没有受控的基线。卡住人的往往是主机内存,不是显存。
本地跑更便宜吗? 通常不是,除非你的显卡一直在忙。租来的算力可以做到低于每秒 $0.08,但持久化存储是一笔跟你产量无关的固定月费,量小的时候它就是大头。
本地能出 2K 吗? 不能,砸多少硬件都不能。开源权重是 H3-Base,上限就在 768 档。官方的 2K 是一段托管环节。
Mac 上能跑吗? 能,很慢。官方没有验证过任何东西,但社区的运行确实跑完了:128 GB 的 M4 Max 上,一条 15 秒 480p 用了 90 分钟;64 GB 的 M5 Pro 上,九秒用了一小时。声音同样是本地模型出的。适合满足好奇心,不适合迭代。
AMD 能用吗? 数据中心的 MI300X 和 MI355X 通过服务端运行时验证过。这不构成消费级 Radeon 卡的证据,而且没有公布过任何一次桌面 Radeon 跑完的结果。
一条片子要多久? 三分钟到一个半小时,看你的机器和画布。托管生成有人报的是 30 到 90 秒。
是不是要 384 GB 系统内存? 不用。那个数字是把一次官方服务端基准读错了:377 GiB 是测试机有的,不是模型要的。同一次运行每张卡峰值 26.3 GiB,而消费级配置在 32 GB 上就能跑完。
要下多少东西? 文字与图片那套精简包 42.47 GB,加上参考 checkpoint 是 63.44 GB。除此之外还要给缓存和成片留余量。
我住的地方允许跑吗? 只要不在被排除的地域就行:美国、欧盟、英国和韩国。这条限制也管到产出物。托管接入不受这一条影响。这是摘要,不是法律意见。
哪些东西可能变。 首个开源版本里没有原生稀疏注意力,所以上面每一个耗时都是全注意力下的。如果 H3-Regenerate-2K 哪天放出来,「本地出不了 2K」这句话就不再成立。云 GPU 价格每周都在变。最后核对于 2026-08-14。
在浏览器里花两分钟,比花一个下午加 42.47 GB 便宜。不管你的账算成什么样,在押注任何一条路之前,你都可以先听听 H3 做出来是什么样。
作者
编辑部
minimax-h3ai.video


