Guides

MiniMax H3 ComfyUI:版本、四个文件,和那个止住 OOM 的开关

原生节点在 0.30.0 就有了,但止住爆显存的修复是 0.32.0 才进的,而多数教程还停在 0.30.0。这里是当前状态,每条都带 PR 号。

9 分钟读完编辑部编辑部
MiniMax H3 ComfyUI:版本、四个文件,和那个止住 OOM 的开关

在 ComfyUI 里跑 MiniMax H3,你需要 ComfyUI 0.32.0 或更新的版本、合计 42.47 GB 的四个模型文件,以及零个自定义节点。原生支持是 0.30.0 来的,但修音频失真的采样器补丁落在 0.31.0,峰值显存的修复落在 0.32.0。24 GB 的卡上,决定它能不能跑完的是主机内存。

这里的每一条都有日期。0.30.0 之后又进了九个 H3 修复,所以第一周写出来的教程描述的是另一个程序。下面每条事实都带着它的 PR 号和发布版本。

下载任何东西之前先看这一条:MiniMax H3 社区许可证把美国、欧盟、英国和韩国排除在「本地跑权重」的授权之外,而 §V.4 把这条限制延伸到了产出物上。托管 API 不受地域条款约束。这是摘要,不是法律意见——许可证逐条拆解里有条文。

0.30.0 给了你什么,又没给什么

0.30.0 是节点和三个本地示例模板出现的那一版。它就只有这些。

0.31.0 在 8 月 8 日又带来六个修复,领头的是 kijai 的 #15243Fix sampler issues for audio with minimax0.32.0 在 8 月 11 日带来三个,其中包括 comfyanonymous 的 #15486Fix peak memory issue with H3——一张过去必死的 24 GB 卡现在能跑完,就是因为它。

版本PR修的是什么严重程度
0.31.0#15243采样器把音频那条时间表走过头了;4 步下直接是噪声阻断级
0.31.0#15390EasyCache 把音轨弄坏严重
0.31.0#15377音频 VAE 完全卸载会失败严重
0.31.0#15334int8_convrot 那个 VAE 加载不了严重
0.31.0#15322带遮罩的采样算错轻微
0.31.0#15268VAE 解码期间设备不匹配报错轻微
0.32.0#15486就是那个 OOM。 在你手动打任何补丁之前先升级阻断级
0.32.0#15477分块 VAE 解码在 NestedTensor latent 上崩严重
0.32.0#15446没有它,解码更慢也更吃资源轻微

8 月 13 日的 0.33.1 加了 MiniMax ContextIR 与 Regenerate-2K 的 API 节点(#15471),所以托管的 2K 那一段可以接在本地工作流后面。它的权重仍然没开源,而且我们自己没跑过这一条。

cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version        # 期待 0.32.0 或更新

Windows 便携版:用自带的更新脚本,或者应用内的更新器。

该下哪几个模型文件,放到哪儿

别克隆整个仓库——那里面每个精度变体都在,合计约 475 GB。一个文生视频或图片生视频的工作流,正好加载四个文件,8 月 14 日按字节和 Hugging Face 核对过。

文件体积放进
minimax_h3_fl2va_pruned_int8_convrot.safetensors20.97 GBmodels/diffusion_models/
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.69 GBmodels/text_encoders/
minimax_h3_video_vae_fp16.safetensors5.21 GBmodels/vae/
minimax_h3_audio_vae_fp32.safetensors0.61 GBmodels/vae/
合计42.47 GB = 39.55 GiB
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models

参考生视频要多一个文件,也就是单独那份 Ref2VA checkpoint,整套变成 63.44 GB。把 FL2VA 那个文件加载进 R2V 工作流,是第一次跑最常见的失败原因。

有两张被大量转载的文件表,数字用的是 gibibyte,标签写的却是 GB。如果你只腾了 39.6 GB 硬盘,那么在 ComfyUI 写下第一个字节之前,你就已经差 2.9 GB 了。

关于精度:光是扩散模型,bf16 就有 66.28 GB——除非你知道自己为什么要它,否则别选。fp8_scaled 是 20.96 GB,跟 int8_convrot 体积几乎一样;只在 int8_convrot 在你的环境里编不起来的时候才选它。

然后:Workflow → Browse Templates → Video → MiniMax H3。三个本地模板,另外三个走 API。

你的显卡跑得动吗

没有官方最低配置,而且你能找到的每一张硬件表都跟别的表打架,因为它们量的根本不是同一样东西。

弄死这一次运行的是主机内存,不是显存

在 4090 上跑精简 INT8 那一套,采样期间待在显存里的只有大约 6.6 GB——权重住在主机内存里,按需换进来。所以失败是主机内存的失败。有一次有记录的 3090 运行冲到 31,997 MB 里的 29,866 MB,被内核杀掉;同一个任务加上 --disable-pinned-memory,峰值只有 7,508 MB,23 分 17 秒跑完。锁页内存是换不出去的,这就是为什么单加交换分区一点用都没有。

如果你卡在 0.30–0.31 又没法升级,那些能复现的偏方改的都是同一个常数——comfy/supported_models.py 里的 MiniMaxH3.memory_usage_factor,从 0.114 改成 1.0。在 0.32.0 之后,先升级,只在它还 OOM 的时候才去打补丁。

实测记录,以及各自背后的硬件

已经有十四次运行公布了足够归因的细节。它们都不是基准测试——没有人把变量控住过。把它们当成存在性证明来读:这套配置跑完了,用了这么久。

显卡显存主机内存画布时长耗时
RTX 306012 GB16 GB0.2 MP5 秒51 分 07 秒
RTX 306012 GB32 GB864×4805.17 秒,20 步不到 9 分钟
RTX 30708 GB32 GB0.4 MP5 秒约 9–10 分钟
RTX 4090 Laptop + SageAttention16 GB32 GB960×5405 秒,20 步182 秒
RTX 5070 Ti16 GB64 GB0.4 MP5 / 10 / 15 秒约 2 / 4.5 / 7 分钟
RTX 508016 GB1.0 MP10 秒13 分 36 秒
RTX 409024 GB832×48015 秒,8 步约 25–30 分钟
RTX 309024 GB31 GB15 秒23 分 17 秒
2× RTX 5090(SGLang,不是 ComfyUI各 32 GB377 GiB1344×768124 帧,50 步559.67 秒

最后那一行是另一套运行时,跑在两张卡加 377 GiB 主机内存上。列在这儿是给个量级,不是拿来比的——用它去预测单卡 ComfyUI 的速度是错的。在单张 4090 上,同一套配方给出的是一个可行性边界:832×480 在 124 帧和 362 帧都能跑完,1088×640 在 124 帧能跑完,而 1088×640 上 192 帧、1344×768 上 362 帧都会 OOM。

这张卡到底回不回得了本,是另一笔账

分辨率、帧数,和 17n+5 网格

Resolution Selector 上的三个设置决定宽高。Multiple 保持 32——那是 H3 的网格。原生画布是短边 768 像素,上限 768×1344。16:9 下,Megapixels 填 0.98 正好给出 1344×768;1.0 那个预设给的是 1376×768,已经出了文档写的画布。模板出厂是 0.4 MP。就从那儿开始。下限是 384p;256p 直接失败。

帧数在 24 fps 下吸附到 17n+5,所以多数请求会往上取整。175 帧是 7.29 秒;没有 7.00 这个值。整个 4–15 秒区间里,正好只有一个值落在整秒上:192 帧,8.000 秒。经过验证的上限是 362 帧,也就是 15.08 秒。

没声音,或者声音是坏的

两种不同的失败,两个不同的原因。

没声音是接线问题。 两个 VAE 都得加载,而且 VAEDecodeAudio 的输出必须接到保存节点上。去查文件,别去查播放器——你应该看到 24 fps 的 H.264 和 32 kHz 的 AAC 立体声。没有第二条流,说明工作流错了,不是模型错了。

ffprobe -hide_banner out.mp4

失真是采样器问题。 H3 的画面和声音跑在两条 flow 时间表上,shift 12 和 shift 3,而单时钟采样器会把其中一条走过头。20 步下这个误差看不出来;到 Turbo LoRA 用的 4 步,它就变成削波和噪声。ComfyUI 0.31.0 通过 ModelSamplingAV 原生处理这两条时间表。低于这个版本,你需要 larryvrh 的双时钟采样器。

报错,以及各自的一行修法

动手之前先记两条规矩。一次只改一个变量,而且用同样的提示词和 seed 重跑——把 --lowvram--reserve-vram--cache-none 和一个量化 checkpoint 一次性堆上去,你就再也说不清是哪一个起了作用。另外,先让一个干净的官方模板跑通,再去加 SageAttention、TeaCache、EasyCache 或者 GGUF 加载器。

控制台里的现象原因修法
采样中 CUDA out of memory画布 × 帧数超出了计划先降 Megapixels,再降帧数。在 0.30–0.31 上,升到 0.32.0(#15486
进程被杀、机器卡死、没有 CUDA 报错主机内存。 锁页内存换不出去--disable-pinned-memory --disable-async-offload
只在 VAE 解码时 OOM解码分配随帧数增长减帧数或者缩画布;升到 0.32.0(#15477#15446
找不到 MiniMaxH3… 节点或模板核心版本低于 0.30.0python main.py --version,升级,重启
哪儿都找不到「text to video」节点是误会T2V 模板就是什么都不接的 MiniMaxH3ImageToVideo。不要去装第三方的替代节点
R2V 工作流报加载错误选成了 FL2VA 而不是 Ref2VAminimax_h3_ref2va_pruned_int8_convrot.safetensors
成片没有音频流音频 VAE 没加载,或者 VAEDecodeAudio 没接到保存节点两处都查一遍,用 ffprobe 验证
声音削波、嗡嗡响,或者变成噪声两条 flow 时间表被一个时钟走了升到 0.31.0(#15243),或者用 larryvrh 的 Turbo Sampler
256p 下生成失败低于 H3 的 384p 下限用模板预设

想让它更快,按这个顺序

按这个顺序,因为前两条不花钱,最后一条要拿画质换。

  1. 升级。 0.32.0 的 VAE 优化和内存修复,比任何一个启动参数都值钱。
  2. 先降画布,再降时长。 0.4 MP 能跑完的地方,1 MP 在 24 GB 卡上常常跑不完。
  3. SageAttention。--use-sage-attention 启动,或者用 KJNodes 打进去。ComfyUI 自己估的是大约翻倍;卡在换页上的机器提升会少一些。dtype 回退的警告是正常的。
  4. Turbo LoRA。 larryvrh 的 v4 把采样从大约 20 步压到 4–8 步。用 6–8;4 步会把快速运动糊掉,超过 8 步就不再有帮助了。

不要在用 --disable-pinned-memory 的同时加 --lowvram。它们互相冲突。

什么时候不该在 ComfyUI 里跑

三种情况本地是错的答案,一种情况它显然是对的。

如果你在美国、欧盟、英国或韩国,并且是自部署权重,本地就是错的;许可证没给这个授权。如果你需要开源权重下的 2K,也是错的,因为 Regenerate-2K 从来没有放出来过。如果你是 8 GB 显存加 16 GB 系统内存,那也是错的——那种配置下有人报过一条五秒片子跑了 51 分钟。

本地是对的,条件是你有 24 GB 显存、32 GB 主机内存,而且在被允许的地域。 这时 ComfyUI 给你的批处理、LoRA 和节点级控制,是任何托管界面——包括我们——都比不了的。这也是为什么这里每个文件名和每个参数都写全了。

第一次跑失败之后的问题

要装自定义节点吗? 不用。0.30.0 起就是原生的,模板只用核心节点。

为什么没有文生视频节点? T2V 模板就是什么都不接的 MiniMaxH3ImageToVideo。这是设计如此。

到底该跑哪个版本? 0.32.0 或更新。0.30.0 能跑,但少了九个 H3 修复。

我的成片为什么没声音? 两个 VAE 都得加载,而且 VAEDecodeAudio 必须接到保存节点。用 ffprobe 验证。

4 步下声音为什么会坏? 单时钟采样把音频那条时间表走过头了。0.31.0 修好了。

要多少硬盘? T2V 和 I2V 是 42.47 GB,带上 Ref2VA 是 63.44 GB,再加缓存。

12 GB 的卡行不行? 行,但要大量换页。有维护者报过 864×480、124 帧、20 步,不到九分钟。

我要的 7 秒为什么变长了? 帧数吸附到 17n+5。175 帧是 7.29 秒。

要不要用 GGUF 版本? 没有官方的。等官方那一套跑通之后再试。

本地能出 2K 吗? 开源权重出不了。0.33.1 之后你可以把托管的 Regenerate-2K 节点接上去。


哪些东西可能变。 这块每周都在动:去 ComfyUI 的发布记录里找比 0.33.1 更新的 H3 条目。362 帧那个上限是第三方文档写的,不是官方给的天花板。另外 memory_usage_factor 那个补丁,在 0.32.0 之后可能已经不需要了。最后核对于 2026-08-14。

编辑部

作者

编辑部

minimax-h3ai.video

所有文章