MiniMax H3 no ComfyUI: a versão, os arquivos, e a flag que para o OOM
Os nós nativos saíram na 0.30.0; a correção do estouro de memória saiu na 0.32.0, e a maioria dos guias para antes. Estado atual, com os PRs.

Para rodar o MiniMax H3 no ComfyUI você precisa do ComfyUI 0.32.0 ou mais recente, de quatro arquivos de modelo somando 42,47 GB, e de nó customizado nenhum. O suporte nativo chegou na 0.30.0, mas a correção do sampler para o áudio distorcido veio na 0.31.0 e a correção do pico de memória na 0.32.0. Numa placa de 24 GB, quem decide se termina é a RAM do host.
Tudo aqui está datado. Nove correções do H3 saíram depois da 0.30.0, então um guia escrito na primeira semana descreve outro programa. Cada fato abaixo carrega o número do pull request e a versão.
Confira isto antes de baixar qualquer coisa: a MiniMax H3 Community Licence exclui os EUA, a UE, o Reino Unido e a Coreia do Sul da concessão para rodar os pesos localmente, e o §V.4 estende essa restrição à saída. A API hospedada não é coberta pela cláusula de território. Um resumo, não aconselhamento jurídico — a análise completa da licença tem as cláusulas.
O que a 0.30.0 te dá, e o que ela não dá
A 0.30.0 é onde aparecem os nós e os três templates locais de exemplo. Só isso.
Mais seis correções chegaram na 0.31.0 em 8 de agosto, lideradas pelo
#15243 do kijai, Fix sampler issues for audio with minimax. Outras três
chegaram na 0.32.0 em 11 de agosto, incluindo o #15486 do comfyanonymous,
Fix peak memory issue with H3 — o motivo pelo qual uma placa de 24 GB que
morria agora termina.
| Versão | PR | O que corrige | Gravidade |
|---|---|---|---|
| 0.31.0 | #15243 | O sampler passa do cronograma do áudio; em 4 passos vira ruído | impeditivo |
| 0.31.0 | #15390 | O EasyCache corrompe a trilha sonora | grave |
| 0.31.0 | #15377 | O offload completo do VAE de áudio falha | grave |
| 0.31.0 | #15334 | O VAE int8_convrot não carrega | grave |
| 0.31.0 | #15322 | A amostragem com máscara está errada | leve |
| 0.31.0 | #15268 | Erros de dispositivo incompatível durante o decode do VAE | leve |
| 0.32.0 | #15486 | A do OOM. Atualize antes de remendar qualquer coisa à mão | impeditivo |
| 0.32.0 | #15477 | O decode de VAE em ladrilhos quebra com latentes NestedTensor | grave |
| 0.32.0 | #15446 | O decode fica mais lento e mais pesado sem isso | leve |
A 0.33.1 em 13 de agosto acrescentou nós de API do MiniMax ContextIR e do
Regenerate-2K (#15471), então o estágio hospedado de 2K pode ser encadeado
num grafo local. Os pesos desse estágio continuam hospedados, então esse
caminho precisa de uma chave de API e não de um checkpoint local.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version # expect 0.32.0 or laterWindows portátil: use o script de atualização que vem junto ou o atualizador dentro do app.
Quais arquivos de modelo baixar, e para onde eles vão
Não clone o repositório — ele guarda toda variante de precisão e soma uns 475 GB. Um grafo de texto para vídeo ou de imagem para vídeo carrega exatamente quatro arquivos, conferidos byte a byte contra o Hugging Face em 14 de agosto.
| Arquivo | Tamanho | Vai em |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 GB | models/diffusion_models/ |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 GB | models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | 5,21 GB | models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | 0,61 GB | models/vae/ |
| Total | 42,47 GB = 39,55 GiB |
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir ComfyUI/modelsReferência para vídeo acrescenta um quinto arquivo, o checkpoint Ref2VA separado, levando o conjunto a 63,44 GB. Carregar o arquivo FL2VA num grafo de R2V é a falha de primeira execução mais comum.
Duas tabelas de arquivos muito copiadas reportam esses números em gibibytes rotulando como GB. Se você liberou 39,6 GB de disco, faltam 2,9 GB antes de o ComfyUI escrever qualquer coisa.
Sobre precisão: o bf16 são 66,28 GB só para o modelo de difusão — escolha ele
só se você sabe por quê. O fp8_scaled são 20,96 GB, quase idêntico em tamanho
ao int8_convrot; escolha ele só se o int8_convrot não montar no seu
ambiente.
Depois: Workflow → Browse Templates → Video → MiniMax H3. Três templates locais, mais três que chamam a API.
A sua GPU vai rodar isso?
Não existe mínimo oficial, e toda tabela de hardware que você encontrar discorda das outras porque cada uma mediu uma coisa.
Quem mata a execução é a RAM do host, não a VRAM
Numa 4090 rodando a pilha INT8 podada, só cerca de 6,6 GB ficam na VRAM
durante a amostragem — os pesos moram na memória do host e são paginados para
dentro. Então a falha é uma falha de memória do host. Uma execução documentada
numa 3090 chegou a 29.866 MB de 31.997 MB e foi morta pelo kernel; o mesmo
trabalho com --disable-pinned-memory teve pico de 7.508 MB e terminou em
23 minutos e 17 segundos. Você não consegue paginar memória fixada para fora,
que é por que acrescentar swap sozinho não muda nada.
Se você está na 0.30–0.31 e não pode atualizar, as receitas reprodutíveis mudam
uma constante — o MiniMaxH3.memory_usage_factor em
comfy/supported_models.py, de 0.114 para 1.0. Na 0.32.0 ou mais recente,
atualize primeiro e só remende se ainda der OOM.
Execuções medidas, e o hardware por trás de cada uma
Catorze execuções foram publicadas com detalhe suficiente para atribuir. Nenhuma é um benchmark — ninguém segurou as variáveis. Leia como provas de existência: esta configuração terminou, neste tempo.
| GPU | VRAM | RAM do host | Tela | Duração | Tempo |
|---|---|---|---|---|---|
| RTX 3060 | 12 GB | 16 GB | 0,2 MP | 5 s | 51 min 07 s |
| RTX 3060 | 12 GB | 32 GB | 864×480 | 5,17 s, 20 passos | menos de 9 min |
| RTX 3070 | 8 GB | 32 GB | 0,4 MP | 5 s | ~9–10 min |
| RTX 4090 Laptop + SageAttention | 16 GB | 32 GB | 960×540 | 5 s, 20 passos | 182 s |
| RTX 5070 Ti | 16 GB | 64 GB | 0,4 MP | 5 / 10 / 15 s | ~2 / 4,5 / 7 min |
| RTX 5080 | 16 GB | — | 1,0 MP | 10 s | 13 min 36 s |
| RTX 4090 | 24 GB | — | 832×480 | 15 s, 8 passos | ~25–30 min |
| RTX 3090 | 24 GB | 31 GB | — | 15 s | 23 min 17 s |
| 2× RTX 5090 (SGLang, não ComfyUI) | 32 GB cada | 377 GiB | 1344×768 | 124 quadros, 50 passos | 559,67 s |
Essa última linha é outro runtime, em duas placas, com 377 GiB de RAM de host. Ela está listada para dar escala, não para comparar — usar ela para prever velocidade de ComfyUI em placa única está errado. Numa 4090 única, a mesma receita dá uma margem de viabilidade: 832×480 termina com 124 e com 362 quadros, 1088×640 termina com 124 quadros, e tanto 1088×640 com 192 quadros quanto 1344×768 com 362 quadros dão OOM.
Se a placa se paga é outra conta.
Resolução, quadros, e a grade 17n+5
Três ajustes no Resolution Selector produzem largura e altura. Mantenha o Multiple em 32 — essa é a grade do H3. A tela nativa é um lado curto de 768 pixels, limitada a 768×1344. Em 16:9, Megapixels 0,98 dá exatamente 1344×768; o preset 1,0 dá 1376×768, que está fora da tela documentada. Os templates vêm com 0,4 MP. Comece por aí. O piso é 384p; 256p falha direto.
As contagens de quadros encaixam em 17n+5 a 24 fps, então a maioria dos pedidos arredonda para cima. 175 quadros são 7,29 segundos; não existe 7,00. Em toda a faixa de 4 a 15 segundos exatamente um valor cai num segundo inteiro: 192 quadros, 8,000 segundos. O teto validado são 362 quadros, ou 15,08 segundos.
Sem áudio, ou áudio distorcido
Duas falhas diferentes com duas causas diferentes.
Silêncio é problema de ligação. Os dois VAEs têm de estar carregados e a
saída do VAEDecodeAudio tem de chegar ao nó de salvar. Confira o arquivo, não
o player — você deveria ver H.264 a 24 fps e AAC estéreo a 32 kHz. Nenhum
segundo fluxo quer dizer que o grafo está errado, não o modelo.
ffprobe -hide_banner out.mp4Distorção é problema de sampler. O H3 roda imagem e som em dois
cronogramas de fluxo, shift 12 e shift 3, e um sampler de relógio único passa
de um deles. Com 20 passos o erro é invisível; com os 4 passos que uma LoRA
Turbo usa, ele vira clipping e ruído. O ComfyUI 0.31.0 lida com os dois
cronogramas nativamente pelo ModelSamplingAV. Abaixo dessa versão você
precisa do sampler de relógio duplo do larryvrh.
Erros, e a correção de uma linha para cada um
Duas regras antes de mudar qualquer coisa. Mude uma variável de cada vez e rode
o mesmo prompt e a mesma seed — empilhar --lowvram, --reserve-vram,
--cache-none e um checkpoint quantizado de uma vez te deixa sem ideia de qual
deles ajudou. E faça um template oficial simples terminar antes de acrescentar
SageAttention, TeaCache, EasyCache ou um loader de GGUF.
| Sintoma no console | Causa | Correção |
|---|---|---|
CUDA out of memory durante a amostragem | Tela × quadros passam do plano | Baixe os Megapixels primeiro, os quadros depois. Na 0.30–0.31, atualize para a 0.32.0 (#15486) |
| Processo morto, máquina trava, sem erro de CUDA | RAM do host. Memória fixada não pode ser paginada para fora | --disable-pinned-memory --disable-async-offload |
| OOM só durante o decode do VAE | A alocação do decode escala com os quadros | Menos quadros ou tela menor; atualize para a 0.32.0 (#15477, #15446) |
Nós ou templates MiniMaxH3… ausentes | Core mais antigo que a 0.30.0 | python main.py --version, atualize, reinicie |
| Nenhum nó de «texto para vídeo» em lugar nenhum | Mal-entendido | O template de T2V é o MiniMaxH3ImageToVideo sem nada conectado. Não instale substitutos de terceiros |
| Erro de loader no grafo de R2V | Checkpoint FL2VA selecionado em vez do Ref2VA | Selecione minimax_h3_ref2va_pruned_int8_convrot.safetensors |
| A saída não tem fluxo de áudio | VAE de áudio não carregado, ou VAEDecodeAudio não chegando ao nó de salvar | Confira os dois, verifique com ffprobe |
| O áudio corta, zumbe ou vira ruído | Dois cronogramas de fluxo num relógio só | Atualize para a 0.31.0 (#15243), ou use o Turbo Sampler do larryvrh |
| A geração falha em 256p | Abaixo do piso de 384p do H3 | Use os presets dos templates |
Deixando mais rápido, na ordem que ajuda
Nesta ordem, porque os dois primeiros são de graça e o último custa qualidade.
- Atualize. A otimização de VAE e a correção de memória da 0.32.0 valem mais que qualquer flag.
- Baixe a tela antes da duração. 0,4 MP termina onde 1 MP numa placa de 24 GB muitas vezes não termina.
- SageAttention. Suba com
--use-sage-attention, ou aplique pelos KJNodes. O ComfyUI estima mais ou menos o dobro; máquinas presas ao offload veem menos. Os avisos de fallback de dtype são esperados. - LoRA Turbo. A v4 do larryvrh corta a amostragem de uns 20 passos para 4–8. Use 6–8; 4 borra movimento rápido, e passando de 8 para de ajudar.
Não acrescente --lowvram junto de --disable-pinned-memory. Eles conflitam.
Quando não rodar no ComfyUI
Três casos em que o local é a resposta errada, e um em que ele é claramente a certa.
O local é errado se você está nos EUA, na UE, no Reino Unido ou na Coreia do Sul e vai rodar os pesos por conta própria; a licença não concede isso. É errado se você precisa de 2K a partir de pesos abertos, porque o Regenerate-2K nunca foi liberado. E é errado em 8 GB com 16 GB de RAM de sistema, onde um clipe de cinco segundos foi relatado em 51 minutos.
O local é certo se você tem 24 GB de VRAM, 32 GB de RAM de host e um território permitido. O ComfyUI te dá então lotes, LoRAs e controle no nível do nó que interface hospedada nenhuma, a nossa inclusive, consegue igualar. É por isso que cada nome de arquivo e cada flag aqui estão escritos por extenso.
Perguntas depois de uma primeira execução que falhou
Preciso de um nó customizado? Não. Nativo desde a 0.30.0, e os templates usam só nós do core.
Por que não existe um nó de texto para vídeo?
O template de T2V é o MiniMaxH3ImageToVideo sem nada conectado. É de
propósito.
Qual versão eu deveria rodar de verdade? A 0.32.0 ou mais recente. A 0.30.0 roda, mas perde nove correções do H3.
Por que a minha saída está muda?
Os dois VAEs têm de carregar e o VAEDecodeAudio tem de chegar ao nó de
salvar. Verifique com o ffprobe.
Por que o som quebra com 4 passos? Amostragem de relógio único passa do cronograma do áudio. Corrigido na 0.31.0.
De quanto disco eu preciso? 42,47 GB para T2V e I2V, 63,44 GB com o Ref2VA, mais cache.
Uma placa de 12 GB dá conta? Dá, com offload pesado. Uma pessoa que mantém o projeto relatou 864×480, 124 quadros, 20 passos, em menos de nove minutos.
Por que o meu clipe de 7 segundos rodou mais longo? Os quadros encaixam em 17n+5. 175 quadros são 7,29 segundos.
Eu deveria usar uma build GGUF? Não existe uma oficial. Tente só depois que a pilha oficial funcionar.
Consigo 2K localmente? A partir de pesos abertos, não. Desde a 0.33.1 você pode encadear o nó hospedado do Regenerate-2K.
Se o download de 42,47 GB ou a matriz de versões é o que está te travando, o gerador de vídeo com IA MiniMax H3 roda os três estágios hospedados, sem nada para instalar e sem cartão.
O que pode mudar. Isto se move toda semana: confira nas versões do ComfyUI
se há entradas de H3 mais novas que a 0.33.1. O teto de 362 quadros é
documentação de terceiros, não um limite oficial. E o remendo do
memory_usage_factor pode já ser desnecessário na 0.32.0 e adiante. Última
verificação em 2026-08-14.
Escrito por
Redação
minimax-h3ai.video
Publicado no gerador de vídeo com IA MiniMax H3, uma interface independente, de terceiros, construída sobre o MiniMax H3.


