Guides

MiniMax H3 no ComfyUI: a versão, os arquivos, e a flag que para o OOM

Os nós nativos saíram na 0.30.0; a correção do estouro de memória saiu na 0.32.0, e a maioria dos guias para antes. Estado atual, com os PRs.

9 min de leituraRedaçãoRedação
MiniMax H3 no ComfyUI: a versão, os arquivos, e a flag que para o OOM

Para rodar o MiniMax H3 no ComfyUI você precisa do ComfyUI 0.32.0 ou mais recente, de quatro arquivos de modelo somando 42,47 GB, e de nó customizado nenhum. O suporte nativo chegou na 0.30.0, mas a correção do sampler para o áudio distorcido veio na 0.31.0 e a correção do pico de memória na 0.32.0. Numa placa de 24 GB, quem decide se termina é a RAM do host.

Tudo aqui está datado. Nove correções do H3 saíram depois da 0.30.0, então um guia escrito na primeira semana descreve outro programa. Cada fato abaixo carrega o número do pull request e a versão.

Confira isto antes de baixar qualquer coisa: a MiniMax H3 Community Licence exclui os EUA, a UE, o Reino Unido e a Coreia do Sul da concessão para rodar os pesos localmente, e o §V.4 estende essa restrição à saída. A API hospedada não é coberta pela cláusula de território. Um resumo, não aconselhamento jurídico — a análise completa da licença tem as cláusulas.

O que a 0.30.0 te dá, e o que ela não dá

A 0.30.0 é onde aparecem os nós e os três templates locais de exemplo. Só isso.

Mais seis correções chegaram na 0.31.0 em 8 de agosto, lideradas pelo #15243 do kijai, Fix sampler issues for audio with minimax. Outras três chegaram na 0.32.0 em 11 de agosto, incluindo o #15486 do comfyanonymous, Fix peak memory issue with H3 — o motivo pelo qual uma placa de 24 GB que morria agora termina.

VersãoPRO que corrigeGravidade
0.31.0#15243O sampler passa do cronograma do áudio; em 4 passos vira ruídoimpeditivo
0.31.0#15390O EasyCache corrompe a trilha sonoragrave
0.31.0#15377O offload completo do VAE de áudio falhagrave
0.31.0#15334O VAE int8_convrot não carregagrave
0.31.0#15322A amostragem com máscara está erradaleve
0.31.0#15268Erros de dispositivo incompatível durante o decode do VAEleve
0.32.0#15486A do OOM. Atualize antes de remendar qualquer coisa à mãoimpeditivo
0.32.0#15477O decode de VAE em ladrilhos quebra com latentes NestedTensorgrave
0.32.0#15446O decode fica mais lento e mais pesado sem issoleve

A 0.33.1 em 13 de agosto acrescentou nós de API do MiniMax ContextIR e do Regenerate-2K (#15471), então o estágio hospedado de 2K pode ser encadeado num grafo local. Os pesos desse estágio continuam hospedados, então esse caminho precisa de uma chave de API e não de um checkpoint local.

cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version        # expect 0.32.0 or later

Windows portátil: use o script de atualização que vem junto ou o atualizador dentro do app.

Quais arquivos de modelo baixar, e para onde eles vão

Não clone o repositório — ele guarda toda variante de precisão e soma uns 475 GB. Um grafo de texto para vídeo ou de imagem para vídeo carrega exatamente quatro arquivos, conferidos byte a byte contra o Hugging Face em 14 de agosto.

ArquivoTamanhoVai em
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 GBmodels/diffusion_models/
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GBmodels/text_encoders/
minimax_h3_video_vae_fp16.safetensors5,21 GBmodels/vae/
minimax_h3_audio_vae_fp32.safetensors0,61 GBmodels/vae/
Total42,47 GB = 39,55 GiB
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models

Referência para vídeo acrescenta um quinto arquivo, o checkpoint Ref2VA separado, levando o conjunto a 63,44 GB. Carregar o arquivo FL2VA num grafo de R2V é a falha de primeira execução mais comum.

Duas tabelas de arquivos muito copiadas reportam esses números em gibibytes rotulando como GB. Se você liberou 39,6 GB de disco, faltam 2,9 GB antes de o ComfyUI escrever qualquer coisa.

Sobre precisão: o bf16 são 66,28 GB só para o modelo de difusão — escolha ele só se você sabe por quê. O fp8_scaled são 20,96 GB, quase idêntico em tamanho ao int8_convrot; escolha ele só se o int8_convrot não montar no seu ambiente.

Depois: Workflow → Browse Templates → Video → MiniMax H3. Três templates locais, mais três que chamam a API.

A sua GPU vai rodar isso?

Não existe mínimo oficial, e toda tabela de hardware que você encontrar discorda das outras porque cada uma mediu uma coisa.

Quem mata a execução é a RAM do host, não a VRAM

Numa 4090 rodando a pilha INT8 podada, só cerca de 6,6 GB ficam na VRAM durante a amostragem — os pesos moram na memória do host e são paginados para dentro. Então a falha é uma falha de memória do host. Uma execução documentada numa 3090 chegou a 29.866 MB de 31.997 MB e foi morta pelo kernel; o mesmo trabalho com --disable-pinned-memory teve pico de 7.508 MB e terminou em 23 minutos e 17 segundos. Você não consegue paginar memória fixada para fora, que é por que acrescentar swap sozinho não muda nada.

Se você está na 0.30–0.31 e não pode atualizar, as receitas reprodutíveis mudam uma constante — o MiniMaxH3.memory_usage_factor em comfy/supported_models.py, de 0.114 para 1.0. Na 0.32.0 ou mais recente, atualize primeiro e só remende se ainda der OOM.

Execuções medidas, e o hardware por trás de cada uma

Catorze execuções foram publicadas com detalhe suficiente para atribuir. Nenhuma é um benchmark — ninguém segurou as variáveis. Leia como provas de existência: esta configuração terminou, neste tempo.

GPUVRAMRAM do hostTelaDuraçãoTempo
RTX 306012 GB16 GB0,2 MP5 s51 min 07 s
RTX 306012 GB32 GB864×4805,17 s, 20 passosmenos de 9 min
RTX 30708 GB32 GB0,4 MP5 s~9–10 min
RTX 4090 Laptop + SageAttention16 GB32 GB960×5405 s, 20 passos182 s
RTX 5070 Ti16 GB64 GB0,4 MP5 / 10 / 15 s~2 / 4,5 / 7 min
RTX 508016 GB1,0 MP10 s13 min 36 s
RTX 409024 GB832×48015 s, 8 passos~25–30 min
RTX 309024 GB31 GB15 s23 min 17 s
2× RTX 5090 (SGLang, não ComfyUI)32 GB cada377 GiB1344×768124 quadros, 50 passos559,67 s

Essa última linha é outro runtime, em duas placas, com 377 GiB de RAM de host. Ela está listada para dar escala, não para comparar — usar ela para prever velocidade de ComfyUI em placa única está errado. Numa 4090 única, a mesma receita dá uma margem de viabilidade: 832×480 termina com 124 e com 362 quadros, 1088×640 termina com 124 quadros, e tanto 1088×640 com 192 quadros quanto 1344×768 com 362 quadros dão OOM.

Se a placa se paga é outra conta.

Resolução, quadros, e a grade 17n+5

Três ajustes no Resolution Selector produzem largura e altura. Mantenha o Multiple em 32 — essa é a grade do H3. A tela nativa é um lado curto de 768 pixels, limitada a 768×1344. Em 16:9, Megapixels 0,98 dá exatamente 1344×768; o preset 1,0 dá 1376×768, que está fora da tela documentada. Os templates vêm com 0,4 MP. Comece por aí. O piso é 384p; 256p falha direto.

As contagens de quadros encaixam em 17n+5 a 24 fps, então a maioria dos pedidos arredonda para cima. 175 quadros são 7,29 segundos; não existe 7,00. Em toda a faixa de 4 a 15 segundos exatamente um valor cai num segundo inteiro: 192 quadros, 8,000 segundos. O teto validado são 362 quadros, ou 15,08 segundos.

Sem áudio, ou áudio distorcido

Duas falhas diferentes com duas causas diferentes.

Silêncio é problema de ligação. Os dois VAEs têm de estar carregados e a saída do VAEDecodeAudio tem de chegar ao nó de salvar. Confira o arquivo, não o player — você deveria ver H.264 a 24 fps e AAC estéreo a 32 kHz. Nenhum segundo fluxo quer dizer que o grafo está errado, não o modelo.

ffprobe -hide_banner out.mp4

Distorção é problema de sampler. O H3 roda imagem e som em dois cronogramas de fluxo, shift 12 e shift 3, e um sampler de relógio único passa de um deles. Com 20 passos o erro é invisível; com os 4 passos que uma LoRA Turbo usa, ele vira clipping e ruído. O ComfyUI 0.31.0 lida com os dois cronogramas nativamente pelo ModelSamplingAV. Abaixo dessa versão você precisa do sampler de relógio duplo do larryvrh.

Erros, e a correção de uma linha para cada um

Duas regras antes de mudar qualquer coisa. Mude uma variável de cada vez e rode o mesmo prompt e a mesma seed — empilhar --lowvram, --reserve-vram, --cache-none e um checkpoint quantizado de uma vez te deixa sem ideia de qual deles ajudou. E faça um template oficial simples terminar antes de acrescentar SageAttention, TeaCache, EasyCache ou um loader de GGUF.

Sintoma no consoleCausaCorreção
CUDA out of memory durante a amostragemTela × quadros passam do planoBaixe os Megapixels primeiro, os quadros depois. Na 0.30–0.31, atualize para a 0.32.0 (#15486)
Processo morto, máquina trava, sem erro de CUDARAM do host. Memória fixada não pode ser paginada para fora--disable-pinned-memory --disable-async-offload
OOM só durante o decode do VAEA alocação do decode escala com os quadrosMenos quadros ou tela menor; atualize para a 0.32.0 (#15477, #15446)
Nós ou templates MiniMaxH3… ausentesCore mais antigo que a 0.30.0python main.py --version, atualize, reinicie
Nenhum nó de «texto para vídeo» em lugar nenhumMal-entendidoO template de T2V é o MiniMaxH3ImageToVideo sem nada conectado. Não instale substitutos de terceiros
Erro de loader no grafo de R2VCheckpoint FL2VA selecionado em vez do Ref2VASelecione minimax_h3_ref2va_pruned_int8_convrot.safetensors
A saída não tem fluxo de áudioVAE de áudio não carregado, ou VAEDecodeAudio não chegando ao nó de salvarConfira os dois, verifique com ffprobe
O áudio corta, zumbe ou vira ruídoDois cronogramas de fluxo num relógio sóAtualize para a 0.31.0 (#15243), ou use o Turbo Sampler do larryvrh
A geração falha em 256pAbaixo do piso de 384p do H3Use os presets dos templates

Deixando mais rápido, na ordem que ajuda

Nesta ordem, porque os dois primeiros são de graça e o último custa qualidade.

  1. Atualize. A otimização de VAE e a correção de memória da 0.32.0 valem mais que qualquer flag.
  2. Baixe a tela antes da duração. 0,4 MP termina onde 1 MP numa placa de 24 GB muitas vezes não termina.
  3. SageAttention. Suba com --use-sage-attention, ou aplique pelos KJNodes. O ComfyUI estima mais ou menos o dobro; máquinas presas ao offload veem menos. Os avisos de fallback de dtype são esperados.
  4. LoRA Turbo. A v4 do larryvrh corta a amostragem de uns 20 passos para 4–8. Use 6–8; 4 borra movimento rápido, e passando de 8 para de ajudar.

Não acrescente --lowvram junto de --disable-pinned-memory. Eles conflitam.

Quando não rodar no ComfyUI

Três casos em que o local é a resposta errada, e um em que ele é claramente a certa.

O local é errado se você está nos EUA, na UE, no Reino Unido ou na Coreia do Sul e vai rodar os pesos por conta própria; a licença não concede isso. É errado se você precisa de 2K a partir de pesos abertos, porque o Regenerate-2K nunca foi liberado. E é errado em 8 GB com 16 GB de RAM de sistema, onde um clipe de cinco segundos foi relatado em 51 minutos.

O local é certo se você tem 24 GB de VRAM, 32 GB de RAM de host e um território permitido. O ComfyUI te dá então lotes, LoRAs e controle no nível do nó que interface hospedada nenhuma, a nossa inclusive, consegue igualar. É por isso que cada nome de arquivo e cada flag aqui estão escritos por extenso.

Perguntas depois de uma primeira execução que falhou

Preciso de um nó customizado? Não. Nativo desde a 0.30.0, e os templates usam só nós do core.

Por que não existe um nó de texto para vídeo? O template de T2V é o MiniMaxH3ImageToVideo sem nada conectado. É de propósito.

Qual versão eu deveria rodar de verdade? A 0.32.0 ou mais recente. A 0.30.0 roda, mas perde nove correções do H3.

Por que a minha saída está muda? Os dois VAEs têm de carregar e o VAEDecodeAudio tem de chegar ao nó de salvar. Verifique com o ffprobe.

Por que o som quebra com 4 passos? Amostragem de relógio único passa do cronograma do áudio. Corrigido na 0.31.0.

De quanto disco eu preciso? 42,47 GB para T2V e I2V, 63,44 GB com o Ref2VA, mais cache.

Uma placa de 12 GB dá conta? Dá, com offload pesado. Uma pessoa que mantém o projeto relatou 864×480, 124 quadros, 20 passos, em menos de nove minutos.

Por que o meu clipe de 7 segundos rodou mais longo? Os quadros encaixam em 17n+5. 175 quadros são 7,29 segundos.

Eu deveria usar uma build GGUF? Não existe uma oficial. Tente só depois que a pilha oficial funcionar.

Consigo 2K localmente? A partir de pesos abertos, não. Desde a 0.33.1 você pode encadear o nó hospedado do Regenerate-2K.


Se o download de 42,47 GB ou a matriz de versões é o que está te travando, o gerador de vídeo com IA MiniMax H3 roda os três estágios hospedados, sem nada para instalar e sem cartão.


O que pode mudar. Isto se move toda semana: confira nas versões do ComfyUI se há entradas de H3 mais novas que a 0.33.1. O teto de 362 quadros é documentação de terceiros, não um limite oficial. E o remendo do memory_usage_factor pode já ser desnecessário na 0.32.0 e adiante. Última verificação em 2026-08-14.

Redação

Escrito por

Redação

minimax-h3ai.video

Publicado no gerador de vídeo com IA MiniMax H3, uma interface independente, de terceiros, construída sobre o MiniMax H3.

Todos os artigos