Guides

MiniMax H3 en ComfyUI: la versión, los archivos y el flag que corta el OOM

Los nodos nativos llegaron en la 0.30.0; el arreglo que evita quedarse sin memoria, en la 0.32.0, y casi todas las guías paran ahí. Estado actual, con PR.

9 min de lecturaRedacciónRedacción
MiniMax H3 en ComfyUI: la versión, los archivos y el flag que corta el OOM

Para ejecutar MiniMax H3 en ComfyUI necesitas ComfyUI 0.32.0 o posterior, cuatro archivos de modelo que suman 42,47 GB, y ningún nodo personalizado. El soporte nativo llegó en la 0.30.0, pero el arreglo del sampler para el audio distorsionado aterrizó en la 0.31.0 y el del pico de memoria en la 0.32.0. En una tarjeta de 24 GB, quien decide si termina es la RAM del anfitrión.

Todo lo de aquí lleva fecha. Después de la 0.30.0 salieron nueve arreglos de H3, así que una guía escrita en la primera semana describe otro programa. Cada dato de abajo lleva su número de pull request y su versión.

Comprueba esto antes de descargar nada: la MiniMax H3 Community Licence excluye Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur de la concesión para ejecutar los pesos en local, y el §V.4 extiende esa restricción a la salida. La API alojada no está cubierta por la cláusula de territorio. Es un resumen, no asesoramiento legal — el desglose completo de la licencia tiene las cláusulas.

Qué te da la 0.30.0 y qué no

La 0.30.0 es donde aparecen los nodos y las tres plantillas de ejemplo locales. Eso es todo lo que es.

En la 0.31.0, el 8 de agosto, llegaron seis arreglos más, encabezados por el #15243 de kijai, Fix sampler issues for audio with minimax. En la 0.32.0, el 11 de agosto, llegaron tres, entre ellos el #15486 de comfyanonymous, Fix peak memory issue with H3 — la razón de que una tarjeta de 24 GB que antes se moría ahora termine.

VersiónPRQué arreglaGravedad
0.31.0#15243El sampler se pasa de pasos en el calendario del audio; a 4 pasos es ruidobloqueante
0.31.0#15390EasyCache corrompe la banda sonoragrave
0.31.0#15377La descarga completa del VAE de audio fallagrave
0.31.0#15334El VAE int8_convrot no cargagrave
0.31.0#15322El muestreo con máscara está malmenor
0.31.0#15268Errores de dispositivo distinto al decodificar el VAEmenor
0.32.0#15486El del OOM. Actualiza antes de parchear nada a manobloqueante
0.32.0#15477La decodificación por tiles del VAE se cae con latentes NestedTensorgrave
0.32.0#15446Sin él la decodificación es más lenta y más pesadamenor

La 0.33.1, el 13 de agosto, añadió los nodos de API de MiniMax ContextIR y Regenerate-2K (#15471), así que la etapa alojada de 2K se puede encadenar a un grafo local. Los pesos de esa etapa siguen alojados, así que esta vía necesita una clave de API y no un checkpoint local.

cd /ruta/a/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version        # se espera 0.32.0 o posterior

En el portable de Windows: usa el script de actualización incluido o el actualizador de la propia app.

Qué archivos de modelo descargar, y dónde van

No clones el repositorio — guarda todas las variantes de precisión y suma unos 475 GB. Un grafo de texto a video o de foto a video carga exactamente cuatro archivos, comprobados byte a byte contra Hugging Face el 14 de agosto.

ArchivoTamañoVa en
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 GBmodels/diffusion_models/
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GBmodels/text_encoders/
minimax_h3_video_vae_fp16.safetensors5,21 GBmodels/vae/
minimax_h3_audio_vae_fp32.safetensors0,61 GBmodels/vae/
Total42,47 GB = 39,55 GiB
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models

La referencia a video añade un quinto archivo, el checkpoint Ref2VA aparte, y sube el juego a 63,44 GB. Cargar el archivo FL2VA en un grafo R2V es el fallo más común en la primera ejecución.

Dos tablas de archivos muy copiadas dan estas cifras en gibibytes pero las etiquetan como GB. Si dejaste libres 39,6 GB de disco, te faltan 2,9 GB antes de que ComfyUI escriba nada.

Sobre la precisión: bf16 son 66,28 GB sólo para el modelo de difusión — elígelo sólo si sabes por qué. fp8_scaled son 20,96 GB, casi el mismo tamaño que int8_convrot; escógelo sólo si int8_convrot no llega a construirse en tu entorno.

Después: Workflow → Browse Templates → Video → MiniMax H3. Tres plantillas locales, más tres que llaman a la API.

¿Tu GPU va a poder?

No hay ningún mínimo oficial, y todas las tablas de hardware que encuentres se contradicen entre sí porque midieron cosas distintas.

Lo que mata la ejecución es la RAM del anfitrión, no la VRAM

En una 4090 con la pila INT8 podada, durante el muestreo sólo hay unos 6,6 GB en la VRAM — los pesos viven en la memoria del anfitrión y van entrando por páginas. Así que el fallo es un fallo de memoria de anfitrión. Hay una ejecución documentada en una 3090 que llegó a 29 866 MB de 31 997 MB y a la que mató el núcleo; el mismo trabajo con --disable-pinned-memory tuvo un pico de 7 508 MB y terminó en 23 minutos y 17 segundos. La memoria fijada no se puede paginar hacia fuera, y por eso añadir swap por sí solo no cambia nada.

Si estás en la 0.30 o la 0.31 y no puedes actualizar, las recetas reproducibles cambian una constante — MiniMaxH3.memory_usage_factor en comfy/supported_models.py, de 0.114 a 1.0. En la 0.32.0 o posterior, actualiza primero y sólo parchea si sigue dando OOM.

Ejecuciones medidas, y el hardware que hay detrás de cada una

Se han publicado catorce ejecuciones con detalle suficiente para atribuirlas. Ninguna es un benchmark — nadie ha mantenido quietas las variables. Léelas como pruebas de existencia: esta configuración terminó, y tardó esto.

GPUVRAMRAM anfitriónLienzoDuraciónTiempo
RTX 306012 GB16 GB0,2 MP5 s51 min 07 s
RTX 306012 GB32 GB864×4805,17 s, 20 pasosmenos de 9 min
RTX 30708 GB32 GB0,4 MP5 s~9–10 min
RTX 4090 Laptop + SageAttention16 GB32 GB960×5405 s, 20 pasos182 s
RTX 5070 Ti16 GB64 GB0,4 MP5 / 10 / 15 s~2 / 4,5 / 7 min
RTX 508016 GB1,0 MP10 s13 min 36 s
RTX 409024 GB832×48015 s, 8 pasos~25–30 min
RTX 309024 GB31 GB15 s23 min 17 s
2× RTX 5090 (SGLang, no ComfyUI)32 GB cada una377 GiB1344×768124 fotogramas, 50 pasos559,67 s

Esa última fila es otro runtime sobre dos tarjetas con 377 GiB de RAM de anfitrión. Está listada por escala, no para comparar — usarla para predecir la velocidad de una sola tarjeta en ComfyUI está mal. En una 4090 sola, la misma receta da un borde de viabilidad: 832×480 termina tanto a 124 como a 362 fotogramas, 1088×640 termina a 124 fotogramas, y tanto 1088×640 a 192 fotogramas como 1344×768 a 362 fotogramas dan OOM.

Si la tarjeta se amortiza o no es un cálculo aparte.

Resolución, fotogramas y la rejilla 17n+5

Tres ajustes del Resolution Selector producen el ancho y el alto. Deja Multiple en 32 — ésa es la rejilla de H3. El lienzo nativo es un lado corto de 768 píxeles con tope en 768×1344. A 16:9, Megapixels 0,98 da exactamente 1344×768; el preajuste de 1,0 da 1376×768, que está fuera del lienzo documentado. Las plantillas vienen a 0,4 MP. Empieza ahí. El suelo son 384p; a 256p falla directamente.

Los recuentos de fotogramas se ajustan a 17n+5 a 24 fps, así que casi todas las peticiones redondean hacia arriba. 175 fotogramas son 7,29 segundos; no existe el 7,00. En todo el rango de 4 a 15 segundos hay exactamente un valor que cae en un segundo entero: 192 fotogramas, 8,000 segundos. El techo validado son 362 fotogramas, o 15,08 segundos.

Sin audio, o con el audio distorsionado

Dos fallos distintos con dos causas distintas.

El silencio es un problema de cableado. Tienen que estar cargados los dos VAE y la salida de VAEDecodeAudio tiene que llegar al nodo de guardado. Comprueba el archivo, no el reproductor — deberías ver H.264 a 24 fps y AAC estéreo a 32 kHz. Si no hay un segundo flujo, lo que está mal es el grafo y no el modelo.

ffprobe -hide_banner out.mp4

La distorsión es un problema del sampler. H3 corre la imagen y el sonido en dos calendarios de flujo, shift 12 y shift 3, y un sampler de un solo reloj se pasa de pasos en uno de ellos. A 20 pasos el error es invisible; a los 4 pasos que usa un Turbo LoRA se convierte en recorte y ruido. ComfyUI 0.31.0 gestiona los dos calendarios de forma nativa a través de ModelSamplingAV. Por debajo de esa versión necesitas el sampler de doble reloj de larryvrh.

Errores, y el arreglo de una línea para cada uno

Dos reglas antes de cambiar nada. Cambia una variable cada vez y vuelve a ejecutar con el mismo prompt y la misma semilla — apilar --lowvram, --reserve-vram, --cache-none y un checkpoint cuantizado a la vez te deja sin saber cuál ayudó. Y consigue que termine una plantilla oficial simple antes de añadir SageAttention, TeaCache, EasyCache o un cargador GGUF.

Síntoma en la consolaCausaArreglo
CUDA out of memory durante el muestreoLienzo × fotogramas se salen del planBaja primero Megapixels y después los fotogramas. En la 0.30 y la 0.31, actualiza a la 0.32.0 (#15486)
Proceso matado, la máquina se congela, ningún error de CUDARAM del anfitrión. La memoria fijada no se puede paginar--disable-pinned-memory --disable-async-offload
OOM sólo al decodificar el VAELa reserva de la decodificación escala con los fotogramasMenos fotogramas o lienzo más pequeño; actualiza a la 0.32.0 (#15477, #15446)
No aparecen los nodos ni las plantillas MiniMaxH3…Núcleo anterior a la 0.30.0python main.py --version, actualiza, reinicia
No aparece ningún nodo de “texto a video”MalentendidoLa plantilla de T2V es MiniMaxH3ImageToVideo sin nada conectado. No instales sustitutos de terceros
Error de carga en el grafo R2VSe eligió el checkpoint FL2VA en vez del Ref2VASelecciona minimax_h3_ref2va_pruned_int8_convrot.safetensors
La salida no tiene flujo de audioEl VAE de audio no está cargado, o VAEDecodeAudio no llega al nodo de guardadoComprueba las dos cosas y verifica con ffprobe
El audio recorta, zumba o se convierte en ruidoDos calendarios de flujo pisados con un solo relojActualiza a la 0.31.0 (#15243), o usa el Turbo Sampler de larryvrh
La generación falla a 256pPor debajo del suelo de 384p de H3Usa los preajustes de las plantillas

Hacerlo más rápido, en el orden que sirve

En este orden, porque los dos primeros son gratis y el último cuesta calidad.

  1. Actualiza. La optimización del VAE y el arreglo de memoria de la 0.32.0 valen más que cualquier flag.
  2. Baja el lienzo antes que la duración. 0,4 MP termina donde 1 MP en una tarjeta de 24 GB muchas veces no.
  3. SageAttention. Arranca con --use-sage-attention, o métela con KJNodes. ComfyUI estima aproximadamente el doble; las máquinas limitadas por la descarga a memoria ven menos. Los avisos de reserva de dtype son esperables.
  4. Turbo LoRA. La v4 de larryvrh baja el muestreo de unos 20 pasos a 4–8. Usa 6–8; con 4 se emborrona el movimiento rápido, y pasando de 8 deja de ayudar.

No añadas --lowvram junto a --disable-pinned-memory. Entran en conflicto.

Cuándo no ejecutarlo en ComfyUI

Tres casos en los que lo local es la respuesta equivocada, y uno en el que es claramente la correcta.

Lo local está mal si estás en Estados Unidos, la Unión Europea, el Reino Unido o Corea del Sur y vas a autoalojar los pesos; la licencia no lo concede. Está mal si necesitas 2K desde pesos abiertos, porque Regenerate-2K no se publicó nunca. Y está mal en 8 GB con 16 GB de RAM de sistema, donde se ha reportado un clip de cinco segundos en 51 minutos.

Lo local está bien si tienes 24 GB de VRAM, 32 GB de RAM de anfitrión y un territorio permitido. ComfyUI te da entonces lotes, LoRAs y control a nivel de nodo que ninguna interfaz alojada, la nuestra incluida, puede igualar. Por eso aquí están escritos todos los nombres de archivo y todos los flags.

Preguntas después de una primera ejecución fallida

¿Necesito un nodo personalizado? No. Es nativo desde la 0.30.0, y las plantillas usan sólo nodos del núcleo.

¿Por qué no hay un nodo de texto a video? La plantilla de T2V es MiniMaxH3ImageToVideo sin nada conectado. Es a propósito.

¿Qué versión debería ejecutar de verdad? La 0.32.0 o posterior. La 0.30.0 funciona, pero le faltan nueve arreglos de H3.

¿Por qué mi salida es muda? Tienen que cargarse los dos VAE y VAEDecodeAudio tiene que llegar al nodo de guardado. Verifícalo con ffprobe.

¿Por qué se rompe el sonido a 4 pasos? El muestreo de un solo reloj se pasa de pasos en el calendario del audio. Arreglado en la 0.31.0.

¿Cuánto disco necesito? 42,47 GB para T2V e I2V, 63,44 GB con Ref2VA, más la caché.

¿Puede hacerlo una tarjeta de 12 GB? Sí, con mucha descarga a memoria. Un mantenedor reportó 864×480, 124 fotogramas, 20 pasos, en menos de nueve minutos.

¿Por qué mi clip de 7 segundos salió más largo? Los fotogramas se ajustan a 17n+5. 175 fotogramas son 7,29 segundos.

¿Debería usar una compilación GGUF? No hay ninguna oficial. Pruébala sólo después de que funcione la pila oficial.

¿Puedo sacar 2K en local? Desde pesos abiertos no. Desde la 0.33.1 puedes encadenar el nodo alojado de Regenerate-2K.


Si lo que te frena es la descarga de 42,47 GB o la matriz de versiones, el generador de video con IA de MiniMax H3 ejecuta las tres etapas alojadas, sin nada que instalar y sin tarjeta.


Qué puede cambiar. Esto se mueve cada semana: mira las publicaciones de ComfyUI por si hay entradas de H3 más nuevas que la 0.33.1. El techo de 362 fotogramas es documentación de terceros, no un tope oficial. Y el parche de memory_usage_factor puede que ya sea innecesario en la 0.32.0 y posteriores. Última verificación: 14 de agosto de 2026.

Redacción

Escrito por

Redacción

minimax-h3ai.video

Publicado en el generador de video con IA MiniMax H3, una interfaz independiente de terceros construida sobre MiniMax H3.

Todos los artículos