MiniMax H3 en ComfyUI: la versión, los archivos y el flag que corta el OOM
Los nodos nativos llegaron en la 0.30.0; el arreglo que evita quedarse sin memoria, en la 0.32.0, y casi todas las guías paran ahí. Estado actual, con PR.

Para ejecutar MiniMax H3 en ComfyUI necesitas ComfyUI 0.32.0 o posterior, cuatro archivos de modelo que suman 42,47 GB, y ningún nodo personalizado. El soporte nativo llegó en la 0.30.0, pero el arreglo del sampler para el audio distorsionado aterrizó en la 0.31.0 y el del pico de memoria en la 0.32.0. En una tarjeta de 24 GB, quien decide si termina es la RAM del anfitrión.
Todo lo de aquí lleva fecha. Después de la 0.30.0 salieron nueve arreglos de H3, así que una guía escrita en la primera semana describe otro programa. Cada dato de abajo lleva su número de pull request y su versión.
Comprueba esto antes de descargar nada: la MiniMax H3 Community Licence excluye Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur de la concesión para ejecutar los pesos en local, y el §V.4 extiende esa restricción a la salida. La API alojada no está cubierta por la cláusula de territorio. Es un resumen, no asesoramiento legal — el desglose completo de la licencia tiene las cláusulas.
Qué te da la 0.30.0 y qué no
La 0.30.0 es donde aparecen los nodos y las tres plantillas de ejemplo locales. Eso es todo lo que es.
En la 0.31.0, el 8 de agosto, llegaron seis arreglos más, encabezados por el
#15243 de kijai, Fix sampler issues for audio with minimax. En la 0.32.0, el
11 de agosto, llegaron tres, entre ellos el #15486 de comfyanonymous, Fix peak
memory issue with H3 — la razón de que una tarjeta de 24 GB que antes se moría
ahora termine.
| Versión | PR | Qué arregla | Gravedad |
|---|---|---|---|
| 0.31.0 | #15243 | El sampler se pasa de pasos en el calendario del audio; a 4 pasos es ruido | bloqueante |
| 0.31.0 | #15390 | EasyCache corrompe la banda sonora | grave |
| 0.31.0 | #15377 | La descarga completa del VAE de audio falla | grave |
| 0.31.0 | #15334 | El VAE int8_convrot no carga | grave |
| 0.31.0 | #15322 | El muestreo con máscara está mal | menor |
| 0.31.0 | #15268 | Errores de dispositivo distinto al decodificar el VAE | menor |
| 0.32.0 | #15486 | El del OOM. Actualiza antes de parchear nada a mano | bloqueante |
| 0.32.0 | #15477 | La decodificación por tiles del VAE se cae con latentes NestedTensor | grave |
| 0.32.0 | #15446 | Sin él la decodificación es más lenta y más pesada | menor |
La 0.33.1, el 13 de agosto, añadió los nodos de API de MiniMax ContextIR y
Regenerate-2K (#15471), así que la etapa alojada de 2K se puede encadenar a un
grafo local. Los pesos de esa etapa siguen alojados, así que esta vía necesita una
clave de API y no un checkpoint local.
cd /ruta/a/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version # se espera 0.32.0 o posteriorEn el portable de Windows: usa el script de actualización incluido o el actualizador de la propia app.
Qué archivos de modelo descargar, y dónde van
No clones el repositorio — guarda todas las variantes de precisión y suma unos 475 GB. Un grafo de texto a video o de foto a video carga exactamente cuatro archivos, comprobados byte a byte contra Hugging Face el 14 de agosto.
| Archivo | Tamaño | Va en |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 GB | models/diffusion_models/ |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 GB | models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | 5,21 GB | models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | 0,61 GB | models/vae/ |
| Total | 42,47 GB = 39,55 GiB |
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir ComfyUI/modelsLa referencia a video añade un quinto archivo, el checkpoint Ref2VA aparte, y sube el juego a 63,44 GB. Cargar el archivo FL2VA en un grafo R2V es el fallo más común en la primera ejecución.
Dos tablas de archivos muy copiadas dan estas cifras en gibibytes pero las etiquetan como GB. Si dejaste libres 39,6 GB de disco, te faltan 2,9 GB antes de que ComfyUI escriba nada.
Sobre la precisión: bf16 son 66,28 GB sólo para el modelo de difusión — elígelo
sólo si sabes por qué. fp8_scaled son 20,96 GB, casi el mismo tamaño que
int8_convrot; escógelo sólo si int8_convrot no llega a construirse en tu
entorno.
Después: Workflow → Browse Templates → Video → MiniMax H3. Tres plantillas locales, más tres que llaman a la API.
¿Tu GPU va a poder?
No hay ningún mínimo oficial, y todas las tablas de hardware que encuentres se contradicen entre sí porque midieron cosas distintas.
Lo que mata la ejecución es la RAM del anfitrión, no la VRAM
En una 4090 con la pila INT8 podada, durante el muestreo sólo hay unos 6,6 GB en
la VRAM — los pesos viven en la memoria del anfitrión y van entrando por páginas. Así
que el fallo es un fallo de memoria de anfitrión. Hay una ejecución documentada en
una 3090 que llegó a 29 866 MB de 31 997 MB y a la que mató el núcleo; el mismo
trabajo con --disable-pinned-memory tuvo un pico de 7 508 MB y terminó en 23
minutos y 17 segundos. La memoria fijada no se puede paginar hacia fuera, y por eso
añadir swap por sí solo no cambia nada.
Si estás en la 0.30 o la 0.31 y no puedes actualizar, las recetas reproducibles
cambian una constante — MiniMaxH3.memory_usage_factor en
comfy/supported_models.py, de 0.114 a 1.0. En la 0.32.0 o posterior, actualiza
primero y sólo parchea si sigue dando OOM.
Ejecuciones medidas, y el hardware que hay detrás de cada una
Se han publicado catorce ejecuciones con detalle suficiente para atribuirlas. Ninguna es un benchmark — nadie ha mantenido quietas las variables. Léelas como pruebas de existencia: esta configuración terminó, y tardó esto.
| GPU | VRAM | RAM anfitrión | Lienzo | Duración | Tiempo |
|---|---|---|---|---|---|
| RTX 3060 | 12 GB | 16 GB | 0,2 MP | 5 s | 51 min 07 s |
| RTX 3060 | 12 GB | 32 GB | 864×480 | 5,17 s, 20 pasos | menos de 9 min |
| RTX 3070 | 8 GB | 32 GB | 0,4 MP | 5 s | ~9–10 min |
| RTX 4090 Laptop + SageAttention | 16 GB | 32 GB | 960×540 | 5 s, 20 pasos | 182 s |
| RTX 5070 Ti | 16 GB | 64 GB | 0,4 MP | 5 / 10 / 15 s | ~2 / 4,5 / 7 min |
| RTX 5080 | 16 GB | — | 1,0 MP | 10 s | 13 min 36 s |
| RTX 4090 | 24 GB | — | 832×480 | 15 s, 8 pasos | ~25–30 min |
| RTX 3090 | 24 GB | 31 GB | — | 15 s | 23 min 17 s |
| 2× RTX 5090 (SGLang, no ComfyUI) | 32 GB cada una | 377 GiB | 1344×768 | 124 fotogramas, 50 pasos | 559,67 s |
Esa última fila es otro runtime sobre dos tarjetas con 377 GiB de RAM de anfitrión. Está listada por escala, no para comparar — usarla para predecir la velocidad de una sola tarjeta en ComfyUI está mal. En una 4090 sola, la misma receta da un borde de viabilidad: 832×480 termina tanto a 124 como a 362 fotogramas, 1088×640 termina a 124 fotogramas, y tanto 1088×640 a 192 fotogramas como 1344×768 a 362 fotogramas dan OOM.
Si la tarjeta se amortiza o no es un cálculo aparte.
Resolución, fotogramas y la rejilla 17n+5
Tres ajustes del Resolution Selector producen el ancho y el alto. Deja Multiple en 32 — ésa es la rejilla de H3. El lienzo nativo es un lado corto de 768 píxeles con tope en 768×1344. A 16:9, Megapixels 0,98 da exactamente 1344×768; el preajuste de 1,0 da 1376×768, que está fuera del lienzo documentado. Las plantillas vienen a 0,4 MP. Empieza ahí. El suelo son 384p; a 256p falla directamente.
Los recuentos de fotogramas se ajustan a 17n+5 a 24 fps, así que casi todas las peticiones redondean hacia arriba. 175 fotogramas son 7,29 segundos; no existe el 7,00. En todo el rango de 4 a 15 segundos hay exactamente un valor que cae en un segundo entero: 192 fotogramas, 8,000 segundos. El techo validado son 362 fotogramas, o 15,08 segundos.
Sin audio, o con el audio distorsionado
Dos fallos distintos con dos causas distintas.
El silencio es un problema de cableado. Tienen que estar cargados los dos VAE y
la salida de VAEDecodeAudio tiene que llegar al nodo de guardado. Comprueba el
archivo, no el reproductor — deberías ver H.264 a 24 fps y AAC estéreo a 32 kHz. Si
no hay un segundo flujo, lo que está mal es el grafo y no el modelo.
ffprobe -hide_banner out.mp4La distorsión es un problema del sampler. H3 corre la imagen y el sonido en dos
calendarios de flujo, shift 12 y shift 3, y un sampler de un solo reloj se pasa de
pasos en uno de ellos. A 20 pasos el error es invisible; a los 4 pasos que usa un
Turbo LoRA se convierte en recorte y ruido. ComfyUI 0.31.0 gestiona los dos
calendarios de forma nativa a través de ModelSamplingAV. Por debajo de esa versión
necesitas el sampler de doble reloj de larryvrh.
Errores, y el arreglo de una línea para cada uno
Dos reglas antes de cambiar nada. Cambia una variable cada vez y vuelve a ejecutar
con el mismo prompt y la misma semilla — apilar --lowvram, --reserve-vram,
--cache-none y un checkpoint cuantizado a la vez te deja sin saber cuál ayudó. Y
consigue que termine una plantilla oficial simple antes de añadir SageAttention,
TeaCache, EasyCache o un cargador GGUF.
| Síntoma en la consola | Causa | Arreglo |
|---|---|---|
CUDA out of memory durante el muestreo | Lienzo × fotogramas se salen del plan | Baja primero Megapixels y después los fotogramas. En la 0.30 y la 0.31, actualiza a la 0.32.0 (#15486) |
| Proceso matado, la máquina se congela, ningún error de CUDA | RAM del anfitrión. La memoria fijada no se puede paginar | --disable-pinned-memory --disable-async-offload |
| OOM sólo al decodificar el VAE | La reserva de la decodificación escala con los fotogramas | Menos fotogramas o lienzo más pequeño; actualiza a la 0.32.0 (#15477, #15446) |
No aparecen los nodos ni las plantillas MiniMaxH3… | Núcleo anterior a la 0.30.0 | python main.py --version, actualiza, reinicia |
| No aparece ningún nodo de “texto a video” | Malentendido | La plantilla de T2V es MiniMaxH3ImageToVideo sin nada conectado. No instales sustitutos de terceros |
| Error de carga en el grafo R2V | Se eligió el checkpoint FL2VA en vez del Ref2VA | Selecciona minimax_h3_ref2va_pruned_int8_convrot.safetensors |
| La salida no tiene flujo de audio | El VAE de audio no está cargado, o VAEDecodeAudio no llega al nodo de guardado | Comprueba las dos cosas y verifica con ffprobe |
| El audio recorta, zumba o se convierte en ruido | Dos calendarios de flujo pisados con un solo reloj | Actualiza a la 0.31.0 (#15243), o usa el Turbo Sampler de larryvrh |
| La generación falla a 256p | Por debajo del suelo de 384p de H3 | Usa los preajustes de las plantillas |
Hacerlo más rápido, en el orden que sirve
En este orden, porque los dos primeros son gratis y el último cuesta calidad.
- Actualiza. La optimización del VAE y el arreglo de memoria de la 0.32.0 valen más que cualquier flag.
- Baja el lienzo antes que la duración. 0,4 MP termina donde 1 MP en una tarjeta de 24 GB muchas veces no.
- SageAttention. Arranca con
--use-sage-attention, o métela con KJNodes. ComfyUI estima aproximadamente el doble; las máquinas limitadas por la descarga a memoria ven menos. Los avisos de reserva de dtype son esperables. - Turbo LoRA. La v4 de larryvrh baja el muestreo de unos 20 pasos a 4–8. Usa 6–8; con 4 se emborrona el movimiento rápido, y pasando de 8 deja de ayudar.
No añadas --lowvram junto a --disable-pinned-memory. Entran en conflicto.
Cuándo no ejecutarlo en ComfyUI
Tres casos en los que lo local es la respuesta equivocada, y uno en el que es claramente la correcta.
Lo local está mal si estás en Estados Unidos, la Unión Europea, el Reino Unido o Corea del Sur y vas a autoalojar los pesos; la licencia no lo concede. Está mal si necesitas 2K desde pesos abiertos, porque Regenerate-2K no se publicó nunca. Y está mal en 8 GB con 16 GB de RAM de sistema, donde se ha reportado un clip de cinco segundos en 51 minutos.
Lo local está bien si tienes 24 GB de VRAM, 32 GB de RAM de anfitrión y un territorio permitido. ComfyUI te da entonces lotes, LoRAs y control a nivel de nodo que ninguna interfaz alojada, la nuestra incluida, puede igualar. Por eso aquí están escritos todos los nombres de archivo y todos los flags.
Preguntas después de una primera ejecución fallida
¿Necesito un nodo personalizado? No. Es nativo desde la 0.30.0, y las plantillas usan sólo nodos del núcleo.
¿Por qué no hay un nodo de texto a video?
La plantilla de T2V es MiniMaxH3ImageToVideo sin nada conectado. Es a propósito.
¿Qué versión debería ejecutar de verdad? La 0.32.0 o posterior. La 0.30.0 funciona, pero le faltan nueve arreglos de H3.
¿Por qué mi salida es muda?
Tienen que cargarse los dos VAE y VAEDecodeAudio tiene que llegar al nodo de
guardado. Verifícalo con ffprobe.
¿Por qué se rompe el sonido a 4 pasos? El muestreo de un solo reloj se pasa de pasos en el calendario del audio. Arreglado en la 0.31.0.
¿Cuánto disco necesito? 42,47 GB para T2V e I2V, 63,44 GB con Ref2VA, más la caché.
¿Puede hacerlo una tarjeta de 12 GB? Sí, con mucha descarga a memoria. Un mantenedor reportó 864×480, 124 fotogramas, 20 pasos, en menos de nueve minutos.
¿Por qué mi clip de 7 segundos salió más largo? Los fotogramas se ajustan a 17n+5. 175 fotogramas son 7,29 segundos.
¿Debería usar una compilación GGUF? No hay ninguna oficial. Pruébala sólo después de que funcione la pila oficial.
¿Puedo sacar 2K en local? Desde pesos abiertos no. Desde la 0.33.1 puedes encadenar el nodo alojado de Regenerate-2K.
Si lo que te frena es la descarga de 42,47 GB o la matriz de versiones, el generador de video con IA de MiniMax H3 ejecuta las tres etapas alojadas, sin nada que instalar y sin tarjeta.
Qué puede cambiar. Esto se mueve cada semana: mira las publicaciones de ComfyUI
por si hay entradas de H3 más nuevas que la 0.33.1. El techo de 362 fotogramas es
documentación de terceros, no un tope oficial. Y el parche de memory_usage_factor
puede que ya sea innecesario en la 0.32.0 y posteriores. Última verificación: 14 de
agosto de 2026.
Escrito por
Redacción
minimax-h3ai.video
Publicado en el generador de video con IA MiniMax H3, una interfaz independiente de terceros construida sobre MiniMax H3.


