Guides

MiniMax H3 sous ComfyUI : version, fichiers, anti-OOM

Les nœuds natifs sont arrivés en 0.30.0, le correctif mémoire en 0.32.0. La plupart des guides s’arrêtent à 0.30.0. État actuel, numéros de PR.

9 min de lectureRédactionRédaction
MiniMax H3 sous ComfyUI : version, fichiers, anti-OOM

Pour faire tourner MiniMax H3 dans ComfyUI, il vous faut ComfyUI 0.32.0 ou plus récent, quatre fichiers de modèle totalisant 42,47 Go, et aucun nœud personnalisé. La prise en charge native est arrivée en 0.30.0, mais le correctif d’échantillonnage pour l’audio déformé est tombé en 0.31.0 et le correctif de pic mémoire en 0.32.0. Sur une carte de 24 Go, c’est la RAM système qui décide si le rendu va au bout.

Tout ici est daté. Neuf correctifs H3 sont sortis après la 0.30.0, donc un guide écrit la première semaine décrit un autre programme. Chaque fait ci-dessous porte son numéro de pull request et sa version.

À vérifier avant de télécharger quoi que ce soit : la MiniMax H3 Community Licence exclut les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud de la concession permettant de faire tourner les poids en local, et son §V.4 étend cette restriction aux productions. L’API hébergée n’est pas concernée par la clause de territoire. Un résumé, pas un avis juridique — le détail complet de la licence contient les articles.

Ce que la 0.30.0 vous donne, et ce qu’elle ne donne pas

La 0.30.0, c’est là qu’apparaissent les nœuds et les trois flux d’exemple locaux. C’est tout ce qu’elle est.

Six correctifs de plus sont arrivés en 0.31.0 le 8 août, menés par le #15243 de kijai, Fix sampler issues for audio with minimax. Trois sont arrivés en 0.32.0 le 11 août, dont le #15486 de comfyanonymous, Fix peak memory issue with H3 — la raison pour laquelle une carte de 24 Go qui mourait avant va maintenant au bout.

VersionPRCe qu’il corrigeGravité
0.31.0#15243L’échantillonneur dépasse le calendrier audio ; à 4 étapes, c’est du bruitbloquant
0.31.0#15390EasyCache corrompt la bande sonoremajeur
0.31.0#15377Le déchargement complet du VAE audio échouemajeur
0.31.0#15334Le VAE int8_convrot refuse de se chargermajeur
0.31.0#15322L’échantillonnage masqué est fauxmineur
0.31.0#15268Erreurs de périphérique incohérent pendant le décodage VAEmineur
0.32.0#15486Celui de l’OOM. Mettez à jour avant de rustiner à la mainbloquant
0.32.0#15477Le décodage VAE en tuiles plante sur les latents NestedTensormajeur
0.32.0#15446Sans lui, le décodage est plus lent et plus lourdmineur

La 0.33.1 du 13 août a ajouté les nœuds d’API MiniMax ContextIR et Regenerate-2K (#15471), de sorte que l’étape 2K hébergée peut être chaînée sur un graphe local. Les poids de cette étape restent hébergés, donc ce chemin demande une clé d’API plutôt qu’un checkpoint local.

cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version        # expect 0.32.0 or later

Version portable Windows : utilisez le script de mise à jour fourni ou le programme de mise à jour intégré.

Quels fichiers de modèle télécharger, et où ils vont

Ne clonez pas le dépôt : il contient toutes les variantes de précision et pèse environ 475 Go. Un graphe texte vers vidéo (T2V) ou image vers vidéo (I2V) charge exactement quatre fichiers, vérifiés octet par octet sur Hugging Face le 14 août.

FichierTailleVa dans
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 Gomodels/diffusion_models/
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 Gomodels/text_encoders/
minimax_h3_video_vae_fp16.safetensors5,21 Gomodels/vae/
minimax_h3_audio_vae_fp32.safetensors0,61 Gomodels/vae/
Total42,47 Go = 39,55 Gio
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models

Le graphe à image de référence ajoute un cinquième fichier, le checkpoint Ref2VA distinct, ce qui porte l’ensemble à 63,44 Go. Charger le fichier FL2VA dans un graphe R2V est l’échec de premier lancement le plus fréquent.

Deux tableaux de fichiers très recopiés donnent ces chiffres en gibioctets tout en les étiquetant Go. Si vous avez libéré 39,6 Go de disque, il vous en manque 2,9 avant même que ComfyUI n’écrive quoi que ce soit.

Sur la précision : bf16 pèse 66,28 Go pour le seul modèle de diffusion — choisissez-le seulement si vous savez pourquoi. fp8_scaled pèse 20,96 Go, presque la même taille qu’int8_convrot ; ne le prenez que si int8_convrot ne se construit pas dans votre environnement.

Ensuite : Workflow → Browse Templates → Video → MiniMax H3. Trois flux locaux, plus trois qui appellent l’API.

Votre GPU va-t-il y arriver ?

Il n’y a pas de minimum officiel, et tous les tableaux de matériel que vous trouverez se contredisent, parce qu’ils ont mesuré des choses différentes.

Ce qui tue le rendu, c’est la RAM système, pas la VRAM

Sur une 4090 qui fait tourner la pile INT8 élaguée, seuls 6,6 Go environ occupent la VRAM pendant l’échantillonnage — les poids vivent en mémoire système et sont paginés au fur et à mesure. L’échec est donc un échec de mémoire système. Une exécution documentée sur 3090 a atteint 29 866 Mo sur 31 997 Mo et a été tuée par le noyau ; le même travail avec --disable-pinned-memory a plafonné à 7 508 Mo et s’est terminé en 23 minutes 17 secondes. La mémoire épinglée ne peut pas être paginée, ce qui explique qu’ajouter du swap ne change rien à soi seul.

Si vous êtes en 0.30–0.31 et ne pouvez pas mettre à jour, les recettes reproductibles changent une constante — MiniMaxH3.memory_usage_factor dans comfy/supported_models.py, de 0.114 à 1.0. En 0.32.0 ou plus récent, mettez à jour d’abord et ne rustinez que si ça déborde encore.

Exécutions mesurées, et le matériel derrière chacune

Quatorze exécutions ont été publiées avec assez de détail pour être attribuées. Aucune n’est un banc d’essai : personne n’a tenu les variables immobiles. Lisez-les comme des preuves d’existence — cette configuration est allée au bout, en ce temps-là.

GPUVRAMRAM systèmeSurfaceDuréeTemps
RTX 306012 Go16 Go0,2 MP5 s51 min 07 s
RTX 306012 Go32 Go864×4805,17 s, 20 étapesmoins de 9 min
RTX 30708 Go32 Go0,4 MP5 s~9–10 min
RTX 4090 Laptop + SageAttention16 Go32 Go960×5405 s, 20 étapes182 s
RTX 5070 Ti16 Go64 Go0,4 MP5 / 10 / 15 s~2 / 4,5 / 7 min
RTX 508016 Go1,0 MP10 s13 min 36 s
RTX 409024 Go832×48015 s, 8 étapes~25–30 min
RTX 309024 Go31 Go15 s23 min 17 s
2× RTX 5090 (SGLang, pas ComfyUI)32 Go chacune377 Gio1344×768124 images, 50 étapes559,67 s

Cette dernière ligne est un autre moteur d’exécution, sur deux cartes, avec 377 Gio de RAM système. Elle est là pour l’échelle, pas pour la comparaison : s’en servir pour prédire la vitesse d’un ComfyUI mono-carte est faux. Sur une seule 4090, la même recette donne une limite de faisabilité — 832×480 va au bout à 124 comme à 362 images, 1088×640 va au bout à 124 images, et 1088×640 à 192 images comme 1344×768 à 362 images débordent.

Savoir si la carte se rembourse est un calcul à part.

Résolution, images et la grille 17n+5

Trois réglages du Resolution Selector produisent la largeur et la hauteur. Gardez Multiple à 32 — c’est la grille de H3. La surface native est un petit côté de 768 pixels plafonné à 768×1344. En 16:9, Megapixels 0,98 donne exactement 1344×768 ; le préréglage 1,0 donne 1376×768, qui sort de la surface documentée. Les flux fournis sont à 0,4 MP. Commencez là. Le plancher est à 384p ; le 256p échoue franchement.

Le nombre d’images se cale sur 17n+5 à 24 images par seconde, donc la plupart des demandes sont arrondies vers le haut. 175 images font 7,29 secondes ; il n’existe pas de 7,00. Sur toute la plage de 4 à 15 secondes, une seule valeur tombe sur une seconde entière : 192 images, 8,000 secondes. Le plafond validé est de 362 images, soit 15,08 secondes.

Pas de son, ou du son déformé

Deux échecs différents avec deux causes différentes.

Le silence est un problème de câblage. Les deux VAE doivent être chargés et la sortie VAEDecodeAudio doit atteindre le nœud d’enregistrement. Vérifiez le fichier, pas le lecteur — vous devez voir du H.264 à 24 images par seconde et de l’AAC stéréo à 32 kHz. L’absence d’un second flux signifie que le graphe est faux, pas le modèle.

ffprobe -hide_banner out.mp4

La déformation est un problème d’échantillonneur. H3 fait tourner l’image et le son sur deux calendriers de flux, shift 12 et shift 3, et un échantillonneur à une seule horloge en dépasse un des deux. À 20 étapes, l’erreur est invisible ; aux 4 étapes qu’utilise un Turbo LoRA, elle devient de l’écrêtage et du bruit. ComfyUI 0.31.0 gère nativement les deux calendriers via ModelSamplingAV. En dessous de cette version, il vous faut l’échantillonneur à deux horloges de larryvrh.

Les erreurs, et le correctif en une ligne pour chacune

Deux règles avant de changer quoi que ce soit. Changez une variable à la fois et relancez le même prompt avec la même seed — empiler --lowvram, --reserve-vram, --cache-none et un checkpoint quantifié d’un coup vous laisse sans savoir lequel a aidé. Et faites aboutir un flux officiel nu avant d’ajouter SageAttention, TeaCache, EasyCache ou un chargeur GGUF.

Symptôme dans la consoleCauseCorrectif
CUDA out of memory pendant l’échantillonnageSurface × images dépassent le planBaissez Megapixels d’abord, les images ensuite. En 0.30–0.31, passez en 0.32.0 (#15486)
Processus tué, machine figée, aucune erreur CUDARAM système. La mémoire épinglée ne peut pas être paginée--disable-pinned-memory --disable-async-offload
OOM seulement au décodage VAEL’allocation de décodage suit le nombre d’imagesMoins d’images ou surface plus petite ; passez en 0.32.0 (#15477, #15446)
Nœuds ou flux MiniMaxH3… absentsCœur plus ancien que 0.30.0python main.py --version, mettez à jour, redémarrez
Aucun nœud « texte vers vidéo » nulle partMalentenduLe flux T2V, c’est MiniMaxH3ImageToVideo sans rien de branché. N’installez pas de remplaçants tiers
Erreur de chargement sur le graphe R2VCheckpoint FL2VA choisi à la place de Ref2VAChoisissez minimax_h3_ref2va_pruned_int8_convrot.safetensors
La sortie n’a pas de flux audioVAE audio non chargé, ou VAEDecodeAudio n’atteint pas le nœud d’enregistrementVérifiez les deux, confirmez avec ffprobe
Le son sature, bourdonne ou tourne au bruitDeux calendriers de flux cadencés sur une seule horlogePassez en 0.31.0 (#15243), ou prenez le Turbo Sampler de larryvrh
La génération échoue en 256pSous le plancher de 384p de H3Utilisez les préréglages fournis

L’accélérer, dans l’ordre qui sert

Dans cet ordre, parce que les deux premiers ne coûtent rien et que le dernier coûte de la qualité.

  1. Mettez à jour. L’optimisation VAE et le correctif mémoire de la 0.32.0 valent plus que n’importe quelle option.
  2. Baissez la surface avant la durée. 0,4 MP va au bout là où 1 MP sur une carte de 24 Go n’y arrive souvent pas.
  3. SageAttention. Lancez avec --use-sage-attention, ou greffez-le avec KJNodes. ComfyUI estime à peu près le double ; les machines limitées par le déchargement en voient moins. Les avertissements de repli de dtype sont attendus.
  4. Turbo LoRA. La v4 de larryvrh fait passer l’échantillonnage d’environ 20 étapes à 4–8. Prenez 6–8 ; à 4, les mouvements rapides bavent, et au-delà de 8 cela n’aide plus.

N’ajoutez pas --lowvram en même temps que --disable-pinned-memory. Ils entrent en conflit.

Quand ne pas le faire tourner dans ComfyUI

Trois cas où le local est la mauvaise réponse, et un où il est clairement la bonne.

Le local est faux si vous êtes aux États-Unis, dans l’UE, au Royaume-Uni ou en Corée du Sud et que vous hébergez les poids vous-même ; la licence ne l’accorde pas. Il est faux s’il vous faut du 2K à partir des poids ouverts, parce que Regenerate-2K n’a jamais été publié. Et il est faux sur 8 Go avec 16 Go de RAM système, où un clip de cinq secondes a été rapporté à 51 minutes.

Le local est juste si vous avez 24 Go de VRAM, 32 Go de RAM système et un territoire autorisé. ComfyUI vous donne alors le traitement par lots, les LoRA et un contrôle au niveau du nœud qu’aucune interface hébergée, la nôtre comprise, ne peut égaler. C’est pour cela que chaque nom de fichier et chaque option sont écrits ici en toutes lettres.

Questions après un premier lancement raté

Ai-je besoin d’un nœud personnalisé ? Non. Natif depuis la 0.30.0, et les flux fournis n’utilisent que des nœuds du cœur.

Pourquoi n’y a-t-il pas de nœud texte vers vidéo ? Le flux T2V, c’est MiniMaxH3ImageToVideo sans rien de branché. C’est voulu.

Quelle version faire tourner, concrètement ? La 0.32.0 ou plus récente. La 0.30.0 fonctionne, mais il lui manque neuf correctifs H3.

Pourquoi ma sortie est-elle muette ? Les deux VAE doivent se charger et VAEDecodeAudio doit atteindre le nœud d’enregistrement. Confirmez avec ffprobe.

Pourquoi le son casse-t-il à 4 étapes ? L’échantillonnage à une horloge dépasse le calendrier audio. Corrigé en 0.31.0.

Combien de disque me faut-il ? 42,47 Go pour le T2V et l’I2V, 63,44 Go avec Ref2VA, plus le cache.

Une carte de 12 Go peut-elle le faire ? Oui, avec un déchargement massif. Un mainteneur a rapporté 864×480, 124 images, 20 étapes, en moins de neuf minutes.

Pourquoi mon clip de 7 secondes a-t-il duré plus longtemps ? Le nombre d’images se cale sur 17n+5. 175 images font 7,29 secondes.

Faut-il prendre une version GGUF ? Il n’y en a pas d’officielle. N’essayez qu’une fois la pile officielle en état de marche.

Puis-je obtenir du 2K en local ? Pas à partir des poids ouverts. Depuis la 0.33.1, vous pouvez chaîner le nœud Regenerate-2K hébergé.

Si c’est le téléchargement de 42,47 Go ou la matrice des versions qui vous arrête, le générateur de vidéo IA MiniMax H3 fait tourner les trois étages en hébergé, sans rien à installer et sans carte.


Ce qui peut changer. Cela bouge toutes les semaines : regardez les versions de ComfyUI pour des entrées H3 plus récentes que la 0.33.1. Le plafond de 362 images vient d’une documentation tierce, ce n’est pas une limite officielle. Et la rustine memory_usage_factor est peut-être déjà inutile en 0.32.0 et au-delà. Dernière vérification le 2026-08-14.

Rédaction

Rédigé par

Rédaction

minimax-h3ai.video

Publié sur le MiniMax H3 AI Video Generator, une interface tierce indépendante bâtie sur MiniMax H3.

Tous les articles