MiniMax H3 sous ComfyUI : version, fichiers, anti-OOM
Les nœuds natifs sont arrivés en 0.30.0, le correctif mémoire en 0.32.0. La plupart des guides s’arrêtent à 0.30.0. État actuel, numéros de PR.

Pour faire tourner MiniMax H3 dans ComfyUI, il vous faut ComfyUI 0.32.0 ou plus récent, quatre fichiers de modèle totalisant 42,47 Go, et aucun nœud personnalisé. La prise en charge native est arrivée en 0.30.0, mais le correctif d’échantillonnage pour l’audio déformé est tombé en 0.31.0 et le correctif de pic mémoire en 0.32.0. Sur une carte de 24 Go, c’est la RAM système qui décide si le rendu va au bout.
Tout ici est daté. Neuf correctifs H3 sont sortis après la 0.30.0, donc un guide écrit la première semaine décrit un autre programme. Chaque fait ci-dessous porte son numéro de pull request et sa version.
À vérifier avant de télécharger quoi que ce soit : la MiniMax H3 Community Licence exclut les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud de la concession permettant de faire tourner les poids en local, et son §V.4 étend cette restriction aux productions. L’API hébergée n’est pas concernée par la clause de territoire. Un résumé, pas un avis juridique — le détail complet de la licence contient les articles.
Ce que la 0.30.0 vous donne, et ce qu’elle ne donne pas
La 0.30.0, c’est là qu’apparaissent les nœuds et les trois flux d’exemple locaux. C’est tout ce qu’elle est.
Six correctifs de plus sont arrivés en 0.31.0 le 8 août, menés par le
#15243 de kijai, Fix sampler issues for audio with minimax. Trois sont
arrivés en 0.32.0 le 11 août, dont le #15486 de comfyanonymous, Fix peak
memory issue with H3 — la raison pour laquelle une carte de 24 Go qui mourait
avant va maintenant au bout.
| Version | PR | Ce qu’il corrige | Gravité |
|---|---|---|---|
| 0.31.0 | #15243 | L’échantillonneur dépasse le calendrier audio ; à 4 étapes, c’est du bruit | bloquant |
| 0.31.0 | #15390 | EasyCache corrompt la bande sonore | majeur |
| 0.31.0 | #15377 | Le déchargement complet du VAE audio échoue | majeur |
| 0.31.0 | #15334 | Le VAE int8_convrot refuse de se charger | majeur |
| 0.31.0 | #15322 | L’échantillonnage masqué est faux | mineur |
| 0.31.0 | #15268 | Erreurs de périphérique incohérent pendant le décodage VAE | mineur |
| 0.32.0 | #15486 | Celui de l’OOM. Mettez à jour avant de rustiner à la main | bloquant |
| 0.32.0 | #15477 | Le décodage VAE en tuiles plante sur les latents NestedTensor | majeur |
| 0.32.0 | #15446 | Sans lui, le décodage est plus lent et plus lourd | mineur |
La 0.33.1 du 13 août a ajouté les nœuds d’API MiniMax ContextIR et
Regenerate-2K (#15471), de sorte que l’étape 2K hébergée peut être chaînée sur
un graphe local. Les poids de cette étape restent hébergés, donc ce chemin
demande une clé d’API plutôt qu’un checkpoint local.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version # expect 0.32.0 or laterVersion portable Windows : utilisez le script de mise à jour fourni ou le programme de mise à jour intégré.
Quels fichiers de modèle télécharger, et où ils vont
Ne clonez pas le dépôt : il contient toutes les variantes de précision et pèse environ 475 Go. Un graphe texte vers vidéo (T2V) ou image vers vidéo (I2V) charge exactement quatre fichiers, vérifiés octet par octet sur Hugging Face le 14 août.
| Fichier | Taille | Va dans |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 Go | models/diffusion_models/ |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 Go | models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | 5,21 Go | models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | 0,61 Go | models/vae/ |
| Total | 42,47 Go = 39,55 Gio |
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir ComfyUI/modelsLe graphe à image de référence ajoute un cinquième fichier, le checkpoint Ref2VA distinct, ce qui porte l’ensemble à 63,44 Go. Charger le fichier FL2VA dans un graphe R2V est l’échec de premier lancement le plus fréquent.
Deux tableaux de fichiers très recopiés donnent ces chiffres en gibioctets tout en les étiquetant Go. Si vous avez libéré 39,6 Go de disque, il vous en manque 2,9 avant même que ComfyUI n’écrive quoi que ce soit.
Sur la précision : bf16 pèse 66,28 Go pour le seul modèle de diffusion —
choisissez-le seulement si vous savez pourquoi. fp8_scaled pèse 20,96 Go,
presque la même taille qu’int8_convrot ; ne le prenez que si int8_convrot ne
se construit pas dans votre environnement.
Ensuite : Workflow → Browse Templates → Video → MiniMax H3. Trois flux locaux, plus trois qui appellent l’API.
Votre GPU va-t-il y arriver ?
Il n’y a pas de minimum officiel, et tous les tableaux de matériel que vous trouverez se contredisent, parce qu’ils ont mesuré des choses différentes.
Ce qui tue le rendu, c’est la RAM système, pas la VRAM
Sur une 4090 qui fait tourner la pile INT8 élaguée, seuls 6,6 Go environ
occupent la VRAM pendant l’échantillonnage — les poids vivent en mémoire système
et sont paginés au fur et à mesure. L’échec est donc un échec de mémoire
système. Une exécution documentée sur 3090 a atteint 29 866 Mo sur 31 997 Mo et
a été tuée par le noyau ; le même travail avec --disable-pinned-memory a
plafonné à 7 508 Mo et s’est terminé en 23 minutes 17 secondes. La mémoire
épinglée ne peut pas être paginée, ce qui explique qu’ajouter du swap ne change
rien à soi seul.
Si vous êtes en 0.30–0.31 et ne pouvez pas mettre à jour, les recettes
reproductibles changent une constante — MiniMaxH3.memory_usage_factor dans
comfy/supported_models.py, de 0.114 à 1.0. En 0.32.0 ou plus récent,
mettez à jour d’abord et ne rustinez que si ça déborde encore.
Exécutions mesurées, et le matériel derrière chacune
Quatorze exécutions ont été publiées avec assez de détail pour être attribuées. Aucune n’est un banc d’essai : personne n’a tenu les variables immobiles. Lisez-les comme des preuves d’existence — cette configuration est allée au bout, en ce temps-là.
| GPU | VRAM | RAM système | Surface | Durée | Temps |
|---|---|---|---|---|---|
| RTX 3060 | 12 Go | 16 Go | 0,2 MP | 5 s | 51 min 07 s |
| RTX 3060 | 12 Go | 32 Go | 864×480 | 5,17 s, 20 étapes | moins de 9 min |
| RTX 3070 | 8 Go | 32 Go | 0,4 MP | 5 s | ~9–10 min |
| RTX 4090 Laptop + SageAttention | 16 Go | 32 Go | 960×540 | 5 s, 20 étapes | 182 s |
| RTX 5070 Ti | 16 Go | 64 Go | 0,4 MP | 5 / 10 / 15 s | ~2 / 4,5 / 7 min |
| RTX 5080 | 16 Go | — | 1,0 MP | 10 s | 13 min 36 s |
| RTX 4090 | 24 Go | — | 832×480 | 15 s, 8 étapes | ~25–30 min |
| RTX 3090 | 24 Go | 31 Go | — | 15 s | 23 min 17 s |
| 2× RTX 5090 (SGLang, pas ComfyUI) | 32 Go chacune | 377 Gio | 1344×768 | 124 images, 50 étapes | 559,67 s |
Cette dernière ligne est un autre moteur d’exécution, sur deux cartes, avec 377 Gio de RAM système. Elle est là pour l’échelle, pas pour la comparaison : s’en servir pour prédire la vitesse d’un ComfyUI mono-carte est faux. Sur une seule 4090, la même recette donne une limite de faisabilité — 832×480 va au bout à 124 comme à 362 images, 1088×640 va au bout à 124 images, et 1088×640 à 192 images comme 1344×768 à 362 images débordent.
Savoir si la carte se rembourse est un calcul à part.
Résolution, images et la grille 17n+5
Trois réglages du Resolution Selector produisent la largeur et la hauteur. Gardez Multiple à 32 — c’est la grille de H3. La surface native est un petit côté de 768 pixels plafonné à 768×1344. En 16:9, Megapixels 0,98 donne exactement 1344×768 ; le préréglage 1,0 donne 1376×768, qui sort de la surface documentée. Les flux fournis sont à 0,4 MP. Commencez là. Le plancher est à 384p ; le 256p échoue franchement.
Le nombre d’images se cale sur 17n+5 à 24 images par seconde, donc la plupart des demandes sont arrondies vers le haut. 175 images font 7,29 secondes ; il n’existe pas de 7,00. Sur toute la plage de 4 à 15 secondes, une seule valeur tombe sur une seconde entière : 192 images, 8,000 secondes. Le plafond validé est de 362 images, soit 15,08 secondes.
Pas de son, ou du son déformé
Deux échecs différents avec deux causes différentes.
Le silence est un problème de câblage. Les deux VAE doivent être chargés et
la sortie VAEDecodeAudio doit atteindre le nœud d’enregistrement. Vérifiez le
fichier, pas le lecteur — vous devez voir du H.264 à 24 images par seconde et de
l’AAC stéréo à 32 kHz. L’absence d’un second flux signifie que le graphe est
faux, pas le modèle.
ffprobe -hide_banner out.mp4La déformation est un problème d’échantillonneur. H3 fait tourner l’image et
le son sur deux calendriers de flux, shift 12 et shift 3, et un échantillonneur
à une seule horloge en dépasse un des deux. À 20 étapes, l’erreur est invisible ;
aux 4 étapes qu’utilise un Turbo LoRA, elle devient de l’écrêtage et du bruit.
ComfyUI 0.31.0 gère nativement les deux calendriers via ModelSamplingAV.
En dessous de cette version, il vous faut l’échantillonneur à deux horloges de
larryvrh.
Les erreurs, et le correctif en une ligne pour chacune
Deux règles avant de changer quoi que ce soit. Changez une variable à la fois et
relancez le même prompt avec la même seed — empiler --lowvram,
--reserve-vram, --cache-none et un checkpoint quantifié d’un coup vous laisse
sans savoir lequel a aidé. Et faites aboutir un flux officiel nu avant d’ajouter
SageAttention, TeaCache, EasyCache ou un chargeur GGUF.
| Symptôme dans la console | Cause | Correctif |
|---|---|---|
CUDA out of memory pendant l’échantillonnage | Surface × images dépassent le plan | Baissez Megapixels d’abord, les images ensuite. En 0.30–0.31, passez en 0.32.0 (#15486) |
| Processus tué, machine figée, aucune erreur CUDA | RAM système. La mémoire épinglée ne peut pas être paginée | --disable-pinned-memory --disable-async-offload |
| OOM seulement au décodage VAE | L’allocation de décodage suit le nombre d’images | Moins d’images ou surface plus petite ; passez en 0.32.0 (#15477, #15446) |
Nœuds ou flux MiniMaxH3… absents | Cœur plus ancien que 0.30.0 | python main.py --version, mettez à jour, redémarrez |
| Aucun nœud « texte vers vidéo » nulle part | Malentendu | Le flux T2V, c’est MiniMaxH3ImageToVideo sans rien de branché. N’installez pas de remplaçants tiers |
| Erreur de chargement sur le graphe R2V | Checkpoint FL2VA choisi à la place de Ref2VA | Choisissez minimax_h3_ref2va_pruned_int8_convrot.safetensors |
| La sortie n’a pas de flux audio | VAE audio non chargé, ou VAEDecodeAudio n’atteint pas le nœud d’enregistrement | Vérifiez les deux, confirmez avec ffprobe |
| Le son sature, bourdonne ou tourne au bruit | Deux calendriers de flux cadencés sur une seule horloge | Passez en 0.31.0 (#15243), ou prenez le Turbo Sampler de larryvrh |
| La génération échoue en 256p | Sous le plancher de 384p de H3 | Utilisez les préréglages fournis |
L’accélérer, dans l’ordre qui sert
Dans cet ordre, parce que les deux premiers ne coûtent rien et que le dernier coûte de la qualité.
- Mettez à jour. L’optimisation VAE et le correctif mémoire de la 0.32.0 valent plus que n’importe quelle option.
- Baissez la surface avant la durée. 0,4 MP va au bout là où 1 MP sur une carte de 24 Go n’y arrive souvent pas.
- SageAttention. Lancez avec
--use-sage-attention, ou greffez-le avec KJNodes. ComfyUI estime à peu près le double ; les machines limitées par le déchargement en voient moins. Les avertissements de repli de dtype sont attendus. - Turbo LoRA. La v4 de larryvrh fait passer l’échantillonnage d’environ 20 étapes à 4–8. Prenez 6–8 ; à 4, les mouvements rapides bavent, et au-delà de 8 cela n’aide plus.
N’ajoutez pas --lowvram en même temps que --disable-pinned-memory. Ils
entrent en conflit.
Quand ne pas le faire tourner dans ComfyUI
Trois cas où le local est la mauvaise réponse, et un où il est clairement la bonne.
Le local est faux si vous êtes aux États-Unis, dans l’UE, au Royaume-Uni ou en Corée du Sud et que vous hébergez les poids vous-même ; la licence ne l’accorde pas. Il est faux s’il vous faut du 2K à partir des poids ouverts, parce que Regenerate-2K n’a jamais été publié. Et il est faux sur 8 Go avec 16 Go de RAM système, où un clip de cinq secondes a été rapporté à 51 minutes.
Le local est juste si vous avez 24 Go de VRAM, 32 Go de RAM système et un territoire autorisé. ComfyUI vous donne alors le traitement par lots, les LoRA et un contrôle au niveau du nœud qu’aucune interface hébergée, la nôtre comprise, ne peut égaler. C’est pour cela que chaque nom de fichier et chaque option sont écrits ici en toutes lettres.
Questions après un premier lancement raté
Ai-je besoin d’un nœud personnalisé ? Non. Natif depuis la 0.30.0, et les flux fournis n’utilisent que des nœuds du cœur.
Pourquoi n’y a-t-il pas de nœud texte vers vidéo ?
Le flux T2V, c’est MiniMaxH3ImageToVideo sans rien de branché. C’est voulu.
Quelle version faire tourner, concrètement ? La 0.32.0 ou plus récente. La 0.30.0 fonctionne, mais il lui manque neuf correctifs H3.
Pourquoi ma sortie est-elle muette ?
Les deux VAE doivent se charger et VAEDecodeAudio doit atteindre le nœud
d’enregistrement. Confirmez avec ffprobe.
Pourquoi le son casse-t-il à 4 étapes ? L’échantillonnage à une horloge dépasse le calendrier audio. Corrigé en 0.31.0.
Combien de disque me faut-il ? 42,47 Go pour le T2V et l’I2V, 63,44 Go avec Ref2VA, plus le cache.
Une carte de 12 Go peut-elle le faire ? Oui, avec un déchargement massif. Un mainteneur a rapporté 864×480, 124 images, 20 étapes, en moins de neuf minutes.
Pourquoi mon clip de 7 secondes a-t-il duré plus longtemps ? Le nombre d’images se cale sur 17n+5. 175 images font 7,29 secondes.
Faut-il prendre une version GGUF ? Il n’y en a pas d’officielle. N’essayez qu’une fois la pile officielle en état de marche.
Puis-je obtenir du 2K en local ? Pas à partir des poids ouverts. Depuis la 0.33.1, vous pouvez chaîner le nœud Regenerate-2K hébergé.
Si c’est le téléchargement de 42,47 Go ou la matrice des versions qui vous arrête, le générateur de vidéo IA MiniMax H3 fait tourner les trois étages en hébergé, sans rien à installer et sans carte.
Ce qui peut changer. Cela bouge toutes les semaines : regardez les versions
de ComfyUI pour des entrées H3 plus récentes que la 0.33.1. Le plafond de
362 images vient d’une documentation tierce, ce n’est pas une limite officielle.
Et la rustine memory_usage_factor est peut-être déjà inutile en 0.32.0 et
au-delà. Dernière vérification le 2026-08-14.
Rédigé par
Rédaction
minimax-h3ai.video
Publié sur le MiniMax H3 AI Video Generator, une interface tierce indépendante bâtie sur MiniMax H3.


