Guides

MiniMax H3 в ComfyUI: версия, файлы и флаг против OOM

Нативные ноды приехали в 0.30.0, а починка нехватки памяти — только в 0.32.0. Текущее состояние, с номерами PR.

9 мин чтенияРедакцияРедакция
MiniMax H3 в ComfyUI: версия, файлы и флаг против OOM

Чтобы запустить MiniMax H3 в ComfyUI, нужны ComfyUI 0.32.0 или новее, четыре файла модели общим весом 42,47 ГБ и никаких кастомных нод. Нативная поддержка появилась в 0.30.0, но починка сэмплера для искажённого звука приехала в 0.31.0, а починка пикового потребления памяти — в 0.32.0. На карте с 24 ГБ дойдёт ли прогон до конца, решает оперативная память.

Всё здесь датировано. После 0.30.0 вышло девять исправлений по H3, так что руководство, написанное на первой неделе, описывает другую программу. У каждого факта ниже есть номер pull request и релиз.

Прежде чем что-то скачивать, проверьте вот что: лицензия сообщества MiniMax H3 выносит США, ЕС, Великобританию и Республику Корея за пределы разрешения запускать веса локально, а §V.4 распространяет это ограничение на результат. Территориальный пункт не касается хостингового API. Это краткое изложение, а не юридическая консультация — пункты разобраны в полном разборе лицензии.

Что даёт 0.30.0, а что нет

0.30.0 — это версия, где появляются ноды и три локальных шаблона-примера. И это всё, что она даёт.

Ещё шесть исправлений приехали в 0.31.0 8 августа, во главе с #15243 от kijai — Fix sampler issues for audio with minimax. Три приехали в 0.32.0 11 августа, включая #15486 от comfyanonymous — Fix peak memory issue with H3, из-за которого карта на 24 ГБ, раньше умиравшая, теперь доходит до конца.

РелизPRЧто чинитТяжесть
0.31.0#15243Сэмплер перешагивает звуковое расписание; на 4 шагах это шумблокер
0.31.0#15390EasyCache портит звуковую дорожкусерьёзно
0.31.0#15377Полная выгрузка звукового VAE падаетсерьёзно
0.31.0#15334VAE int8_convrot не загружаетсясерьёзно
0.31.0#15322Маскированное сэмплирование считается неверномелочь
0.31.0#15268Ошибки несовпадения устройств при декоде VAEмелочь
0.32.0#15486Тот самый OOM. Обновитесь, прежде чем что-то править рукамиблокер
0.32.0#15477Тайловый декод VAE падает на латентах NestedTensorсерьёзно
0.32.0#15446Без него декод медленнее и тяжелеемелочь

0.33.1 от 13 августа добавила API-ноды MiniMax ContextIR и Regenerate-2K (#15471), так что хостинговую ступень 2K можно прицепить к локальному графу. Веса этой ступени остаются на сервере, поэтому здесь нужен ключ API, а не локальный чекпойнт.

cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version        # ожидаем 0.32.0 или новее

Portable-сборка под Windows: используйте вложенный скрипт обновления или встроенный апдейтер.

Какие файлы модели качать и куда их класть

Не клонируйте репозиторий: в нём лежат все варианты точности, и суммарно это около 475 ГБ. Граф «видео по тексту» или «оживить фото» загружает ровно четыре файла, побайтово сверенных с Hugging Face 14 августа.

ФайлРазмерКладётся в
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 ГБmodels/diffusion_models/
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 ГБmodels/text_encoders/
minimax_h3_video_vae_fp16.safetensors5,21 ГБmodels/vae/
minimax_h3_audio_vae_fp32.safetensors0,61 ГБmodels/vae/
Итого42,47 ГБ = 39,55 ГиБ
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models

Видео по референсу добавляет пятый файл — отдельный чекпойнт Ref2VA, — и набор вырастает до 63,44 ГБ. Загрузить файл FL2VA в граф R2V — самая частая ошибка первого запуска.

Две широко растиражированные таблицы файлов приводят эти цифры в гибибайтах, но подписывают их как ГБ. Если вы освободили 39,6 ГБ на диске, вам не хватает 2,9 ГБ ещё до того, как ComfyUI что-нибудь запишет.

Про точность: bf16 — это 66,28 ГБ на одну только диффузионную модель, берите его, только если знаете зачем. fp8_scaled весит 20,96 ГБ, почти столько же, сколько int8_convrot; выбирайте его, только если int8_convrot не собирается в вашем окружении.

Дальше: Workflow → Browse Templates → Video → MiniMax H3. Три локальных шаблона плюс три, которые ходят в API.

Потянет ли ваш GPU?

Официального минимума нет, и все таблицы по железу, которые вы найдёте, противоречат друг другу, потому что мерили разное.

Прогон убивает оперативная память, а не видеопамять

На 4090 с урезанным стеком INT8 во время сэмплирования в видеопамяти сидит всего около 6,6 ГБ — веса живут в оперативной памяти и подкачиваются оттуда. Значит, и падение происходит по оперативной памяти. Один задокументированный прогон на 3090 дошёл до 29 866 МБ из 31 997 МБ и был убит ядром; та же задача с --disable-pinned-memory дала пик 7 508 МБ и завершилась за 23 минуты 17 секунд. Закреплённую память нельзя выгрузить в своп — поэтому добавление свопа само по себе ничего не меняет.

Если вы на 0.30–0.31 и обновиться не можете, воспроизводимые рецепты меняют одну константу — MiniMaxH3.memory_usage_factor в comfy/supported_models.py, с 0.114 на 1.0. На 0.32.0 и новее сначала обновитесь и правьте руками, только если OOM остался.

Замеренные прогоны и железо за каждым из них

Опубликовано четырнадцать прогонов с достаточной детализацией, чтобы их можно было атрибутировать. Ни один не является бенчмарком: переменные никто не фиксировал. Читайте их как доказательства существования — вот эта конфигурация дошла до конца, вот за столько.

GPUVRAMОЗУХолстДлинаВремя
RTX 306012 ГБ16 ГБ0,2 Мп5 с51 мин 07 с
RTX 306012 ГБ32 ГБ864×4805,17 с, 20 шаговменьше 9 мин
RTX 30708 ГБ32 ГБ0,4 Мп5 с~9–10 мин
RTX 4090 Laptop + SageAttention16 ГБ32 ГБ960×5405 с, 20 шагов182 с
RTX 5070 Ti16 ГБ64 ГБ0,4 Мп5 / 10 / 15 с~2 / 4,5 / 7 мин
RTX 508016 ГБ1,0 Мп10 с13 мин 36 с
RTX 409024 ГБ832×48015 с, 8 шагов~25–30 мин
RTX 309024 ГБ31 ГБ15 с23 мин 17 с
2× RTX 5090 (SGLang, не ComfyUI)по 32 ГБ377 ГиБ1344×768124 кадра, 50 шагов559,67 с

Последняя строка — это другой рантайм на двух картах с 377 ГиБ оперативной памяти. Она приведена для масштаба, а не для сравнения: предсказывать по ней скорость одной карты в ComfyUI неправильно. На одиночной 4090 тот же рецепт даёт границу выполнимости: 832×480 доходит и на 124, и на 362 кадрах, 1088×640 доходит на 124 кадрах, а 1088×640 на 192 кадрах и 1344×768 на 362 кадрах уходят в OOM.

Окупится ли карта — это отдельный расчёт.

Разрешение, кадры и сетка 17n+5

Ширину и высоту дают три настройки в Resolution Selector. Держите Multiple на 32: это сетка H3. Родной холст — короткая сторона в 768 пикселей с потолком 768×1344. На 16:9 значение Megapixels 0.98 даёт ровно 1344×768; пресет 1.0 даёт 1376×768, а это уже за документированным холстом. Шаблоны приходят на 0,4 Мп. Начинайте оттуда. Нижняя граница — 384p; 256p падает сразу.

Число кадров прилипает к 17n+5 при 24 кадрах в секунду, поэтому большинство запросов округляется вверх. 175 кадров — это 7,29 секунды; ровно 7,00 не бывает. На всём диапазоне 4–15 секунд ровно одно значение попадает в целую секунду: 192 кадра, 8,000 секунды. Проверенный потолок — 362 кадра, то есть 15,08 секунды.

Нет звука или звук искажён

Два разных сбоя с двумя разными причинами.

Тишина — это проблема схемы. Оба VAE должны быть загружены, а выход VAEDecodeAudio должен доходить до ноды сохранения. Проверяйте файл, а не плеер: вы должны увидеть H.264 при 24 кадрах в секунду и стерео AAC на 32 кГц. Нет второго потока — значит, неверен граф, а не модель.

ffprobe -hide_banner out.mp4

Искажение — это проблема сэмплера. H3 ведёт картинку и звук по двум потоковым расписаниям, shift 12 и shift 3, а одночасовой сэмплер перешагивает одно из них. На 20 шагах ошибка незаметна; на 4 шагах, которые использует Turbo LoRA, она превращается в клиппинг и шум. ComfyUI 0.31.0 обрабатывает оба расписания нативно, через ModelSamplingAV. Ниже этой версии нужен двухчасовой сэмплер от larryvrh.

Ошибки и однострочная починка для каждой

Два правила, прежде чем что-то менять. Меняйте по одной переменной за раз и перезапускайте с тем же промптом и сидом: если сложить --lowvram, --reserve-vram, --cache-none и квантованный чекпойнт разом, вы не поймёте, что именно помогло. И добейтесь, чтобы один простой официальный шаблон дошёл до конца, прежде чем добавлять SageAttention, TeaCache, EasyCache или GGUF-загрузчик.

Симптом в консолиПричинаПочинка
CUDA out of memory во время сэмплированияХолст × кадры выходят за планСначала снижайте Megapixels, потом кадры. На 0.30–0.31 обновитесь до 0.32.0 (#15486)
Процесс убит, машина замирает, ошибки CUDA нетОперативная память. Закреплённую память нельзя выгрузить--disable-pinned-memory --disable-async-offload
OOM только при декоде VAEВыделение памяти на декод растёт с числом кадровМеньше кадров или меньше холст; обновитесь до 0.32.0 (#15477, #15446)
Нод MiniMaxH3… или шаблонов нетЯдро старее 0.30.0python main.py --version, обновиться, перезапустить
Нигде нет ноды «text to video»НедоразумениеШаблон T2V — это MiniMaxH3ImageToVideo без подключённого входа. Сторонние замены не ставьте
Ошибка загрузчика на графе R2VВыбран чекпойнт FL2VA вместо Ref2VAВыберите minimax_h3_ref2va_pruned_int8_convrot.safetensors
В результате нет звуковой дорожкиЗвуковой VAE не загружен или VAEDecodeAudio не доходит до ноды сохраненияПроверьте оба, сверьтесь через ffprobe
Звук клиппит, жужжит или превращается в шумДва потоковых расписания шагают по одним часамОбновитесь до 0.31.0 (#15243) или возьмите Turbo Sampler от larryvrh
Генерация падает на 256pНиже нижней границы H3 в 384pИспользуйте пресеты шаблонов

Как сделать быстрее, в том порядке, в котором это помогает

Именно в этом порядке: первые два бесплатны, а последний стоит качества.

  1. Обновитесь. Оптимизация VAE и починка памяти в 0.32.0 стоят больше любого флага.
  2. Снижайте холст раньше, чем длину. 0,4 Мп доходит там, где 1 Мп на карте с 24 ГБ часто не доходит.
  3. SageAttention. Запускайтесь с --use-sage-attention или подставьте его через KJNodes. ComfyUI оценивает прирост примерно вдвое; машины, упирающиеся в выгрузку, увидят меньше. Предупреждения об откате dtype ожидаемы.
  4. Turbo LoRA. v4 от larryvrh срезает сэмплирование примерно с 20 шагов до 4–8. Берите 6–8; на 4 быстрое движение смазывается, а после 8 прирост заканчивается.

Не добавляйте --lowvram вместе с --disable-pinned-memory. Они конфликтуют.

Когда не надо запускать это в ComfyUI

Три случая, когда локально — неверный ответ, и один, когда он очевидно верный.

Локально неверно, если вы в США, ЕС, Великобритании или Республике Корея и поднимаете веса у себя: лицензия этого не разрешает. Неверно, если вам нужен 2K из открытых весов, потому что Regenerate-2K так и не выпустили. И неверно на 8 ГБ с 16 ГБ системной памяти, где пятисекундный клип показывали за 51 минуту.

Локально верно, если у вас 24 ГБ видеопамяти, 32 ГБ оперативной и разрешённая территория. Тогда ComfyUI даёт батчинг, LoRA и контроль на уровне нод, которых не даст ни один хостинговый интерфейс, включая наш. Поэтому здесь и выписаны все имена файлов и флаги.

Вопросы после неудачного первого запуска

Нужна ли кастомная нода? Нет. Нативно начиная с 0.30.0, и шаблоны используют только ядровые ноды.

Почему нет ноды «видео по тексту»? Шаблон T2V — это MiniMaxH3ImageToVideo без подключённого входа. Так задумано.

Какую версию реально ставить? 0.32.0 или новее. 0.30.0 работает, но в ней нет девяти исправлений по H3.

Почему результат без звука? Должны загрузиться оба VAE, а VAEDecodeAudio должен доходить до ноды сохранения. Сверьтесь через ffprobe.

Почему звук ломается на 4 шагах? Одночасовое сэмплирование перешагивает звуковое расписание. Починено в 0.31.0.

Сколько нужно места на диске? 42,47 ГБ для T2V и I2V, 63,44 ГБ вместе с Ref2VA, плюс кеш.

Справится ли карта на 12 ГБ? Да, при тяжёлой выгрузке. Мейнтейнер сообщал о 864×480, 124 кадрах, 20 шагах и времени меньше девяти минут.

Почему мой семисекундный клип получился длиннее? Кадры прилипают к 17n+5. 175 кадров — это 7,29 секунды.

Стоит ли брать сборку GGUF? Официальной нет. Пробуйте только после того, как заработает официальный стек.

Можно ли получить 2K локально? Из открытых весов — нет. Начиная с 0.33.1 можно прицепить хостинговую ноду Regenerate-2K.


Если вас останавливает загрузка на 42,47 ГБ или матрица версий, то нейросеть для генерации видео MiniMax H3 крутит все три ступени на хостинге, без установки и без карты.


Что может измениться. Это двигается еженедельно: смотрите в релизах ComfyUI записи по H3 новее 0.33.1. Потолок в 362 кадра — это стороннее описание, а не официальное ограничение. А правка memory_usage_factor, возможно, уже не нужна на 0.32.0 и новее. Последняя сверка 2026-08-14.

Редакция

Автор

Редакция

minimax-h3ai.video

Опубликовано на нейросети для генерации видео MiniMax H3 — независимом стороннем интерфейсе к модели MiniMax H3.

Все статьи