MiniMax H3 в ComfyUI: версия, файлы и флаг против OOM
Нативные ноды приехали в 0.30.0, а починка нехватки памяти — только в 0.32.0. Текущее состояние, с номерами PR.

Чтобы запустить MiniMax H3 в ComfyUI, нужны ComfyUI 0.32.0 или новее, четыре файла модели общим весом 42,47 ГБ и никаких кастомных нод. Нативная поддержка появилась в 0.30.0, но починка сэмплера для искажённого звука приехала в 0.31.0, а починка пикового потребления памяти — в 0.32.0. На карте с 24 ГБ дойдёт ли прогон до конца, решает оперативная память.
Всё здесь датировано. После 0.30.0 вышло девять исправлений по H3, так что руководство, написанное на первой неделе, описывает другую программу. У каждого факта ниже есть номер pull request и релиз.
Прежде чем что-то скачивать, проверьте вот что: лицензия сообщества MiniMax H3 выносит США, ЕС, Великобританию и Республику Корея за пределы разрешения запускать веса локально, а §V.4 распространяет это ограничение на результат. Территориальный пункт не касается хостингового API. Это краткое изложение, а не юридическая консультация — пункты разобраны в полном разборе лицензии.
Что даёт 0.30.0, а что нет
0.30.0 — это версия, где появляются ноды и три локальных шаблона-примера. И это всё, что она даёт.
Ещё шесть исправлений приехали в 0.31.0 8 августа, во главе с #15243 от
kijai — Fix sampler issues for audio with minimax. Три приехали в 0.32.0
11 августа, включая #15486 от comfyanonymous — Fix peak memory issue with H3,
из-за которого карта на 24 ГБ, раньше умиравшая, теперь доходит до конца.
| Релиз | PR | Что чинит | Тяжесть |
|---|---|---|---|
| 0.31.0 | #15243 | Сэмплер перешагивает звуковое расписание; на 4 шагах это шум | блокер |
| 0.31.0 | #15390 | EasyCache портит звуковую дорожку | серьёзно |
| 0.31.0 | #15377 | Полная выгрузка звукового VAE падает | серьёзно |
| 0.31.0 | #15334 | VAE int8_convrot не загружается | серьёзно |
| 0.31.0 | #15322 | Маскированное сэмплирование считается неверно | мелочь |
| 0.31.0 | #15268 | Ошибки несовпадения устройств при декоде VAE | мелочь |
| 0.32.0 | #15486 | Тот самый OOM. Обновитесь, прежде чем что-то править руками | блокер |
| 0.32.0 | #15477 | Тайловый декод VAE падает на латентах NestedTensor | серьёзно |
| 0.32.0 | #15446 | Без него декод медленнее и тяжелее | мелочь |
0.33.1 от 13 августа добавила API-ноды MiniMax ContextIR и Regenerate-2K
(#15471), так что хостинговую ступень 2K можно прицепить к локальному графу.
Веса этой ступени остаются на сервере, поэтому здесь нужен ключ API, а не
локальный чекпойнт.
cd /path/to/ComfyUI
git pull
python -m pip install -r requirements.txt
python main.py --version # ожидаем 0.32.0 или новееPortable-сборка под Windows: используйте вложенный скрипт обновления или встроенный апдейтер.
Какие файлы модели качать и куда их класть
Не клонируйте репозиторий: в нём лежат все варианты точности, и суммарно это около 475 ГБ. Граф «видео по тексту» или «оживить фото» загружает ровно четыре файла, побайтово сверенных с Hugging Face 14 августа.
| Файл | Размер | Кладётся в |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20,97 ГБ | models/diffusion_models/ |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15,69 ГБ | models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | 5,21 ГБ | models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | 0,61 ГБ | models/vae/ |
| Итого | 42,47 ГБ = 39,55 ГиБ |
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir ComfyUI/modelsВидео по референсу добавляет пятый файл — отдельный чекпойнт Ref2VA, — и набор вырастает до 63,44 ГБ. Загрузить файл FL2VA в граф R2V — самая частая ошибка первого запуска.
Две широко растиражированные таблицы файлов приводят эти цифры в гибибайтах, но подписывают их как ГБ. Если вы освободили 39,6 ГБ на диске, вам не хватает 2,9 ГБ ещё до того, как ComfyUI что-нибудь запишет.
Про точность: bf16 — это 66,28 ГБ на одну только диффузионную модель, берите
его, только если знаете зачем. fp8_scaled весит 20,96 ГБ, почти столько же,
сколько int8_convrot; выбирайте его, только если int8_convrot не собирается
в вашем окружении.
Дальше: Workflow → Browse Templates → Video → MiniMax H3. Три локальных шаблона плюс три, которые ходят в API.
Потянет ли ваш GPU?
Официального минимума нет, и все таблицы по железу, которые вы найдёте, противоречат друг другу, потому что мерили разное.
Прогон убивает оперативная память, а не видеопамять
На 4090 с урезанным стеком INT8 во время сэмплирования в видеопамяти сидит всего
около 6,6 ГБ — веса живут в оперативной памяти и подкачиваются оттуда.
Значит, и падение происходит по оперативной памяти. Один задокументированный
прогон на 3090 дошёл до 29 866 МБ из 31 997 МБ и был убит ядром; та же задача с
--disable-pinned-memory дала пик 7 508 МБ и завершилась за 23 минуты
17 секунд. Закреплённую память нельзя выгрузить в своп — поэтому добавление
свопа само по себе ничего не меняет.
Если вы на 0.30–0.31 и обновиться не можете, воспроизводимые рецепты меняют одну
константу — MiniMaxH3.memory_usage_factor в comfy/supported_models.py, с
0.114 на 1.0. На 0.32.0 и новее сначала обновитесь и правьте руками, только
если OOM остался.
Замеренные прогоны и железо за каждым из них
Опубликовано четырнадцать прогонов с достаточной детализацией, чтобы их можно было атрибутировать. Ни один не является бенчмарком: переменные никто не фиксировал. Читайте их как доказательства существования — вот эта конфигурация дошла до конца, вот за столько.
| GPU | VRAM | ОЗУ | Холст | Длина | Время |
|---|---|---|---|---|---|
| RTX 3060 | 12 ГБ | 16 ГБ | 0,2 Мп | 5 с | 51 мин 07 с |
| RTX 3060 | 12 ГБ | 32 ГБ | 864×480 | 5,17 с, 20 шагов | меньше 9 мин |
| RTX 3070 | 8 ГБ | 32 ГБ | 0,4 Мп | 5 с | ~9–10 мин |
| RTX 4090 Laptop + SageAttention | 16 ГБ | 32 ГБ | 960×540 | 5 с, 20 шагов | 182 с |
| RTX 5070 Ti | 16 ГБ | 64 ГБ | 0,4 Мп | 5 / 10 / 15 с | ~2 / 4,5 / 7 мин |
| RTX 5080 | 16 ГБ | — | 1,0 Мп | 10 с | 13 мин 36 с |
| RTX 4090 | 24 ГБ | — | 832×480 | 15 с, 8 шагов | ~25–30 мин |
| RTX 3090 | 24 ГБ | 31 ГБ | — | 15 с | 23 мин 17 с |
| 2× RTX 5090 (SGLang, не ComfyUI) | по 32 ГБ | 377 ГиБ | 1344×768 | 124 кадра, 50 шагов | 559,67 с |
Последняя строка — это другой рантайм на двух картах с 377 ГиБ оперативной памяти. Она приведена для масштаба, а не для сравнения: предсказывать по ней скорость одной карты в ComfyUI неправильно. На одиночной 4090 тот же рецепт даёт границу выполнимости: 832×480 доходит и на 124, и на 362 кадрах, 1088×640 доходит на 124 кадрах, а 1088×640 на 192 кадрах и 1344×768 на 362 кадрах уходят в OOM.
Окупится ли карта — это отдельный расчёт.
Разрешение, кадры и сетка 17n+5
Ширину и высоту дают три настройки в Resolution Selector. Держите Multiple на 32: это сетка H3. Родной холст — короткая сторона в 768 пикселей с потолком 768×1344. На 16:9 значение Megapixels 0.98 даёт ровно 1344×768; пресет 1.0 даёт 1376×768, а это уже за документированным холстом. Шаблоны приходят на 0,4 Мп. Начинайте оттуда. Нижняя граница — 384p; 256p падает сразу.
Число кадров прилипает к 17n+5 при 24 кадрах в секунду, поэтому большинство запросов округляется вверх. 175 кадров — это 7,29 секунды; ровно 7,00 не бывает. На всём диапазоне 4–15 секунд ровно одно значение попадает в целую секунду: 192 кадра, 8,000 секунды. Проверенный потолок — 362 кадра, то есть 15,08 секунды.
Нет звука или звук искажён
Два разных сбоя с двумя разными причинами.
Тишина — это проблема схемы. Оба VAE должны быть загружены, а выход
VAEDecodeAudio должен доходить до ноды сохранения. Проверяйте файл, а не
плеер: вы должны увидеть H.264 при 24 кадрах в секунду и стерео AAC на 32 кГц.
Нет второго потока — значит, неверен граф, а не модель.
ffprobe -hide_banner out.mp4Искажение — это проблема сэмплера. H3 ведёт картинку и звук по двум потоковым
расписаниям, shift 12 и shift 3, а одночасовой сэмплер перешагивает одно из них.
На 20 шагах ошибка незаметна; на 4 шагах, которые использует Turbo LoRA, она
превращается в клиппинг и шум. ComfyUI 0.31.0 обрабатывает оба расписания
нативно, через ModelSamplingAV. Ниже этой версии нужен двухчасовой сэмплер от
larryvrh.
Ошибки и однострочная починка для каждой
Два правила, прежде чем что-то менять. Меняйте по одной переменной за раз и
перезапускайте с тем же промптом и сидом: если сложить --lowvram,
--reserve-vram, --cache-none и квантованный чекпойнт разом, вы не поймёте,
что именно помогло. И добейтесь, чтобы один простой официальный шаблон дошёл до
конца, прежде чем добавлять SageAttention, TeaCache, EasyCache или GGUF-загрузчик.
| Симптом в консоли | Причина | Починка |
|---|---|---|
CUDA out of memory во время сэмплирования | Холст × кадры выходят за план | Сначала снижайте Megapixels, потом кадры. На 0.30–0.31 обновитесь до 0.32.0 (#15486) |
| Процесс убит, машина замирает, ошибки CUDA нет | Оперативная память. Закреплённую память нельзя выгрузить | --disable-pinned-memory --disable-async-offload |
| OOM только при декоде VAE | Выделение памяти на декод растёт с числом кадров | Меньше кадров или меньше холст; обновитесь до 0.32.0 (#15477, #15446) |
Нод MiniMaxH3… или шаблонов нет | Ядро старее 0.30.0 | python main.py --version, обновиться, перезапустить |
| Нигде нет ноды «text to video» | Недоразумение | Шаблон T2V — это MiniMaxH3ImageToVideo без подключённого входа. Сторонние замены не ставьте |
| Ошибка загрузчика на графе R2V | Выбран чекпойнт FL2VA вместо Ref2VA | Выберите minimax_h3_ref2va_pruned_int8_convrot.safetensors |
| В результате нет звуковой дорожки | Звуковой VAE не загружен или VAEDecodeAudio не доходит до ноды сохранения | Проверьте оба, сверьтесь через ffprobe |
| Звук клиппит, жужжит или превращается в шум | Два потоковых расписания шагают по одним часам | Обновитесь до 0.31.0 (#15243) или возьмите Turbo Sampler от larryvrh |
| Генерация падает на 256p | Ниже нижней границы H3 в 384p | Используйте пресеты шаблонов |
Как сделать быстрее, в том порядке, в котором это помогает
Именно в этом порядке: первые два бесплатны, а последний стоит качества.
- Обновитесь. Оптимизация VAE и починка памяти в 0.32.0 стоят больше любого флага.
- Снижайте холст раньше, чем длину. 0,4 Мп доходит там, где 1 Мп на карте с 24 ГБ часто не доходит.
- SageAttention. Запускайтесь с
--use-sage-attentionили подставьте его через KJNodes. ComfyUI оценивает прирост примерно вдвое; машины, упирающиеся в выгрузку, увидят меньше. Предупреждения об откате dtype ожидаемы. - Turbo LoRA. v4 от larryvrh срезает сэмплирование примерно с 20 шагов до 4–8. Берите 6–8; на 4 быстрое движение смазывается, а после 8 прирост заканчивается.
Не добавляйте --lowvram вместе с --disable-pinned-memory. Они конфликтуют.
Когда не надо запускать это в ComfyUI
Три случая, когда локально — неверный ответ, и один, когда он очевидно верный.
Локально неверно, если вы в США, ЕС, Великобритании или Республике Корея и поднимаете веса у себя: лицензия этого не разрешает. Неверно, если вам нужен 2K из открытых весов, потому что Regenerate-2K так и не выпустили. И неверно на 8 ГБ с 16 ГБ системной памяти, где пятисекундный клип показывали за 51 минуту.
Локально верно, если у вас 24 ГБ видеопамяти, 32 ГБ оперативной и разрешённая территория. Тогда ComfyUI даёт батчинг, LoRA и контроль на уровне нод, которых не даст ни один хостинговый интерфейс, включая наш. Поэтому здесь и выписаны все имена файлов и флаги.
Вопросы после неудачного первого запуска
Нужна ли кастомная нода? Нет. Нативно начиная с 0.30.0, и шаблоны используют только ядровые ноды.
Почему нет ноды «видео по тексту»?
Шаблон T2V — это MiniMaxH3ImageToVideo без подключённого входа. Так задумано.
Какую версию реально ставить? 0.32.0 или новее. 0.30.0 работает, но в ней нет девяти исправлений по H3.
Почему результат без звука?
Должны загрузиться оба VAE, а VAEDecodeAudio должен доходить до ноды
сохранения. Сверьтесь через ffprobe.
Почему звук ломается на 4 шагах? Одночасовое сэмплирование перешагивает звуковое расписание. Починено в 0.31.0.
Сколько нужно места на диске? 42,47 ГБ для T2V и I2V, 63,44 ГБ вместе с Ref2VA, плюс кеш.
Справится ли карта на 12 ГБ? Да, при тяжёлой выгрузке. Мейнтейнер сообщал о 864×480, 124 кадрах, 20 шагах и времени меньше девяти минут.
Почему мой семисекундный клип получился длиннее? Кадры прилипают к 17n+5. 175 кадров — это 7,29 секунды.
Стоит ли брать сборку GGUF? Официальной нет. Пробуйте только после того, как заработает официальный стек.
Можно ли получить 2K локально? Из открытых весов — нет. Начиная с 0.33.1 можно прицепить хостинговую ноду Regenerate-2K.
Если вас останавливает загрузка на 42,47 ГБ или матрица версий, то нейросеть для генерации видео MiniMax H3 крутит все три ступени на хостинге, без установки и без карты.
Что может измениться. Это двигается еженедельно: смотрите в релизах ComfyUI
записи по H3 новее 0.33.1. Потолок в 362 кадра — это стороннее описание, а не
официальное ограничение. А правка memory_usage_factor, возможно, уже не нужна
на 0.32.0 и новее. Последняя сверка 2026-08-14.
Автор
Редакция
minimax-h3ai.video
Опубликовано на нейросети для генерации видео MiniMax H3 — независимом стороннем интерфейсе к модели MiniMax H3.


