Stable Diffusion

Celý MiniMax H3 v jedné nodě pro ComfyUI, video se zvukem bez obřích workflow

Celý MiniMax H3 v jedné nodě pro ComfyUI, video se zvukem bez obřích workflow

Kdo někdy skládal v ComfyUI workflow pro video model, ví, jak to dopadá: dvacet nodů, patnáct drátů, tři custom packy a stačí jeden update, aby se celé plátno rozsypalo. U MiniMax H3, který generuje video rovnou i se zvukem, je graf ještě divočejší — samostatná větev pro text encoder, pro video VAE, pro audio VAE, pro Motion Context… Proto mě nadchlo, když jsem narazil na repozitář ComfyUI-ALLinONE-MinimaxH3. Celý ten cirkus zabalí do jediné nody.

Co je MiniMax H3 a proč stojí za pozornost

MiniMax H3 je aktuální generace čínského video modelu, která umí generovat video včetně nativního zvuku — mluvené slovo, ruchy i hudbu v jednom průchodu, žádné dodatečné ozvučování. Váhy jsou volně ke stažení přes Comfy-Org v ořezaných kvantizovaných verzích (int8 u diffusion modelů, nvfp4 u text encoderu), takže běží lokálně na herní grafice. Žádný API klíč, žádné kredity, žádné odesílání dat na cizí server.

Model existuje ve dvou variantách: fl2va pro klasické text-to-video a animaci snímků, a ref2va pro generování řízené referencemi — obrázky, videi nebo zvukem.

Osm režimů v jedné nodě

Po instalaci stačí poklepat na plátno, vyhledat „ALL in ONE MiniMaxH3" a máte před sebou jednu nodu, která přepíná mezi osmi režimy:

  • Image — text-to-image, editace obrázku nebo míchání až 9 referencí přes H3 Studio
  • T2V — text na video s nativním zvukem
  • I2V — rozpohybování obrázku, volitelně s morfem do koncového snímku
  • R2V — generování podle referencí (obrázky, videa i audio)
  • Audio Drive — video řízené zvukovou stopou včetně lip-syncu
  • Keyframes — vlastní snímky umístěné na libovolné pozice v čase
  • Extend — plynulé prodloužení existujícího videa
  • Chain — řetězení více klipů přes H3 Motion Context, navazuje se v latentu, takže se nic znovu nekóduje a kvalita mezi klipy nedegraduje

K tomu autor přibalil věci, které v ComfyUI normálně řešíte dalšími packy: živý náhled během samplování, prohledávatelnou historii s možností znovu použít starý prompt a knihovnu výstupů s oblíbenými položkami a napojením na RTX upscale.

Instalace a co budete potřebovat

Samotná noda se instaluje klasicky:

cd ComfyUI/custom_nodes
git clone https://github.com/LeonQ8/ComfyUI-ALLinONE-MinimaxH3.git

Pak restart ComfyUI a noda je v nabídce. Bez modelů ale nic nepustí — základ pro T2V, I2V a R2V tvoří pět souborů z repozitáře Comfy-Org/MiniMax-H3:

  • minimax_h3_fl2va_pruned_int8_convrot.safetensorsdiffusion_models/
  • minimax_h3_ref2va_pruned_int8_convrot.safetensorsdiffusion_models/
  • qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorstext_encoders/
  • minimax_h3_video_vae_fp16.safetensors a minimax_h3_audio_vae_fp32.safetensorsvae/

Praktický detail, který oceňuji: doplňkové node packy potřebujete jen pro režimy, které opravdu používáte. Audio Drive chce comfyui-vrgamedevgirl, režimy Keyframes/Extend/Chain zase ComfyUI-H3-Motion-Context-MultiRef, Image mód ComfyUI-MiniMax-H3-Studio. Kdo chce rychlejší generování, stáhne si Turbo LoRA minimax_h3_turbo_v4_step600_ema.safetensors a příslušný preset pack. Nic z toho není povinné pro základní text-to-video.

Na co si dát pozor

Projekt je oficiálně v betě a autor vývoj testuje na přesně přišpendlené sestavě: ComfyUI 0.33.0, Python 3.12.10, PyTorch 2.9.1 s CUDA 13.0, Windows portable. Neznamená to, že jinde nepoběží, ale když se něco rozbije, první krok je porovnat verze s jeho souborem COMPATIBILITY.md — sám tam píše, že po updatu se skoro vždy pohnul ComfyUI nebo některý node pack, ne tahle noda. Z vlastní zkušenosti s ComfyUI můžu jen podepsat.

Dvě konkrétní známé miny:

  • Akcelerační pack ComfyUI-MiniMaxH3-Cache rozbíjí režimy Chain a Extend na ComfyUI 0.33, protože mění signatury modelu. Řešení je prosté — přejmenovat složku packu na .disabled, když tyhle režimy potřebujete.
  • Buildy ComfyUI z 6.–13. srpna 2026 obsahovaly chybu, kvůli které padal režim R2V na nesouhlasu tvarů tensorů. Opraveno v jádru 13. srpna, takže stačí aktualizovat ComfyUI.

Nároky na VRAM autor neuvádí. Modely jsou sice ořezané a kvantizované, ale text encoder je odvozený z 32B Qwenu — na 8GB kartě bych zázraky nečekal, tohle je hračka spíš pro 16 GB a víc.

Licence je GPL-3.0, takže noda je zdarma i pro komerční tvorbu videí; jen kdybyste na ní chtěli stavět a šířit vlastní software, musí být také open-source.

Proč to podle mě dává smysl

Podobných „all-in-one" pokusů už v ComfyUI pár bylo a většinou narazily na to, že schovávaly příliš mnoho nastavení. Tahle noda jde na věc chytřeji — parametry nechává přístupné, jen odstraňuje ruční drátování mezi komponentami, které stejně každý zapojoval pořád stejně. A hlavně pokrývá i pokročilé disciplíny jako řetězení klipů v latentu, které si běžný uživatel z oficiálních workflow sám neposkládá.

Jestli MiniMax H3 teprve zkoušíte, začněte režimem T2V se základními pěti modely a teprve potom přidávejte packy pro další režimy — vyhnete se hledání, který ze sedmi najednou nainstalovaných doplňků vám rozbil frontu. A než příště aktualizujete ComfyUI, mrkněte do COMPATIBILITY.md v repozitáři, jestli vás nečeká známá past.

Odkaz na repozitář: github.com/LeonQ8/ComfyUI-ALLinONE-MinimaxH3 (GPL-3.0, zdarma)

← Zpět na tutoriály