Nástroje

Higgs Audio Studio — české TTS a klonování hlasu bez cloudu

Higgs Audio Studio — české TTS a klonování hlasu bez cloudu

Higgs Audio v3 patří k nejlepším otevřeným modelům pro syntézu řeči — psal jsem o něm samostatně. Mezi konstatováním, že je model dobrý, a jeho každodenním používáním ale stojí praktická překážka: ovládá se z příkazové řádky nebo přes workflow v ComfyUI a český text mu musíš připravit ručně, aby přečetl datum jako datum a ne jako řadu číslic.

Proto jsem k němu postavil Higgs Audio Studio — webové rozhraní, které z modelu dělá hotový nástroj. Je celé v češtině a běží výhradně na tvém počítači. Žádný cloud, žádná registrace, žádná nahrávka odeslaná na cizí server.

Devět nástrojů v jednom rozhraní

Levý panel sdružuje úlohy, které se kolem syntézy řeči řeší nejčastěji:

  • Převod textu na řeč — základní režim. Dlouhé texty se automaticky dělí po 45 slovech, aby model udržel plynulost.
  • Klonování hlasu — z ukázky dlouhé 5 až 30 sekund. Přepis nahrávky zajistí Whisper na pozadí, což znatelně zvyšuje věrnost výsledku.
  • Hlas na hlas — namluvíš větu vlastním hlasem a vyjde ve zvoleném hlase z knihovny. Vhodné tam, kde na přesné intonaci záleží víc než na textu.
  • Dialog — scéna až pro šest postav, každá s vlastním hlasem.
  • Rozhovor — propojení s lokálně běžící Ollamou, odpovědi zazní naklonovaným hlasem.
  • Přepis řeči, Studio pro skládání delších projektů po blocích, Knihovna hlasů a Historie s přehráváním, oblíbenými a exportem.

Součástí instalace je šest připravených českých hlasů — Eva, Marek, Bára, Viktor, Lucie a Filip. První výstup tak vznikne bez jediné vlastní nahrávky.

Záložka Klonování hlasu — vlevo referenční nahrávka a její přepis, vpravo text k namluvení s volbou emocí

Emoce jako tlačítka, ne jako syntaxe

Přednes se v Higgs Audiu řídí značkami vloženými přímo do textu, například <|emotion:elation|> nebo <|style:whispering|>. Držet si je v hlavě je zbytečná zátěž, proto jsou v rozhraní dostupné jako tlačítka: 21 emocí od nadšení po bezmoc, tempo, výška hlasu, délka pauz, styl (zpěv, křik, šepot) a zvukové efekty jako smích, pláč nebo povzdech. Kliknutí vloží značku na pozici kurzoru.

Nejvíc času ale ušetří tlačítko Režisér. Vygeneruje stejnou větu ve čtyřech emocích současně a ty si vybereš. Poslechnout si čtyři varianty vedle sebe je spolehlivější než dopředu odhadovat, jestli má věta znít odhodlaně, nebo hrdě.

Čeština jako výchozí stav

Tohle byl hlavní důvod, proč rozhraní vzniklo. Modely trénované převážně na angličtině selhávají u věcí, které působí banálně: datumy, číslovky, měny a zkratky. Zápis „12. 3. 2026“ má zaznít jako „dvanáctého března dva tisíce dvacet šest“.

Aplikace proto text před generováním normalizuje do podoby, v jaké se skutečně vyslovuje, a nabízí Náhled výslovnosti — před spuštěním vidíš přesně to, co model dostane. Doplňuje ho vlastní slovníček výslovnosti pro jména a odborné termíny, které by model jinak komolil. U technických textů a cizích příjmení je to rozdíl mezi použitelným a nepoužitelným výstupem.

Instalace

Cílem bylo, aby se nikdo nemusel zabývat virtuálními prostředími a verzemi knihoven. Postup má tři kroky:

  1. Nainstaluj Python 3.13 a při instalaci zaškrtni přidání do PATH.
  2. Stáhni repozitář (Code → Download ZIP nebo git clone).
  3. Spusť Nainstalovat-Higgs.bat.

Instalátor ověří grafickou kartu, doinstaluje závislosti (přibližně 3 GB), stáhne model (9 GB) a sestaví přednastavené hlasy. Podle rychlosti připojení to trvá 10 až 40 minut. Následuje Spustit-Higgs-Studio.bat, otevře se prohlížeč na adrese 127.0.0.1:7860 a zhruba po půl minutě se objeví stav „Model připraven“. Model není nijak podmíněný, takže nepotřebuješ účet ani přístupový token.

Nároky a známá omezení

Rozhraní potřebuje grafickou kartu NVIDIA s 12 GB VRAM. Vývoj probíhal na RTX 4060 Ti se 16 GB, kde model zabírá zhruba 8,6 GB a Whisper dalších 1,6 GB. Při nedostatku paměti spouštěč standardně zapíná kvantizaci na int8 a nároky klesnou přibližně na 5,3 GB. Na disku počítej s 11 GB. Provoz na procesoru je technicky možný, ale generování jedné věty trvá minuty, takže nemá praktický smysl.

Tři situace, které v praxi působí nejvíc potíží:

  • Verze knihovny transformers musí ležet v rozmezí 5.3 až 5.5. Novější ani starší model nenačte. Pokud se aplikace rozbije po aktualizaci, kontroluj tohle jako první: pip install "transformers>=5.3,<5.6".
  • Export do MP3 a OGG vyžaduje FFmpeg v PATH. Formát WAV funguje vždy, bez FFmpegu tedy o výstup nepřijdeš, jen bude objemnější.
  • Záložka Rozhovor je bez běžící Ollamy neaktivní. Stačí menší model, například ollama pull gemma3:4b.

Generování běží rychlostí kolem 24 tokenů za sekundu — na lokální provoz dostatečně, ale nikoli okamžitě. Výchozí teplota 0,8 vyhovuje většině textů; hodnota 0,6 přednes stabilizuje, rozmezí 1,0 až 1,1 ho naopak zvýrazní.

Licence ve dvou vrstvách

Tahle část se často zjednodušuje, a to je chyba. Kód aplikace je pod licencí MIT a nakládat s ním můžeš volně. Váhy modelu ale spadají pod výzkumnou a nekomerční licenci Boson AI, což jsou dvě různé věci.

Prakticky to znamená, že model nesmíš provozovat jako API nebo SaaS, vestavět do cizího produktu, přeprodávat jeho váhy ani na nich trénovat vlastní modely. Takzvaný Creator Use Grant naopak výslovně umožňuje zpeněžit vygenerovaný zvuk — v podcastu, na YouTube i na sociálních sítích — pokud uvedeš, že audio vzniklo s Higgs Audio od Boson AI. Pro tvůrce obsahu je to ta podstatná věta.

Odpovědnost při klonování hlasu

Hlas je biometrický údaj a zároveň osobnostní právo chráněné občanským zákoníkem. Klonování cizího hlasu bez souhlasu je nepřípustné a od srpna 2026 platí podle AI Actu povinnost syntetický zvuk označovat. Naklonované hlasy zůstávají uložené výhradně na tvém disku a nikam se neodesílají — odpovědnost za to, čí hlas do aplikace vložíš, ale nese uživatel.

Pokud si chceš jen ověřit, jak čeština z Higgs Audia zní, začni přednastavenými hlasy a tlačítkem Režisér — během pár minut budeš vědět, jestli má smysl ladit dál. Na české titulky ke stejnému videu pak slouží samostatný nástroj.

Odkaz na repozitář: github.com/Promptlab37/higgs-audio-studio-webui (kód MIT, zdarma)

← Zpět na tutoriály