Když na většině stanic Hasičského záchranného sboru zazní vyhlášení poplachu, mluví strojový hlas. Českou syntézu řeči tam dodává plzeňská firma SpeechTech a funguje to tak už léta, dávno před tím, než se o umělé inteligenci začalo mluvit v hospodách. Strojové čtení textu je totiž jedna z nejstarších praktických disciplín téhle oblasti. Za poslední tři roky se ale posunula natolik, že rozdíl mezi nahraným a vygenerovaným hlasem poznáte u krátkého textu jen stěží. A u češtiny to platí taky, i když s výhradami, o kterých se v zahraničních recenzích nedočtete.

Jak se z písmen stane hlas

Starší čtečky skládaly věty z předem nahraných kousků slov. Slyšeli jste to okamžitě: rovné tempo, důraz na špatné slabice a švy mezi slabikami.

Dnešní modely pracují jinak. Naučí se z tisíců hodin nahrané řeči, jak zní celá věta včetně melodie, pauz a nádechu, a zvuk pak vytvoří naráz, ne po dílcích. Rozdíl je podobný jako mezi textem vysázeným z hotových razítek a textem napsaným rukou, kde každé písmeno navazuje na předchozí.

Pro češtinu z toho plyne jedna dobrá zpráva a jedna horší. Dobrá: modely zvládají české přízvučné schéma, tedy důraz na první slabice slova, protože se ho naučily z reálné řeči a neodvozují ho z pravidel. Horší: čeština je pro poskytovatele malý trh, takže hlasů je málo a trénovacích dat řádově méně než u angličtiny.

Kde česká výslovnost pořád drhne

Vyzkoušejte jakýkoli nástroj na téhle větě: „Faktura č. 15/2026 je splatná 3. 5. 2026 a zní na 1 250 Kč.“ Většina modelů na ní zakopne. Číslo faktury přečte jako „patnáct lomeno dva tisíce dvacet šest“, datum jako základní číslovky („tři pět“) místo „třetího pátý“ a zkratku Kč připojí v základním tvaru bez ohledu na to, jaký pád si věta žádá. Skloňování číslovek je vůbec největší slabina české syntézy. Model musí odhadnout pád z okolního textu, což u angličtiny nikoho netrápí, protože tam se číslovky neskloňují. Věta „bez 1 250 Kč se neobejdeme“ má správně znít „bez tisíce dvou set padesáti korun“, a přesně na téhle konstrukci strojové čtení sedne na zadek.

Druhá zrádná oblast jsou zkratky a cizí jména. Zkratku „s. r. o.“ jeden hlas přečte po písmenech, druhý se z ní pokusí udělat slovo. Francouzské nebo maďarské příjmení v českém textu obvykle dopadne špatně bez ohledu na cenu tarifu.

Třetí je intonace u dlouhých souvětí. U dvou vět po sobě zní výsledek přesvědčivě, u odstavce s vloženými vsuvkami začne hlas ztrácet melodii a čte monotónně, jako by mu docházel dech.

Nástroje, které umí česky

ElevenLabs má podle mého u češtiny dnes nejlepší poměr kvality a ceny. Češtinu podporují modely Eleven v3 (přes 70 jazyků), Multilingual v2 (29 jazyků) a rychlý Flash v2.5 (32 jazyků). Bezplatný tarif dává 10 tisíc kreditů měsíčně, placené začínají na 6 dolarech (Starter), Creator stojí 22 a Pro 99 dolarů měsíčně. Ověřeno v srpnu 2026.

Google Cloud Text-to-Speech nabízí pro češtinu překvapivě širokou paletu. Vedle jednoho staršího standardního a jednoho WaveNet hlasu je tu třicet hlasů z novější řady Chirp 3 HD, které znějí výrazně živěji. Účtuje se podle počtu znaků, aktuální sazby najdete v oficiálním ceníku.

Microsoft Azure Speech má pro češtinu dva neurální hlasy, ženský cs-CZ-VlastaNeural a mužský cs-CZ-AntoninNeural. Je jich málo, ale jsou stabilní a Azure je bere jako produkční službu s odpovídající podporou. Českou syntézu od Microsoftu si přitom můžete poslechnout zdarma, stačí zapnout funkci Číst nahlas v prohlížeči Edge.

OpenAI nabízí čtení textu přes API. Model tts-1 stojí 15 dolarů za milion znaků, kvalitnější tts-1-hd 30 dolarů za milion znaků (ověřeno v srpnu 2026). Česky mluví, ale s mírným cizím přízvukem, protože hlasy jsou trénované primárně na angličtině. Pro interní použití to nevadí, pro veřejnou audioverzi článku bych sáhl jinam.

Speechify je jiná kategorie. Míří na lidi, kteří chtějí poslouchat, ne vyrábět zvuk pro ostatní: přečte vám e-mail, PDF, článek nebo skripta a umí zrychlit až na pětinásobek. Tarif Premium stojí 29 dolarů měsíčně a zpřístupní více než tisíc hlasů v šedesáti jazycích včetně češtiny. Bezplatná verze má jen deset hlasů, které znějí roboticky.

SpeechTech z Plzně jde starší cestou. Prodává české hlasy jako software s jednorázovou licencí, jeden hlas vyjde na 2 500 Kč. Zní méně efektně než neurální modely, zato běží lokálně, bez internetu a bez měsíčního poplatku. Pro průmyslové hlášení nebo informační systém, který musí fungovat i při výpadku sítě, to dává smysl.

Kdy smíte hlas použít komerčně

Tohle je nejčastěji přehlížený bod a taky ten, který umí nejvíc bolet. U ElevenLabs bezplatný tarif komerční licenci neobsahuje. Podmínky služby říkají u bezplatných uživatelů výslovně, že smí služby používat jen k nekomerčním účelům. Komerční užití, tedy monetizované video, práce pro klienta nebo reklama, začíná až tarifem Starter za 6 dolarů měsíčně, kde je komerční licence uvedená přímo mezi funkcemi tarifu. Rozdíl mezi „vyzkoušel jsem si to“ a „pustil jsem to do kampaně“ je tedy šest dolarů, a ty se vyplatí zaplatit.

U Google Cloud a Azure se komerční užití řídí smluvními podmínkami dané cloudové služby a u běžného generování hlasu z předpřipravených hlasů obvykle problém nepředstavuje. U SpeechTechu kupujete licenci k hlasu rovnou, takže víte, co máte. Zvlášť opatrně přistupujte k použití cizího hlasu. Namluvení textu hlasem konkrétního člověka, ať už kolegy nebo známé osobnosti, spadá do klonování hlasu, kde platí jiná pravidla a je potřeba výslovný souhlas dotyčného. To je téma na samostatný text.

Jak to prakticky udělat

Postup, který funguje u audioverze článku i u firemního školení:

  1. Text připravte pro ucho, ne pro oko. Rozepište zkratky, čísla vypište slovy tam, kde na tvaru záleží („tři sta padesát korun“ místo „350 Kč“), a vyhoďte odkazy, závorky a poznámky pod čarou.
  2. Rozdělte text na kratší úseky. Odstavec po odstavci vyjde líp než jeden dlouhý blok. Modely na dlouhém textu ztrácejí tempo a chyba v jedné větě vám nezkazí celý soubor.
  3. Vyberte hlas podle obsahu, ne podle toho, který zní nejhezčeji. Návod chce klidný a pomalejší hlas, reklamní spot rychlejší. U většiny nástrojů si můžete nastavit tempo a míru výraznosti.
  4. Poslechněte si celý výsledek. Ne kus, celý. Právě uprostřed delších pasáží se objevují ta místa, kde model přečte datum nebo jméno špatně.
  5. Chybu opravte v textu, ne v nastavení. Když hlas přečte „SEO“ po písmenech a vy to nechcete, napište do textu „es í ou“. Zní to hloupě, funguje to spolehlivě.

Užitečná pomůcka u zkoušení: nechte si stejný odstavec přečíst dvěma nebo třemi různými hlasy a poslechněte si je za sebou. Rozdíly, kterých si u jednoho hlasu nevšimnete, vyskočí okamžitě, jakmile máte srovnání.

Na co si dát pozor

Generovaný hlas se hodí označit, nařízení EU o umělé inteligenci (AI Act) ukládá v článku 50 poskytovatelům systémů generujících syntetický zvuk povinnost označit výstup strojově čitelným způsobem a tahle část se používá od 2. srpna 2026. Jak přesně se to promítne do konkrétního nástroje, se liší, u komerčního nasazení se vyplatí ověřit aktuální stav přímo u poskytovatele. Nezávisle na povinnostech platí, že posluchač obvykle ocení, když se dozví, že poslouchá stroj. Delší poslech umělého hlasu unavuje víc než lidský. U hodinového školení to poznáte, u tříminutového shrnutí ne. Kdo plánuje audioknihu nebo dlouhý podcast, měl by si napřed poslechnout dvacet minut vcelku a teprve pak se rozhodnout.

A poslední věc, o které se moc nemluví: strojové čtení textu původně vzniklo jako pomůcka pro lidi se zrakovým postižením a s dyslexií. Když děláte audioverzi obsahu, myslete na to i technicky. Soubor ke stažení, rozumné tempo a možnost přeskočit po kapitolách pomůžou víc než honba za tím nejpřirozeněji znějícím hlasem.

Komu se to vyplatí a komu ne

Pravidelnému tvůrci obsahu se předplatné vrátí rychle. Stačí si spočítat, kolik by stálo studio a dabér u každé verze textu, a porovnat to s měsíčním tarifem. Firmě, která překopává interní školení pokaždé, když se změní směrnice, vychází výpočet ještě jednoznačněji, protože text stačí upravit a nechat přečíst znovu.

Nevyplatí se to člověku, který potřebuje namluvit jeden text ročně, a hlavně ne tam, kde je hlas součástí značky. U znělky pořadu nebo hlavní postavy ve hře posluchač rozdíl pozná a rozpozná i to, že jste ušetřili.

Pokud si chcete převod textu na řeč vyzkoušet hned a zadarmo, otevřete libovolný český článek v prohlížeči Edge a zapněte Číst nahlas. Za třicet vteřin budete vědět, jestli vám dnešní česká syntéza řeči stačí, nebo jestli má smysl řešit placené nástroje.