Naklonoval jsem si vlastní hlas a přehrál výsledek mámě. Nepoznala to. Zavolal jsem jí přes reproduktor a nechal svou kopii přečíst dvě věty o tom, že mi ujel vlak. Zeptala se, jestli jsem si vzal bundu.

Trvalo mi to devadesát vteřin nahrávání a asi tři minuty čekání, přesně v tu chvíli mi došlo, proč se u téhle techniky mluví o etice dřív než o funkcích.

ElevenLabs je dnes v syntéze řeči nejviditelnější jméno a klonování hlasu zpřístupnil komukoliv s prohlížečem, s tou dostupností přišly i hranice, které se obejít nedají. Cizí hlas tam naklonovat nejde ani tehdy, když vám k tomu ten člověk dá souhlas.

Co se pod kapotou vlastně přepíná

Staré čtečky textu skládaly věty z předem nahraných slabik a poznali jste je na první poslech. Dnešní modely se učí převádět text rovnou na zvukovou vlnu i s tempem, melodií věty a pauzami.

ElevenLabs nabízí několik modelů a rozdíly mezi nimi jsou praktické, ne marketingové.

Eleven v3 je nejvýraznější a nejexpresivnější. Podporuje přes sedmdesát jazyků včetně češtiny. Hodí se na vyprávění, audioknihu, dabing, tedy všude, kde chcete, aby hlas hrál.

Eleven Multilingual v2 zvládá devětadvacet jazyků, čeština je mezi nimi. Je vyrovnaný a předvídatelný, takže se pořád používá tam, kde potřebujete stabilní výsledek napříč delším textem.

Eleven Flash v2.5 je rychlý model s dvaatřiceti jazyky. Vyplatí se, když jde o odezvu v reálném čase, třeba u hlasového asistenta. Za rychlost platíte menší výrazovou pestrostí.

Starší Eleven Flash v2 a řadu Turbo už dokumentace označuje za zastaralé a doporučuje přechod na Flash. Označení modelů se u ElevenLabs mění rychle, takže to, co uvidíte v rozhraní, se od tohoto textu může za pár měsíců lišit.

Kolik toho dostanete zdarma a kde je zeď

Bezplatný účet má 10 000 kreditů měsíčně. Kolik z nich vyrobíte zvuku, se liší podle zvoleného modelu, řádově jde o minuty, ne o hodiny. Nevyčerpané kredity se do dalšího měsíce nepřenášejí. Zeď přichází dřív, než dojdou kredity.

Bezplatný tarif nemá komerční licenci. Podmínky užití rozdělují uživatele na bezplatné, kteří smějí služby používat jen nekomerčně, a platící, kteří je smějí použít i komerčně. U obsahu zveřejněného z bezplatného účtu navíc služba vyžaduje uvést ElevenLabs jako zdroj.

Placené tarify k srpnu 2026 vypadají takto. Starter za 6 dolarů měsíčně dává 30 000 kreditů a odemyká dvě věci, kvůli kterým na něj většina lidí přechází: komerční licenci a okamžité klonování hlasu. Creator za 22 dolarů měsíčně má 121 000 kreditů a přidává profesionální klonování, pro za 99 dolarů měsíčně nabízí 600 000 kreditů a kvalitnější výstup pro API. Rozdíl mezi bezplatným účtem a Starterem se tedy neměří kredity. Rozhoduje, jestli smíte výsledek vůbec použít pro práci. Za šest dolarů měsíčně se ta hranice překračuje snadno, takže kdo s hlasem cokoliv vydělává, měl by přejít hned.

První namluvený text za dvě minuty

Postup je jednodušší, než většina lidí čeká.

  1. Založte účet a otevřete převod textu na řeč. Instalovat nic nemusíte, všechno běží v prohlížeči.
  2. Vyberte hlas z knihovny. U každého hlasu je náhled. Poslechněte si aspoň pět kandidátů, rozdíly jsou větší, než napovídají popisky.
  3. Zvolte model. Na vyprávění sáhněte po v3, na dlouhý souvislý text po Multilingual v2.
  4. Vložte text a poslechněte si výsledek. Nezačínejte celou kapitolou. Jeden odstavec vám řekne dost.
  5. Dolaďte interpunkci, ne nastavení. Tečka, čárka a odstavec řídí pauzy víc než jakýkoliv posuvník. Krátké věty zní přirozeněji.
  6. Stáhněte zvuk. Pokud vznikl na bezplatném účtu, patří k němu uvedení zdroje.

Nejčastější chyba je nacpat do pole tři normostrany a divit se, že hlas v půlce ztratí tempo. Model pracuje po částech a delší text je potřeba rozdělit, zkontrolovat a případně po úsecích přegenerovat.

Zadání pro hlas se navíc dá psát podobně jako zadání pro chatbota. Holé „přečti tuhle větu“ model splní doslovně a ploše. Popis situace mu dá vodítko, kam s tónem: klidný zpravodajský přednes s mírným důrazem na konci věty zní jinak než rozjívený komentář k videu. U delších textů si vyplatí zvolit jeden režim a držet ho, protože změna tónu uprostřed kapitoly je slyšet jako střih.

Čeština funguje, ale poslech si odpustit nemůžete

Čeština je v dokumentaci uvedená u v3, u Multilingual v2 i u Flash v2.5, takže nemusíte hledat žádnou objížďku. Kvalita je slušná a u krátkých úseků často nerozpoznatelná od skutečné nahrávky.

Problémy začínají u detailů. Většina hlasů v knihovně vznikla z anglických nahrávek, takže si s sebou nesou lehký přízvuk. U některých je to nepatrné, u jiných to zní jako Čech po deseti letech v Londýně.

Několik zásahů do textu pomáhá skoro vždy. Čísla pište slovy, protože „1. 9. 2026“ model přečte, jak ho napadne. Zkratky rozepisujte, „ČSSZ“ dopadne líp jako „Č S S Z“ s mezerami nebo rovnou celým názvem. Cizí jména napište foneticky, tedy tak, jak se čtou. A tam, kde má hlas nadechnout, dejte odstavec.

Diakritika je povinná. Text bez háčků a čárek model přečte jako jinou řeč a výsledek zní jako parodie na slovenštinu.

U delších českých textů si nechte rezervu na kontrolu. Počítám zhruba s tím, že na deset minut hotového zvuku padne dvacet minut poslechu a oprav. Kdo tenhle čas nezapočítá, nestihne termín.

Klonování vlastního hlasu krok za krokem

ElevenLabs rozlišuje dva druhy klonování a rozdíl mezi nimi rozhoduje o tom, co si smíte dovolit.

Okamžité klonování (Instant Voice Cloning) si vystačí s krátkou nahrávkou. Dokumentace doporučuje nahrát alespoň minutu zvuku, ideálně jednu až dvě minuty. Nad tři minuty už podle ní přínos prakticky mizí. Nahrávka musí být čistá, bez dozvuku místnosti, bez šumu a bez hudby na pozadí. Kvalita záznamu rozhoduje víc než jeho délka.

Praktický postup vypadá takhle:

  1. Najděte si tichou místnost s textilem. Ložnice s postelí a závěsy je lepší než kancelář s holými stěnami.
  2. Nahrajte jednu až dvě minuty souvislého mluvení stejným tempem a stejnou barvou. Čtěte text, který vás nebude nutit měnit náladu uprostřed.
  3. Poslechněte si nahrávku ve sluchátkách a bez milosti smažte části s mlasknutím, nádechem do mikrofonu nebo zvukem z ulice.
  4. Nahrajte soubor do klonovacího nástroje a před uložením potvrďte souhlas s tím, že na klonování daného hlasu máte právo. Bez toho potvrzení proces neproběhne.
  5. Otestujte klon na větě, kterou jste nikdy nenahrávali. Tam poznáte, jestli sedí.

Profesionální klonování (Professional Voice Cloning) pracuje s mnohem delším materiálem a dává věrnější výsledek. Je dostupné od tarifu Creator a každý takový klon prochází ověřením.

Špatný klon poznáte podle dvou věcí. Zní jako vy, ale mluví v jednom tempu a bez nádechů, takže po půl minutě začne posluchače unavovat. Nebo si přinese zvuk místnosti, ve které vznikl originál, a každá věta má za sebou slabou ozvěnu. Obojí vzniklo už při nahrávání, přegenerování to nespraví. Vrátit se k mikrofonu a natočit minutu znovu je rychlejší než hodina zkoušení. Můj první klon spadl přesně do druhé kategorie. Nahrával jsem v kuchyni, kde se zvuk odráží od dlaždic, a výsledek zněl, jako bych mluvil z koupelny. Druhý pokus v ložnici s postelí a závěsy sedl napoprvé.

Cizí hlas naklonovat nemůžete, ani kdyby souhlasil

Tady je věta, kterou by si měl přečíst každý, kdo se chystá „naklonovat kolegu, protože nemá čas namlouvat“. Profesionální klon jde vytvořit pouze z vlastního hlasu. Dokumentace ElevenLabs to formuluje bez prostoru pro výklad: klon cizího hlasu nevytvoříte ani tehdy, když vám ten člověk dá souhlas. Každý klon prochází ověřovacím procesem, který má potvrdit, že hlas patří vám.

Existuje jediná legální cesta, jak pracovat s hlasem někoho jiného, ten člověk si klon vytvoří a ověří sám ve svém účtu a pak vám k němu dá přístup přes soukromý odkaz. Kontrolu nad svým hlasem má tedy pořád on. U okamžitého klonování systém spoléhá na vaše potvrzení. To ale nic nemění na tom, co potvrzujete: prohlašujete, že máte právo a souhlas daný hlas klonovat. Falešné odškrtnutí je porušení podmínek služby a v řadě situací i právní problém sám o sobě.

Návod, jak někoho napodobit, tady tedy nenajdete. Tenhle text končí u vašeho vlastního hlasu.

Proč se u hlasu mluví o etice dřív než o funkcích

Kopie hlasu patří dnes k nejúčinnějším nástrojům, jaké podvodníci mají. Americká Federální obchodní komise před tímhle typem podvodu varuje od března 2023: útočník si z krátkého veřejně dostupného záznamu vyrobí kopii hlasu příbuzného a zavolá s tím, že je v nouzi a potřebuje okamžitě poslat peníze. Český Národní úřad pro kybernetickou a informační bezpečnost vydal 19. února 2025 upozornění na podvodné telefonáty, které kombinují vishing, tedy podvodné volání, se spoofingem, tedy podvržením telefonního čísla. Doporučení je stručné: nejednat pod tlakem emocí, nikdy neposílat peníze na základě telefonátu ve spěchu a při jakékoliv pochybnosti zavěsit a zavolat zpět na číslo, které znáte.

Doma to jde ošetřit ještě jednodušeji. Domluvte si v rodině kontrolní otázku nebo slovo, které v žádné veřejné nahrávce nezaznělo. Hlasová kopie ho nevymyslí. Evropská pravidla už platí. Nařízení AI Act ukládá v článku 50 poskytovatelům systémů, které generují syntetický zvuk, obraz, video nebo text, povinnost označit výstup strojově čitelným způsobem tak, aby šel rozpoznat jako uměle vytvořený. Tahle část nařízení se používá od 2. srpna 2026.

A pak je tu rovina, na kterou se v recenzích nástrojů zapomíná. Za každým hlasem, který nahradíte generovaným, stojí někdo, kdo tím živil rodinu. Dabéři a hlasoví herci o podmínkách používání svých hlasů k trénování modelů vyjednávají už několik let. Firma, která nasadí umělý hlas tam, kde dřív pracoval člověk, tenhle dopad nese, ať si to přizná, nebo ne.

Na co si dát pozor

Nahrávka, kterou pošlete ke klonování, odchází na cizí server. Než tam nahrajete hlas svého dítěte nebo rodiče, zvažte, jestli vám ta hračka za to stojí.

Bezplatný účet neposlouží k ničemu, co vydělává. Video s reklamou, podcast se sponzorem ani klientská zakázka na něj nepatří. Hlasy z knihovny se dají použít napříč projekty, ale zní i ve spoustě cizích videí. Kdo staví značku na zvuku, měl by počítat s tím, že jeho hlas patří i konkurenci.

A poslední, prozaická věc. Vygenerovaný zvuk si zkontrolujte celý, ne jen začátek. Model umí v poslední čtvrtině dlouhé nahrávky změnit tempo nebo spolknout slovo, a právě to si posluchač zapamatuje.

Kdy se to vyplatí a kdy raději k mikrofonu

Generovaný hlas dává smysl u textů, které se často mění: firemní školení, návody, popisky produktů, verze v cizím jazyce. Přepsat větu a nechat ji přemluvit trvá minutu, kdežto svolat dabéra do studia kvůli jedné opravené větě je nesmysl.

Nedává smysl tam, kde je hlas součástí sdělení. Rozhovor, osobní podcast, vzkaz od zakladatele firmy. Posluchač nepozná, čím to je, ale pozná, že něco nesedí.

Můj klon nakonec skončil na jediné praktické práci: čte mi vlastní články nahlas, abych v nich slyšel kostrbaté věty. Je to nudné použití drahé technologie a přesně proto mi vyhovuje. Máma mezitím ví, že když volám kvůli penězům, ptá se na jméno psa, kterého jsme měli v roce 1998.