Grammarly, tedy asi nejznámější jazyková pomůcka pro psaní, dnes češtinu podporuje. Zní to skvěle, dokud si člověk nepřečte, co přesně to znamená. Červené podtržení, tedy pravopis a základní gramatika, funguje ve všech dvaceti a více jazycích včetně češtiny. Modré podtržení, což je celá ta zajímavá část se stylem, plynulostí a tónem, běží jen v šesti jazycích. Angličtina, španělština, francouzština, němčina, portugalština, italština. Čeština mezi nimi není. Tenhle rozdíl vystihuje celý stav AI korektury češtiny docela přesně. Nástroje umí víc než před dvěma lety a u některých typů chyb ušetří opravdu hodně času. Zároveň se u češtiny chovají jinak než u angličtiny, a kdo to neví, snadno pustí ven text, který vypadá opraveně a přitom obsahuje nové chyby.
Co AI u češtiny opravdu spolehlivě opraví
Nejlíp fungují velké jazykové modely, tedy ChatGPT, Claude nebo Gemini, ne specializované korektory. Model si totiž přečte celý text a rozumí kontextu, takže pozná i chyby, které nejde odhalit slovníkem.
Bez váhání jim svěřte překlepy, přehozená písmena a chybějící diakritiku. Vrácení háčků a čárek do textu psaného bez diakritiky zvládají překvapivě dobře, včetně případů, kde o významu rozhoduje okolní věta. Slovo „nemel“ si podle kontextu správně přeloží jako „neměl“ i jako „nemel“ ve smyslu mletí.
Spolehlivě fungují i tyhle věci:
- Opakování slov. Model najde, že jste v jednom odstavci třikrát napsali „proto“, a nabídne varianty.
- Nesmyslně dlouhá souvětí. Rozdělení věty na dvě je úloha, kde AI téměř nechybuje.
- Nekonzistence. Když v textu jednou píšete „e-mail“ a jindy „email“, model to najde a sjednotí.
- Zbytečná vata. Fráze typu „za účelem zajištění“ přepíše na „aby zajistil“ bez ztráty smyslu.
- Změna tónu. Přepsání úředně znějícího odstavce do civilní češtiny patří k tomu nejlepšímu, co dnes AI s textem umí.
Zůstaňme ale u reality. Tohle všechno jsou úpravy, kde se chyba pozná okamžitě při přečtení. Problém začíná u těch, které se nepoznají.
Kde čeština láme i dobré modely
Shoda přísudku s podmětem. Klasická past. Když stojí podmět daleko od přísudku nebo se skládá z několika částí, model občas zvolí špatnou koncovku. Věta „Kolegové a kolegyně z pobočky, kteří se přihlásili v prvním kole, dostali informace“ je správně, protože mužský rod životný má přednost. Model ale někdy dopíše „dostaly“ podle nejbližšího slova. Vyskočí to hlavně u vícenásobných podmětů a u vět, kde je mezi podmětem a slovesem vsuvka.
Čárka před spojkou „a“. V češtině se před slučovacím „a“ čárka nepíše, ale píše se před „a proto“, „a tak“, „a to“, „a přesto“. Modely trénované převážně na angličtině mají tendenci čárku před „a“ přidávat i tam, kam nepatří. Druhá strana téže mince: často zapomenou uzavřít vloženou vedlejší větu druhou čárkou. Napíšou „Kolega, který přišel včas dostal místo“ a čárku za slovem „včas“ prostě vynechají.
Typografie po anglicku. Tady AI kazí text nejčastěji, a to i když jinak opravila správně. Vrátí vám anglické uvozovky „takhle“ místo českých „takhle“, sáhne po dlouhé anglické pomlčce (em dash) a napíše „50%“ tam, kde má být „50 %“. Ta mezera má význam: podle Internetové jazykové příručky Ústavu pro jazyk český se značka od číselné hodnoty odděluje mezerou, takže „14 %“ znamená čtrnáct procent, zatímco „20%“ se čte jako dvacetiprocentní. Když AI mezeru smaže, změní tím význam.
Odborná terminologie. Model nemá důvod vědět, že ve vašem oboru se používá zrovna „pojistná událost“ a ne „pojistný případ“. V dobré víře vám termín „vylepší“ na běžnější synonymum a text tím fakticky rozbije. Právnická, lékařská a technická čeština na tom tratí nejvíc.
Velká písmena u názvů. Psaní velkých písmen patří v češtině k nejsložitějším oblastem pravopisu a modely ho zvládají nerovnoměrně. Rozdíl mezi „Ministerstvem financí“ jako konkrétní institucí a „ministerstvem“ jako obecným označením model často setře. Podobně kolísá u názvů ulic, svátků a firem. Pokud v textu figurují úřady nebo obchodní jména, projděte je zvlášť.
Fakta uvnitř věty. Nejnebezpečnější kategorie. Při přepisování stylu se občas mimochodem změní číslo, datum nebo jméno. Model to nedělá schválně, jen generuje pravděpodobné pokračování věty a „2018“ je pravděpodobnější než „2013“. Chyba je tichá, nikde se neoznačí a v uhlazeném odstavci ji přehlédnete.
Proč se AI chová jinak než korektor
Lidský korektor pracuje s pravidlem. Ví, že před „a to“ se píše čárka, a použije to. Jazykový model žádné pravidlo neaplikuje, jen odhaduje, jaké písmeno nebo slovo v daném místě nejspíš následuje, na základě obrovského množství textu, který viděl při trénování.
To vysvětluje jeho chování docela přesně. Kde je vzor v textech častý a jednoznačný, model ho trefí skoro vždycky. Kde je pravidlo výjimečné nebo závisí na významu, který z okolí věty nejde odvodit, model si tipne. A tipne si přesvědčivě, protože nic jiného neumí. Proto zní chybná oprava stejně sebejistě jako správná.
Českých textů navíc bylo v trénovacích datech řádově méně než anglických, odtud pramení část chyb v typografii i sklon k obratům, které v češtině znějí přeloženě.
Prompty, které u české korektury fungují
Rozdíl mezi „oprav mi ten text“ a dobře napsaným zadáním je obrovský, základní zadání model chápe jako pozvánku k přepsání celého textu podle jeho vkusu. Vrátí vám něco hladkého, obecného a ne úplně vašeho. Zkuste místo toho tohle:
„Jsi český korektor. V následujícím textu oprav pravopis, gramatiku a interpunkci. Neměň slovosled, styl ani slovní zásobu. Nepřepisuj věty. Zachovej všechna čísla, jména a odborné termíny přesně tak, jak jsou. Na konci vypiš seznam provedených oprav s krátkým zdůvodněním.“
Ta poslední věta je nejcennější. Když si model musí opravy vypsat, sami uvidíte, co změnil, a odchytíte přepsané číslo dřív, než ho zveřejníte. Zároveň se občas dozvíte pravidlo, které jste neznali.
Na stylistiku použijte samostatné zadání, v druhém kole:
„Následující text projdi stylisticky. Označ místa, která jsou kostrbatá, dvojznačná nebo zbytečně dlouhá, a u každého navrhni jinou formulaci. Text sám nepřepisuj, jen navrhuj. Piš běžnou češtinou bez úřednických obratů.“
Když potřebujete text zkrátit, řekněte to číslem a s omezením: „Zkrať tenhle text zhruba o třetinu. Vyhoď opakování a vatu, ale zachovej všechny konkrétní údaje, čísla a jména.“
A u textu, kde jde o formu, přidejte typografickou instrukci: „Používej české uvozovky, tedy dolní na začátku a horní na konci. Nepoužívej dlouhou pomlčku. Mezi číslo a značku procenta piš mezeru.“
Praktický rozdíl uvidíte hned na první větě. Zadání „oprav text“ u věty „Podle nové smlouvy, kterou jsme podepsali v květnu 2023, se sazba zvyšuje o 15%“ vrátí často přepsanou a vyhlazenou verzi, ve které se mimochodem změní rok. Zadání s výslovným zákazem měnit čísla a s požadavkem na seznam oprav vrátí jedinou změnu: mezeru před značkou procenta. To je přesně ta oprava, kterou jste chtěli.
Jak korekturu poskládat, aby dávala smysl
Nejčastější chyba je hodit do modelu celý dokument najednou a doufat.
Rozdělte si práci na kola. V prvním nechte opravit jen pravopis a interpunkci, s výslovným zákazem přepisovat věty. Ve druhém požádejte o stylistické návrhy, které ale sami vyberete a zapracujete ručně. Ve třetím si nechte text jenom přečíst a zeptejte se, jestli je někde nejasný nebo dvojznačný, bez jakýchkoli oprav.
Delší text dělte po kapitolách nebo po tisíci slovech, modely na dlouhém dokumentu ztrácejí konzistenci a od poloviny začnou opravovat jinak než na začátku.
Výsledek vždycky porovnejte s originálem. Ve Wordu k tomu slouží funkce Porovnat dokumenty, v Google Dokumentech historie verzí, programátoři použijí libovolný nástroj na zobrazení rozdílů. Čtení opraveného textu bez srovnání s původním je přesně ten způsob, jak tichou změnu čísla přehlédnout. Na češtinu se hodí i dvě specializované pomůcky. DeepL Write češtinu podporuje a chová se konzervativněji než chatbot, takže méně improvizuje. Korektor z Ústavu formální a aplikované lingvistiky Matematicko-fyzikální fakulty Univerzity Karlovy je statistický kontrolor pravopisu vyvinutý přímo pro češtinu, k dispozici zdarma pro nekomerční použití. Není chytrý jako jazykový model, zato nikdy nepřepíše obsah. Jako druhé síto po AI korektuře poslouží dobře.
Na co si dát pozor
U právních a úředních textů nespoléhejte na AI bez lidské kontroly. Smlouva, podání k soudu, odvolání, žádost na úřad nebo reklamace jsou dokumenty, kde jedno přepsané číslo nebo změněný termín mění právní důsledky. Nechat si takový text projít je v pořádku, publikovat ho bez přečtení člověkem není. Totéž platí pro zdravotnickou dokumentaci a pro technické texty, kde na formulaci závisí bezpečnost.
Pozor si dejte i na to, co do korektury vkládáte. Text s osobními údaji klientů, s obchodním tajemstvím nebo s neveřejnými čísly odchází při použití běžného chatbota na cizí server. Podmínky konkrétní služby k tomu, jestli váš text používá k dalšímu trénování, si přečtěte dřív, než tam nahrajete personální podklady. A poslední věc, kterou lidé podceňují: AI má sklon opravovat i to, co je správně. Když jí předložíte text psaný záměrně hovorově nebo s autorskou stylizací, srovná ho do neutrální podoby a vy přijdete o to, čím se text lišil. U vlastního psaní je proto lepší používat korekturu jako návrh, ne jako výsledek. Přijmout opravu, kterou nechápete, se nevyplácí.
Co si nechat na sebe
Rozdělení práce, které se osvědčuje, vypadá jednoduše. Stroji patří mechanické chyby: překlepy, chybějící diakritika, opakovaná slova, zapomenuté mezery. Sobě si nechte věcnou správnost, terminologii oboru a rozhodnutí, jak má text znít.
Ověřte si to na jediném pokusu. Vezměte text, který jste napsali před půl rokem a znáte ho. Pusťte ho do korektury s prvním promptem z tohoto článku, nechte si vypsat seznam oprav a projděte ho položku po položce. Zjistíte dvě věci naráz: kolik chyb jste v textu skutečně měli a kolik jich vám model přidal.
To druhé číslo bývá menší, než se čeká, ale skoro nikdy to není nula. Právě proto se korektura pořád vyplatí dělat ve dvou. Jeden z těch dvou jen nemusí být člověk.