Firma, která postavila ChatGPT, se v lednu 2023 pokusila postavit i nástroj, který jeho výstupy pozná. Jmenoval se AI Text Classifier. Podle vlastních čísel OpenAI označil správně 26 procent textů psaných umělou inteligencí a naopak 9 procent lidských textů prohlásil za strojové.
Dvacátého července 2023 ho OpenAI vypnula s odůvodněním, že má nízkou přesnost.
Tenhle příběh je dobrý začátek proto, že o možnostech detekce řekne víc než jakýkoliv marketingový slib. Firma, která model postavila, znala jeho vnitřek nejlíp na světě, a přesto svůj vlastní detektor stáhla. Následující text shrnuje, co detekce AI obsahu dnes umí u textu, obrázků, videa a hlasu, kde se plete a jak s jejím výsledkem zacházet, aby z toho nevznikla škoda.
Co detektor dělá a co nedělá
Detektor AI obsahu počítá, jak moc se vstup podobá tomu, co obvykle vyrábějí generativní modely, a výsledek vydá jako číslo, ne jako rozbor významu nebo pravdivosti.
Z toho plynou dvě věci, které se pořád přehlížejí. Za prvé, výstup je pravděpodobnost, ne verdikt. „87 procent“ neznamená, že text z 87 procent napsala AI ani že je vinen na 87 procent. Znamená to, že podle jednoho konkrétního modelu vypadá vstup takhle podobně strojovému psaní. Za druhé, každý detektor někde nastavil práh, od kterého začne hlásit poplach. Kdo ten práh posune, změní poměr mezi přehlédnutými případy a falešně obviněnými. Neexistuje nastavení, které by odstranilo obojí. Podrobně princip a jeho slabiny rozebírá samostatný text o tom, jak detektory fungují.
Čísla, která stojí za připomenutí
Marketing detektorů pracuje s údaji typu „přesnost 99 procent“. Nezávislé testy vypadají jinak.
Mezinárodní tým vedený Deborou Weber-Wulff z HTW Berlin, do kterého patřili i Tomáš Foltýnek a Petr Šigut z Masarykovy univerzity, otestoval v roce 2023 čtrnáct nástrojů, dvanáct volně dostupných a dva komerční, včetně Turnitinu. Závěr studie zní, že dostupné detekční nástroje „nejsou ani přesné, ani spolehlivé“ a mají hlavní sklon označovat výstup za psaný člověkem, místo aby odhalily text od AI. Obcházecí techniky jejich výkon podle autorů výrazně zhoršují.
Podobně dopadla i další velká studie, kterou vedl Weixin Liang ze Stanfordu, s výraznými rozdíly podle toho, jestli autor testovaného textu psal svým rodným jazykem. Turnitin, nejpoužívanější nástroj ve školách, uvádí u vlastního detektoru chybovost kolem čtyř procent na úrovni jednotlivých vět. Kompletní čísla i to, proč se detektory pletou právě tímhle způsobem, rozebírá text o tom, jak AI detektory fungují.
Čtyři procenta zní nevinně. U práce o třiceti větách je to průměrně víc než jedna věta označená chybně.
Kdo detekci vlastně potřebuje
Otázka „jak spolehlivé jsou detektory“ nemá jednu odpověď, protože každý uživatel s výsledkem dělá něco jiného a nese jiné riziko.
Školy a univerzity. Nejcitlivější případ. V sázce je obvinění konkrétního člověka a chybný verdikt má následky, které se špatně napravují. Zároveň jde o prostředí s nejsilnějším tlakem detekci nasadit plošně. Tahle kombinace je nebezpečná a věnuje se jí předposlední část textu.
Redakce a vydavatelé. Tady jde hlavně o to, jestli text nabídnutý externím autorem prošel modelem, a o kvalitu. Editor má proti detektoru výhodu: může se autora zeptat, vyžádat si podklady a ověřit fakta. Detektor slouží jako první síto, ne jako rozhodčí.
E-shopy a hodnoticí portály. Hromadně generované recenze jsou dnes běžné a tady detekce dává největší smysl, protože se posuzuje vzorec, ne jednotlivý text. Padesát pochvalných recenzí napsaných za dvě hodiny je podezřelých bez ohledu na to, co říká skóre u kterékoliv z nich.
Nábor. Motivační dopis vygenerovaný modelem dnes pošle skoro každý a mnoho firem s tím počítá. Vyřazovat uchazeče podle detektoru znamená vyřazovat hlavně ty, kdo neumějí anglicky jako rodilý mluvčí. Užitečnější je zadat úkol, který se dělá při pohovoru.
Vědecké časopisy. Řeší se hlavně smyšlené citace a obrázky, tedy věci, které jdou ověřit přímo, ne odhadnout ze stylu. Kontrola, jestli citovaná studie existuje, dá spolehlivější výsledek než jakýkoliv detektor.
Detekce textu: co jde a co nejde
U textu funguje detekce nejhůř ze všech typů obsahu a stojí za to vědět proč.
Věty, které vygeneruje jazykový model, vypadají statisticky hladce. Model v každém kroku vybírá pravděpodobné pokračování, takže výsledek nemá tolik neobvyklých obratů a nepravidelných délek vět jako běžné lidské psaní, právě na tuhle vyhlazenost se detektory dívají.
Problém je, že hladce píše i spousta lidí. Nerodilí mluvčí, kteří se drží jistých obratů. Autoři technické dokumentace. Studenti, kterým učitel roky vtloukal jednotnou strukturu odstavce. Kdokoliv, kdo text prohnal korekturou.
A z druhé strany, čím jsou modely lepší, tím míň se jejich výstup od lidského psaní liší. Tým kolem Vinu Sankara Sadasivana z Marylandské univerzity to v roce 2023 popsal i teoreticky: horní hranice toho, jak dobrý může detektor být, závisí na statistické vzdálenosti mezi rozdělením lidských a strojových textů. Jak se ta vzdálenost s vývojem modelů zmenšuje, blíží se nejlepší možný detektor náhodě.
Praktický dopad je jednoduchý. U krátkých textů, u překladů, u redigovaných textů a u textů od nerodilých mluvčích je výsledek detektoru natolik nejistý, že se s ním nedá pracovat jinak než jako s podnětem k rozhovoru.
A jak je to s češtinou
Skoro všechny citované testy proběhly na angličtině a většina detektorů vznikla na anglických datech. Pro češtinu z toho plynou dva důsledky a ani jeden není příznivý. Zaprvé, čeština má bohatší tvarosloví a volnější slovosled, takže statistické vlastnosti textu vypadají jinak než v angličtině. Detektor natrénovaný převážně na angličtině tuhle odlišnost snadno zamění za signál. Zadruhé, českých trénovacích dat je řádově méně, takže i modely samotné píší česky rozpoznatelněji než anglicky, což by detekci teoreticky mělo pomáhat.
Který z těch dvou vlivů převáží, nezávislý test na české školní práci veřejně nemáme. Dokud nebude, dává smysl brát výsledek detektoru u českého textu ještě opatrněji než u anglického, a to i u nástrojů, které češtinu inzerují jako podporovanou. Před nasazením ve škole nebo ve firmě se vyplatí vyžádat si od dodavatele konkrétní čísla pro češtinu, ne jen obecnou přesnost.
Detekce obrázků: jiná hra, jiná pravidla
U obrázků je situace lepší, ale rychle se mění. Jak vznikají obrázky z generátorů, popisuje článek o generování obrázků pomocí AI, a znalost výrobního postupu tady pomáhá.
Vizuální stopy. Šest prstů, srostlé zuby, náušnice jen na jednom uchu, nečitelné písmo na cedulce v pozadí. Tohle byla ještě nedávno spolehlivá cesta a dnes je z ní jen první rychlá kontrola. Novější generátory ruce i text zvládají a zbývají drobnosti: okraje vlasů proti pozadí, nesedící odrazy v brýlích a ve vodě, stíny mířící z různých stran, opakující se vzor v davu.
Metadata. Fotoaparáty i telefony ukládají do souboru údaje EXIF, tedy čas, model přístroje, ohnisko, často i polohu. Vygenerovaný obrázek je obvykle nemá, nebo je má podivně prázdné. Jenže metadata odstraní i běžné nahrání na sociální síť, takže jejich absence nic nedokazuje. Naopak jejich přítomnost je docela dobrý signál, že snímek vznikl v přístroji.
Zpětné vyhledávání. Nahrání snímku do Google Lens nebo TinEye odhalí, jestli obrázek koluje déle, jestli existuje starší verze a v jakém kontextu se objevil. U recyklovaných fotek ze starých událostí, kterých je pořád víc než plně vygenerovaných záběrů, je tohle nejrychlejší postup vůbec.
Detektory obrázků. Existují a fungují líp než detektory textu, protože generátory nechávají v obraze charakteristické stopy na úrovni jednotlivých pixelů. Mají ale stejnou slabinu jako všechny natrénované klasifikátory: dobře poznají to, na čem se učily. Nový generátor, silná komprese nebo screenshot pořízený z obrazovky mobilu jejich přesnost srážejí.
Video a hlas: přebírá to kontext
U videa a zvuku platí totéž co u obrázků, jen s větší nejistotou. Komprese a nízké rozlišení schovají většinu stop a krátký úryvek nedá detektoru dost materiálu. U hlasu je to ještě horší než u obrazu. Telefonní hovor je z principu zkomprimovaný na úzké pásmo, které z nahrávky odstraní přesně ty jemné detaily, podle kterých by detektor mohl poznat syntézu. Právě proto se hlasové podvody dělají po telefonu, a ne přes kvalitní studiový záznam.
Prakticky se proto u těchto formátů posouvá těžiště jinam. Místo zkoumání záznamu se ověřuje, odkud přišel, kdo ho zveřejnil první a jestli ho přebírá někdo, kdo za obsah ručí. Konkrétní postup i seznam toho, čeho si u falešného videa nebo hlasu všímat, rozebírá článek o rozpoznávání deepfake.
Druhá cesta: značka místo hádání
Kromě zkoumání hotového obsahu existuje opačný přístup. Označit obsah už při vzniku a při kontrole tu značku jen přečíst.
Za tímhle přístupem stojí dvě konkurenční řešení. Průmyslové konsorcium C2PA, kde sedí i Adobe, Google, Microsoft nebo OpenAI, k souboru připojuje standardizovaný záznam o tom, čím a jak vznikl. Google DeepMind jde svou vlastní cestou přes technologii SynthID, neviditelnou značku vloženou přímo do dat, která má přežít oříznutí i kompresi. Obě technologie podrobněji rozebírá článek o rozpoznávání deepfake. Od 2. srpna 2026 platí článek 50 evropského nařízení o umělé inteligenci. Ukládá poskytovatelům generativní AI označovat výstupy strojově čitelně a tomu, kdo zveřejní deepfake, přikazuje to přiznat viditelně nebo slyšitelně, tedy tak, aby to člověk poznal bez detektoru. Pro systémy uvedené na trh dřív běží přechodné období do 2. prosince 2026, u textu na téma veřejného zájmu povinnost označení neplatí, pokud text prošel lidskou redakční kontrolou a někdo za něj nese odpovědnost.
Slabina téhle cesty je společná pro obě technologie. Screenshot, převod formátu nebo nahrání na platformu, která metadata zahodí, značku odstraní. A kdo označovat nechce, prostě nebude. Přítomnost značky je tedy silný důkaz původu, ale její nepřítomnost nedokazuje nic.
Humanizace: jev, který existuje a je dobré ho chápat
Kolem detektorů vyrostl trh se službami, které slibují opak: přepsat strojový text tak, aby ho detektor za strojový nepovažoval. Říká se tomu humanizace. Popisovat, jak takové služby ovládat, tenhle text nebude. Užitečnější je vědět, proč vůbec fungují, protože z toho plyne, jak moc se dá detektorům věřit.
Detektory se dívají na statistické vlastnosti textu, ne na jeho původ. Když se text přeformuluje, prostřídají se délky vět a vymění se část slov za méně obvyklá synonyma, ty statistické vlastnosti se posunou. Původ textu se přitom nezmění ani o kousek. Sadasivanův tým ukázal, že opakované přeformulování dokáže srazit záchytnost detektorů výrazně dolů, a to i u těch, které pracují s vodoznakem. Podobný efekt má strojový překlad do jiného jazyka a zpátky.
Z toho plynou dvě věci najednou. Kdo chce kontrolu obejít, dokáže to, a proto se detektor nedá použít jako zámek. A zároveň platí, že text, který prošel humanizací, se běžně zhoršuje, protože nahrazování slov za neobvyklejší synonyma dělá z čitelné věty kostrbatou. Učitel nebo editor to pozná dřív než detektor.
Zbývá etická stránka, kterou nemá smysl obcházet. Odevzdat cizí text jako vlastní je porušení pravidel bez ohledu na to, jestli ho psal člověk, nebo model, a bez ohledu na to, jestli to nějaký software odhalí. Humanizace na tomhle nemění nic. Mění jen to, jestli se na to přijde.
Co s výsledkem, když ho máte
Tohle je část, kde vzniká nejvíc reálné škody, a proto si zaslouží konkrétní pravidla.
Skóre není důkaz. Číslo z detektoru je indicie. Obvinit na jeho základě studenta z podvodu nebo zaměstnance z porušení pravidel znamená postavit rozhodnutí na nástroji, který podle citovaných studií chybuje v desítkách procent případů a systematicky poškozuje nerodilé mluvčí. Škola ani firma by takový postup u žádného jiného měřidla nepřipustily.
Zeptejte se, koho to poškodí. U textů psaných v cizím jazyce, u autorů s jednodušším stylem a u lidí, kteří používají korekturu nebo asistivní nástroje kvůli dyslexii, je riziko falešného poplachu vyšší než u ostatních. Plošné nasazení detektoru dopadne právě na ně.
Postup místo skóre. Když má vyučující podezření, existují spolehlivější kroky. Historie verzí dokumentu v Google Docs nebo Wordu ukazuje, jak práce vznikala. Krátká ústní obhajoba nad odevzdaným textem odhalí, jestli autor rozumí tomu, co odevzdal. Zadání navázané na konkrétní hodinu, vlastní data nebo místní kontext obchází celý problém, protože se hůř generuje.
Řekněte dopředu, co platí. Pravidlo „AI se používat smí, ale musí se uvést jak“ je vymahatelnější než zákaz, na který nikdo nemá nástroj. A hlavně učí to, co bude potřeba dál.
Na co si dát pozor
Detektor s inzerovanou přesností 99 procent tuhle přesnost obvykle měřil na vlastní testovací sadě, tedy na textech od modelů, které zná. Reálný provoz vypadá jinak a nezávislé testy to opakovaně ukazují. Druhá past se týká krátkých textů. Většina nástrojů potřebuje aspoň několik set slov, aby vůbec měla co počítat. Odstavec z e-mailu nebo příspěvek na sociální síti je pro detekci textu prakticky neměřitelný, a jestliže nástroj přesto vydá sebevědomé číslo, není to důvod mu věřit, spíš naopak.
Třetí past je opačná než všechny předchozí. Z toho, že detekce je nespolehlivá, neplyne, že je zbytečná. U hromadného obsahu, tedy u tisíců recenzí, komentářů nebo článků, se dá s chybovostí pracovat statisticky a odhalit vzorec, který by jednotlivá kontrola nenašla. Nespolehlivé měřidlo je použitelné na trendy a nepoužitelné na jednotlivce. A čtvrtá věc, na kterou se zapomíná: hodně obsahu dnes vzniká napůl. Člověk napíše osnovu, model dopíše odstavce, člověk to přepíše. Otázka „napsala to AI, ano nebo ne“ na takový text nesedí a žádný nástroj ji nezodpoví, protože špatně stojí.
Shrnutí
Detekce AI obsahu je odhad pravděpodobnosti, ne důkaz. U obrázků a videa funguje slušně a hlavně se dá doplnit metadaty a zpětným vyhledáváním. U textu je nejistá a bude nejistější, protože se rozdíl mezi strojovým a lidským psaním smazává. Praktický postup, který drží i pod tlakem, vypadá takhle. Nejdřív ověřte původ, tedy odkud obsah přišel a kdo za něj ručí, protože to je spolehlivější než jakýkoliv detektor. Značky typu Content Credentials nebo SynthID berte jako důkaz původu, když jsou, a jako nic, když nejsou. A výsledek detektoru nikdy nepoužívejte jako jediný podklad pro obvinění konkrétního člověka. Na to je příliš nepřesný a mýlí se předvídatelně v neprospěch těch, kdo si to nejmíň zaslouží. Návyky pro ověřování jednotlivých tvrzení včetně odpovědí od chatbotů shrnuje průvodce ověřováním faktů, společenský rozměr strojově vyráběného obsahu pak text o AI a dezinformacích.