Představte si školu, kde za semestr projde kontrolou tisíc studentských prací. Detektor AI textu je nastavený tak, že se u lidského textu splete jednou ze sta. Zní to jako slušná přesnost. Deset nevinných studentů dostane nálepku podvodníka. Za semestr, na jedné škole, u nástroje, který se chlubí devětadevadesátiprocentní spolehlivostí.

Tohle číslo se nedá vylepšit lepším marketingem ani novější verzí. Vyplývá přímo z toho, jak detektory pracují. Následující text vysvětluje ten princip a to, proč z něj falešná obvinění plynou nutně. Širší přehled toho, co detekce umí u textu, obrázků i videa, najdete v průvodci detekcí AI obsahu.

Základem je perplexita, míra překvapení textu

Detektor váš text nečte v tom smyslu, v jakém ho čte člověk. Nezajímá ho, o čem je, jestli je pravdivý ani jestli dává smysl. Zajímá ho jediná otázka: jak předvídatelné je každé následující slovo.

Pomůže představa našeptávače na mobilu. Když píšete zprávu, klávesnice nabízí tři možná pokračování. Vyberete první nabídnuté, pak zase první, pak zase první. Vznikne věta, kterou by klávesnice napsala i bez vás. Přesně tohle měří veličina zvaná perplexita, česky asi nejlíp „míra překvapení“. Nízká perplexita znamená, že text jde po nejpravděpodobnější cestě. Vysoká znamená, že se v něm objevují volby, které by model nečekal.

Jazykový model v každém kroku vybírá pravděpodobné pokračování, a proto jeho výstup má perplexitu nižší než běžné lidské psaní. Jak přesně tenhle výběr probíhá a proč modely pracují se slovy rozdělenými na kousky, rozebírá text o tom, co je token, případně vysvětlení, jak funguje velký jazykový model. Druhá veličina se jmenuje burstiness, tedy nepravidelnost. Lidský text střídá dlouhé a krátké věty, jednou zabrousí do odborného termínu, pak zase napíše něco úplně obyčejného. Míra překvapení tam kolísá. Strojový text bývá vyrovnanější.

Detektor tyhle dvě věci spočítá a výsledek převede na jedno číslo.

Čtyři různé věci pod jedním názvem

Slovo detektor zakrývá aspoň čtyři odlišné přístupy a každý má jinou slepou skvrnu.

Statistický odhad bez učení. Nástroj si vezme referenční jazykový model a spočítá, jak by pravděpodobné pro něj bylo napsat zrovna tenhle text. Slepá skvrna: funguje jen proti modelům podobným referenčnímu. Proti modelu, který píše jinak, ztrácí orientaci.

Natrénovaný klasifikátor. Nástroj dostane hromadu textů psaných lidmi a hromadu textů od modelů a naučí se je rozlišovat. Slepá skvrna je klasická u všeho učeného z příkladů: dobře pozná to, co viděl. Nový model, jiný jazyk, jiný žánr, jiná délka a přesnost padá.

Vodoznak. Generátor při psaní nepatrně nakloní výběr slov podle tajného klíče, takže výsledný text nese skrytý vzorec, který jde později přečíst. Tohle je jediný přístup, který nehádá. Slepá skvrna je ale veliká: funguje pouze tehdy, když generátor spolupracuje. Kdo použije model bez vodoznaku, projde.

Vyhledávání v databázi. Provozovatel si ukládá, co jeho model vygeneroval, a při kontrole hledá shodu. Slepá skvrna: pokrývá jen jednoho poskytovatele a jen po dobu, po kterou záznamy drží.

Většina komerčních nástrojů kombinuje první dva přístupy. To znamená, že hádají, byť poučeně.

Kde se bere falešné pozitivum

Tady je jádro celého problému a stojí za to ho pochopit i bez matematiky. Představte si dvě hromady textů: lidské a strojové. Detektor spočítá u každého jedno skóre, kdyby lidské texty měly vždycky skóre pod padesát a strojové vždycky nad padesát, bylo by hotovo.

Jenže tak to nevypadá. Obě hromady se na té stupnici překrývají. Existují lidské texty, které jsou hodně předvídatelné, a strojové texty, které jsou nezvykle rozevláté. Detektor musí někam položit hranici a od ní hlásit poplach. Když hranici posune nahoru, přestane hlásit nevinné, ale propustí spoustu skutečně strojových textů. Když ji posune dolů, chytí skoro všechny stroje a přibalí k nim nevinné lidi. Překryv nezmizí. Jenom se přesune do jedné, nebo do druhé kolonky.

Podobné je to s měřením výšky. Muži jsou v průměru vyšší než ženy, a přesto by nikoho nenapadlo určovat pohlaví podle metru, rozdělení se překrývají a v překryvu je hodně lidí.

Aritmetika, kterou nikdo nepočítá

Druhá, ještě nepříjemnější věc je poměr mezi tím, kolik podvodů se v souboru skutečně vyskytuje, a kolika lidí se kontrola týká.

Vezměme modelový příklad na zaokrouhlených číslech, aby šla logika vidět. Tisíc odevzdaných prací. Padesát z nich, tedy pět procent, opravdu napsal model. Detektor má citlivost 95 procent a u lidských textů se plete v pěti procentech případů, obojí jsou hodnoty, které by výrobce považoval za výborné.

Ze skutečně strojových prací odhalí zhruba 48. Z 950 poctivých prací jich ale falešně označí přibližně 47. Vyučující tedy dostane asi 95 označených prací, ve kterých je zhruba půl na půl skutečných případů a nevinných lidí. Hod mincí by dopadl stejně, jen by nebyl podepsaný softwarem.

Tenhle jev se jmenuje vliv základní četnosti a týká se každého testu, který hledá vzácný jev ve velkém vzorku. Nejde ho odstranit lepším nástrojem, dá se s ním jen počítat. A právě proto se skóre z detektoru nesmí použít jako důkaz proti konkrétnímu člověku, ať už je to student, nebo zaměstnanec. Jako podnět k rozhovoru ano. Jako obvinění ne.

Pro srovnání s reálným nástrojem: Annie Chechitelli, produktová ředitelka Turnitinu, uvedla pro server Inside Higher Ed, že chybovost jejich detektoru na úrovni jednotlivých vět je kolem čtyř procent. Firma zároveň přestala zobrazovat výsledek u dokumentů se skóre mezi jedním a devatenácti procenty, protože právě tam bylo falešných poplachů nejvíc. Že jde o vlastnost, ne o vadu konkrétního výrobku, potvrzuje i mezinárodní test čtrnácti nástrojů z roku 2023, na kterém se podíleli Tomáš Foltýnek a Petr Šigut z Masarykovy univerzity. Jeho závěr zní, že dostupné detekční nástroje „nejsou ani přesné, ani spolehlivé“.

Chyby nejsou náhodné. Mají adresáta.

Kdyby se detektor pletl náhodně, byl by to statistický problém. On se ale plete systematicky, a to je problém docela jiného řádu.

Stanfordský tým vedený Weixinem Liangem otestoval v roce 2023 sedm detektorů na textech, o kterých bylo jisté, že je psali lidé. U esejí amerických žáků osmé třídy chybovaly minimálně. U esejí z jazykové zkoušky TOEFL, které psali nerodilí mluvčí angličtiny, dosáhla průměrná chybovost 61,3 procenta. Všech sedm nástrojů se shodlo na nálepce „AI“ u 19,8 procenta těch prací a aspoň jeden nástroj označil 97,8 procenta z nich.

Příčina sedí přesně na tom, co jsme si popsali výše. Kdo píše v cizím jazyce, sahá po jistých, běžných obratech. Nezkouší neobvyklá slova, protože si jimi není jistý. Jeho text má proto nízkou perplexitu, a to je přesně ta vlastnost, kterou detektor hledá. Důkaz té souvislosti dodali autoři sami. Když tytéž eseje nechali přepsat bohatší slovní zásobou, chybovost spadla z 61,3 na 11,6 procenta. Nezměnil se autor. Změnil se slovník.

Stejným směrem míří i další skupiny. Lidé s dyslexií, kteří používají korekturní nástroje. Autoři, jejichž text prošel překladem. Kdokoliv, koho ve škole naučili psát podle pevné šablony. A také úředníci, technici a právníci, jejichž žánr vyžaduje ustálené formulace.

Plošné nasazení detektoru tedy nedopadá na náhodný vzorek. Dopadá opakovaně na tytéž lidi.

Proč se to samo nezlepší

Zbývá otázka, jestli to nespraví další generace nástrojů. Odpověď je spíš ne, a existuje pro ni i teoretický důvod.

Tým kolem Vinu Sankara Sadasivana z Marylandské univerzity ukázal, že horní hranice kvality jakéhokoliv detektoru závisí na tom, jak daleko od sebe leží rozdělení lidských a strojových textů. Jak se modely zlepšují, tahle vzdálenost se zmenšuje, a s ní i strop toho, čeho může nejlepší možný detektor dosáhnout. V limitu se blíží hodu mincí.

Tentýž tým doložil i druhou věc. Opakované přeformulování textu srazí záchytnost detektorů výrazně dolů, včetně těch, které pracují s vodoznakem. Přeformulováním se přitom nemění původ textu ani o kousek. Mění se jen statistické vlastnosti, na které se detektor dívá. Detektor tedy neměří to, co si myslíme, že měří.

Na co si dát pozor

Než někde nasadíte nebo přijmete výsledek detektoru, zeptejte se na tři konkrétní věci. Jakou chybovost u lidských textů výrobce uvádí a při jakém prahu. Jakou minimální délku text potřebuje. A jestli existují čísla pro jazyk, ve kterém píšete, nebo jen pro angličtinu.

Když na některou z těch otázek nedostanete odpověď, číslo z nástroje nemá váhu, kterou mu chcete přisoudit.

A pozor na obrácenou chybu. Nízké skóre nedokazuje, že text psal člověk. Detektory mají podle citovaného testu sklon označovat vstup spíš za lidský, takže „čistý“ výsledek znamená hlavně to, že nástroj nic nenašel.

Shrnutí

Detektor AI textu odhaduje předvídatelnost stylu, autorství nezjišťuje. Skóre je pravděpodobnost odvozená ze statistiky, a protože se lidské a strojové psaní na té škále překrývají, falešná pozitiva z principu odstranit nejdou.

Praktický důsledek je jediný a platí bez výjimky. Číslo z detektoru je podnět k rozhovoru, k nahlédnutí do historie verzí dokumentu nebo ke krátké ústní obhajobě. Jako jediný důkaz při obvinění studenta nebo zaměstnance se použít nesmí, protože se mýlí často a mýlí se předvídatelně v neprospěch lidí, kteří píší v cizím jazyce nebo prostě jednodušeji než ostatní.