Loni na podzim mi přistála v poště výroční zpráva o sto osmdesáti stranách a k ní jediná otázka: je tam někde řeč o zdražení servisních poplatků? Nahrál jsem PDF do chatbota a za dvacet vteřin jsem měl hladké shrnutí na deset řádků. Zmínka o zdražení v něm nebyla. Přitom v dokumentu byla, na straně devadesát čtyři, dvě věty schované v odstavci o provozních nákladech. Shrnutí dlouhého textu patří k úkolům, které dnešní modely odbaví nejrychleji. Taky k těm, kde se člověk spálí nejtišeji, protože chybějící větu ve shrnutí prostě nevidí.

Co model s vaším dokumentem provede

Text se před zpracováním rozseká na tokeny, tedy kousky o velikosti zhruba slabiky až krátkého slova. Kolik tokenů model pobere najednou, tomu se říká kontextové okno.

Čísla jsou dnes velkorysá. Anthropic uvádí u modelů Claude Opus 5 a Sonnet 5 okno jednoho milionu tokenů, u menšího Haiku 4.5 dvě stě tisíc. Dokumentace Gemini mluví taky o milionu tokenů a víc a překládá to do lidštiny hezky názorně: jde zhruba o osm průměrně dlouhých anglických románů nebo o přepisy víc než dvou set podcastových epizod. Dva háčky. Čeština se na tokeny láme hůř než angličtina, takže stejně obsáhlý český text sní víc tokenů než jeho anglický protějšek. A do okna se počítá celá konverzace, ne jen nahraný soubor. Když nad jedním PDF vedete dvouhodinovou diskuzi, ukrajujete si místo, které měl k dispozici dokument.

Praktický dopad je jednoduchý: u opravdu dlouhých dokumentů nepracujte v konverzaci, ve které jste předtím řešili tři jiné věci. Otevřete si nový chat.

Vlastní limity má i nahrávání souborů. Anthropic u chatu na Claude.ai uvádí strop 500 MB na soubor, dvacet souborů na konverzaci a maximálně tisíc stran u PDF, přičemž obrázky a grafiku model čte jen do stovky stran. U naskenované smlouvy, která je fakticky sbírkou fotek papíru, tedy může nastat situace, kdy se soubor nahraje, ale model z něj přečte málo nebo nic. Poznáte to jednoduše: požádejte ho, ať doslova ocituje první větu na páté straně.

Zadání „shrň mi to“ je ztracená minuta

Prázdný pokyn nechává na modelu tři rozhodnutí, která má udělat člověk: pro koho je shrnutí určené, jak dlouhé má být a co se z něj nesmí vytratit. Výstup pak vypadá takhle:

Dokument se zabývá hospodařením společnosti za uplynulé období.
Popisuje vývoj tržeb, nákladovou stránku a plány do dalších let.
Vedení hodnotí výsledky jako stabilní a očekává další rozvoj.

Zkuste z toho vyčíst, jestli firma vydělala, nebo prodělala. Nejde to. Věty jsou gramaticky v pořádku a obsahově prázdné, protože model nedostal jediný důvod být konkrétní.

Zadání, které tenhle problém řeší, vypadá jinak:

Jsi analytik, který připravuje podklad na poradu.
Shrň přiložený dokument v češtině.

Formát:
1) Pět odrážek s hlavními fakty. V každé uveď číslo nebo datum, pokud je v textu.
2) Odstavec nadepsaný „Co se mění oproti minulému roku".
3) Odstavec nadepsaný „Co je v dokumentu vágní nebo chybí".

Pravidla:
- Nepiš nic, co v dokumentu není.
- U každé odrážky uveď stranu nebo kapitolu, odkud údaj pochází.
- Když si nejsi jistý, napiš „nejasné" místo odhadu.

Nejvíc práce odvedou poslední tři řádky. Odkaz na stranu si můžete ověřit za deset vteřin, takže vymýšlení hned zdraží. Žádost o pasáže, které jsou vágní, obrátí pozornost modelu na místa, kde se autor dokumentu vyjádřil mlhavě záměrně.

Ze stejné výroční zprávy pak vypadne něco, s čím se dá pracovat:

- Tržby 412 mil. Kč, meziročně o 6 % níž (s. 12)
- Servisní poplatky se od 1. 1. zvyšují o 4 % (s. 94)
- Počet zaměstnanců klesl z 240 na 218 (s. 31)
- Investice do nové linky odložena na 2027 (s. 58)
- Splatnost úvěru 300 mil. Kč nastává v červnu 2027 (s. 63)

Rozdíl proti prvnímu výstupu nespočívá v tom, že by model byl chytřejší. Dostal jen jasně řečeno, že ho zajímají čísla, a zákaz vyplňovat mezery domněnkami.

Ještě jedna věc rozhoduje o výsledku, a lidé ji řeší málokdy: co vlastně od shrnutí chcete. Souvislý text, který obsah převypráví vlastními slovy, je něco jiného než výtah doslovných pasáží. To první se čte líp a snáz se v tom ztratí detail. To druhé zní kostrbatě a dá se ověřit. U smluv a zpráv, kde jde o formulace, si říkejte rovnou o citace.

Když je dokument delší než okno

Rozdělte ho a shrnujte po dílech. Řežte podle kapitol, ne podle počtu stran, aby se argument nerozpůlil uprostřed. Každý díl si očíslujte.

První kolo, u každé části zvlášť:

Tohle je část 3 ze 7 jedné dlouhé zprávy. Zatím nic nezobecňuj.
Vypiš z ní jen fakta: čísla, data, jména, závazky a termíny.
Formát: odrážky, bez úvodní a závěrečné věty.

Druhé kolo, až máte všechny části za sebou:

Tady je sedm dílčích výpisů faktů z jedné zprávy.
Slouč je do jednoho přehledu, seřaď podle témat
a označ místa, kde si dílčí výpisy vzájemně odporují.

Ta poslední instrukce o rozporech je v praxi to nejužitečnější, co z celého postupu vypadne. Rozpory bývají přesně tam, kde má dokument slabinu.

Proč se to podstatné ztrácí uprostřed

Náhoda za tím nestojí. Nelson F. Liu se spoluautory ze Stanfordu, UC Berkeley a Samaya AI popsali v práci Lost in the Middle, publikované v časopise Transactions of the ACL, chování, které od té doby zná každý, kdo s dlouhými texty pracuje. Modely si nejlépe poradí s informací umístěnou na začátku nebo na konci vstupu. Když ji posunete doprostřed, přesnost odpovědí spadne.

Novější měření to potvrzuje i u modelů, které se dlouhým kontextem chlubí. Benchmark NoLiMa z dílny Adobe Research, prezentovaný na konferenci ICML 2025, otestoval třináct modelů deklarujících okno minimálně sto dvacet osm tisíc tokenů. Při délce třiceti dvou tisíc tokenů jedenáct z nich kleslo pod polovinu výkonu, který předváděly na krátkých textech. Tehdejší špička GPT-4o spadla z 99,3 procenta na 69,7 procenta. Trik benchmarku spočíval v tom, že hledaná informace nesdílela s otázkou doslovná slova. Model ji musel najít podle smyslu, ne podle shody znaků. Odsud plyne praktická rada: pokud v dotazu použijete stejné výrazy, jaké má dokument, výrazně si pomůžete. Ptáte-li se na „navýšení ceny“ v textu, kde stojí „úprava sazebníku“, máte problém.

Jak poznat, že shrnutí něco vynechalo

Nejrychlejší kontrola je adresný dotaz na téma, které vás zajímá:

Najdi v dokumentu všechny pasáže, kde se mluví o [téma].
Cituj je doslova, včetně čísla strany.
Pokud tam žádné nejsou, napiš „nenalezeno" a nic nedomýšlej.

Druhá možnost je nechat si nejdřív vypsat osnovu, tedy seznam kapitol a témat, a teprve pak si vybrat, co chcete rozvést. Osnovu zvládne model spolehlivěji než syntézu, protože nadpisy jsou v textu rozeseté rovnoměrně. A do třetice: stejný dotaz položte dvakrát v samostatných chatech. Když dostanete dvě různá čísla, aspoň víte, že se máte podívat do originálu.

Funguje i obrácený postup, který mi ušetřil nejvíc práce. Napište si předem tři až pět otázek, kvůli kterým dokument vůbec otevíráte, a teprve pak si nechte udělat shrnutí. Když se odpověď na některou z nich ve shrnutí neobjeví, víte přesně, kam se doptat, místo abyste dodatečně hádali, co v textu mohlo být.

Co do veřejného chatbota nepatří

Na jaře 2023 vložili inženýři Samsung Electronics do ChatGPT zdrojový kód a přepis interní porady. Podle interního sdělení, o kterém tehdy informovala agentura Bloomberg, firma na začátku května zareagovala plošným zákazem chatbotů na firemních zařízeních. Vložené zadání se z cizího systému zpětně nemaže.

Nastavení se od té doby zlepšilo, ale liší se poskytovatel od poskytovatele. Anthropic uvádí, že u spotřebitelských plánů Claude Free, Pro a Max se konverzace k trénování nepoužívají, dokud to uživatel sám nezapne. OpenAI dává v sekci Data Controls přepínač, kterým se používání konverzací k trénování vypne, a u firemních verzí data k trénování nepoužívá.

Přepínač ale neřeší tu podstatnou otázku. Ta zní, jestli vůbec smíte firemní dokument poslat na cizí server. Smlouva s klientem, personální spis nebo nezveřejněná hospodářská data patří k věcem, u kterých si souhlas zaměstnavatele vyžádejte předem, ne až po nahrání. Řada firem má schválený konkrétní nástroj, ve kterém je to v pořádku, a ostatní zakázané.

Kdy shrnutí od AI radši nepoužít

U smlouvy před podpisem, u lékařské zprávy a u úředního rozhodnutí s termínem je strojové shrnutí dobré leda jako první orientace, co v dokumentu vůbec je. Rozhodnutí stavte na originálu. Cena za přehlédnutou podmínku je tam řádově vyšší než ušetřených dvacet minut čtení.

Kde se to naopak vyplatí okamžitě: přepisy porad, tiskové zprávy, výroční zprávy, dlouhá e-mailová vlákna, studijní materiály. Všude tam, kde potřebujete zjistit, jestli se dokumentem má cenu zabývat dál. Sám jsem si zvykl na jedno pravidlo. Když mi shrnutí neuvede ani jedno konkrétní číslo, něco je špatně, buď s dokumentem, nebo se zadáním. A ve druhém případě to naštěstí spravím jednou větou v promptu.