Sestra mi na rodinném chatu poslala fotku ze svatby, na které jí vadilo pozadí s odstaveným autem u kostela. Nahrál jsem fotku do Gemini a napsal jen „vymaž to auto vzadu a doplň trávník jako zbytek záběru”. O chvíli později přišel obrázek, kde auto zmizelo a tráva navazovala tak plynule, že nikdo netuší, že tam něco stálo. Žádný grafický program, žádné vrstvy, jedna věta.

Tahle konkrétní úprava stojí na modelu, kterému Google i uživatelé říkají Nano Banana, a je jen jednou z funkcí, kvůli kterým se o Gemini mluví jinak než o obyčejném chatovacím okně. Přihlášení, rozhraní a propojení s Gmailem nebo Dokumenty popisuje návod na Gemini. Tenhle text jde dál, k tomu, co Gemini umí jako model: jak dlouhý text a video unese najednou, jak upravuje obrázky a jak si samo poradí s úkolem, na který by jinak člověk potřeboval hodinu prohledávání webu.

Kontext, do kterého se vejde celá kniha

Kontextové okno je množství textu, které si model najednou udrží v hlavě během jedné konverzace. Čím je delší, tím víc materiálu mu můžete naráz předhodit, aniž byste ho museli dělit na kusy nebo mu opakovaně připomínat, co bylo řečeno o pár zpráv zpátky.

Google v tomhle parametru dlouhodobě tlačil konkurenci dopředu. Už model Gemini 1.5 Pro v roce 2024 uměl pracovat s kontextem kolem milionu tokenů, tedy zhruba tisícem stránek textu v jedné konverzaci. Pozdější generace, 2.0, 2.5 a dnešní Gemini 3, na tomhle základu dál stavěly, mezitím se ale na podobnou hranici dostala i konkurence. Prakticky to znamená, že do jedné konverzace nahrajete klidně celou knihu, sadu smluv k jednomu projektu nebo hodiny přepisu rozhovorů, a Gemini se dokáže odkazovat na libovolné místo v tom všem, ne jen na poslední odstavec. Pozor na jeden detail: plné milionové okno je v aplikaci Gemini navázané na placený tarif, bezplatný účet zvládne podklady výrazně kratší.

Má to hranici. Čím delší podklad, tím déle odpověď trvá a tím snáz se v obrovském množství textu ztratí drobný detail, který by člověk při ručním čtení postřehl. Na rychlou otázku k jedné stránce je dlouhé kontextové okno zbytečné, svou sílu ukáže až u objemných podkladů, které by se jinak musely dělit na desítky menších dotazů.

Konkrétní příklad z praxe: advokátní kancelář řešící spor o pozemek nahraje do jedné konverzace všech patnáct let korespondence, znalecké posudky i výpis z katastru a zeptá se, jestli se v průběhu let nezměnilo tvrzení o hranici pozemku. Gemini prochází celý materiál najednou, ne po jednotlivých dokumentech, a dokáže upozornit na rozpor mezi posudkem z roku 2014 a dopisem z roku 2021, i když leží stovky stránek od sebe.

Nano Banana: editace fotek, která si pamatuje, jak věc vypadá

Nano Banana je jméno Googlova modelu na generování a úpravu obrázků zabudovaného v Gemini. Vzniklo původně jako přezdívka v komunitě kolem AI ještě předtím, než Google model oficiálně propojil se svým chatbotem, a natolik se ujalo, že ho firma přijala za vlastní místo suchého technického označení. Dnes jde o oficiální značku, pod kterou Google nabízí několik variant lišících se kvalitou výstupu; ta nejsilnější je vyhrazená platícím uživatelům.

Silná stránka není samotné generování obrázku z ničeho, to umí i konkurence. Je to úprava existující fotky se zachováním toho, jak věc, člověk nebo zvíře doopravdy vypadá. Klasický problém starších generátorů byl, že úprava jednoho detailu, třeba barvy trička, změnila při druhém pokusu i obličej nebo pozadí k nepoznání. Nano Banana dokáže vzít reálnou fotku, upravit jen požadovanou část a zbytek nechat vizuálně konzistentní s originálem.

Druhá silná vlastnost je slučování víc fotek do jedné scény. Nahrajete fotku nábytku z obchodu a fotku vlastního obýváku, napíšete „ukaž, jak by tahle pohovka vypadala u okna vpravo”, a dostanete vizualizaci, která respektuje proporce místnosti. Podobně jde spojit portrét jedné osoby s pozadím z jiné fotky, aniž by výsledek působil jako viditelný koláž.

Slabina zůstává stejná jako u ostatních generátorů obrázků: text uvnitř obrázku. Když chcete plakát s konkrétním nápisem nebo ceduli s přesným textem, model písmena občas zkomolí nebo přehodí. Na úpravu fotografie beze změny textu to nevadí, na cokoliv s čitelným nápisem počítejte s tím, že výsledek zkontrolujete a případně dotáhnete v grafickém programu.

Praktické využití najde tahle funkce i mimo rodinné fotky. Majitel malého e-shopu s ručně vyráběnými svíčkami mi popisoval, jak stejný produkt vyfotí jednou pořádně na bílém pozadí ve studiu a pak požádá Gemini, ať tu samou svíčku umístí do vánoční scény, na letní zahradní stůl nebo vedle knihy k Velikonocům. Sváteční fotky vznikají za pár minut, aniž by musel produkt znovu fotit pro každé roční období zvlášť. Svíčka na všech verzích vypadá stejně, mění se jen okolí.

Deep Research: agent, který sám prochází desítky stránek

Deep Research je režim, kdy Gemini nečeká na jeden dotaz s jednou odpovědí, ale samo naplánuje, jaké kroky vyhledávání potřebuje, a projde desítky webových stránek, než sestaví delší zprávu se všemi zjištěními pohromadě. Zadáte třeba „porovnej sazby a podmínky hypotečního pojištění u pěti největších pojišťoven na českém trhu”, a Gemini místo jedné odpovědi vrátí strukturovaný report s odkazy na zdroje, ze kterých čerpalo.

Rozdíl oproti běžnému dotazu s vyhledáváním na webu je v hloubce a v tom, že celý proces běží samostatně, klidně několik minut, zatímco uživatel dělá něco jiného. Jde o praktickou ukázku posunu od chatbota k agentovi, tedy systému, který nejen odpoví, ale sám naplánuje a provede víc kroků. Co přesně tenhle posun znamená a kde je jeho hranice, rozebírá text o rozdílu mezi chatbotem a AI agentem.

Výstup z Deep Research beru jako výbornou první orientaci v tématu, ne jako hotovou analýzu k podpisu. Model si vybírá zdroje podle vlastního úsudku, a i když u každého tvrzení uvádí odkaz, stojí za to aspoň namátkou ověřit, že citovaný zdroj skutečně říká to, co report tvrdí.

Výsledná zpráva bývá strukturovaná jako menší studie, s úvodním shrnutím, jednotlivými podkapitolami k dílčím otázkám a seznamem zdrojů na konci. Kdo hledá rychlou odpověď na jednoduchou otázku, Deep Research zbytečně zdrží, celý proces prohledávání trvá řádově minuty, ne vteřiny. Vyplatí se hlavně tam, kde by člověk jinak sám otevíral deset a víc záložek v prohlížeči a ručně porovnával, co se v nich píše.

Canvas: vlastní prostor pro dokument a kód

Kromě zapojení do Google Workspace má Gemini i vlastní prostor přímo v chatu, nazvaný Canvas, kam se otevře delší dokument nebo kus kódu k průběžné úpravě. Text nebo kód zůstává na jednom místě a mění se podle dalších pokynů, místo aby se s každou úpravou přepisoval jako nová zpráva v konverzaci.

U kódu Canvas rovnou nabídne živý náhled, pokud jde o jednoduchou webovou stránku nebo interaktivní prvek, takže výsledek vidíte dřív, než ho zkopírujete jinam. U delšího textu, třeba návrhu smlouvy nebo rozepsaného článku, jde označit konkrétní pasáž a požádat o úpravu jen té části. Zbytek zůstane netknutý.

Pro krátké dotazy Canvas roli nehraje. Vyplatí se tam, kde se k jednomu výstupu vracíte vícekrát během jedné konverzace a nechcete se prokousávat historií zpráv, abyste našli poslední platnou verzi textu nebo kódu.

Gemini Live: mluvený režim, který se dívá s vámi

Gemini Live spouští plynulý hlasový rozhovor, podobný telefonátu: mluvíte, model odpovídá hlasem prakticky bez prodlevy a nečeká, až domluvíte celou větu, než začne reagovat. Oproti běžnému přepisu řeči na text a zpátky je rozdíl znát hlavně v přirozenosti, rozhovor plyne bez trapných pauz.

Zajímavější je možnost sdílet kameru telefonu nebo obrazovku počítače přímo do rozhovoru. Namíříte kameru na rozvrhovou tabuli v kuchyni a zeptáte se nahlas, kdy má syn příští zubní prohlídku. Nebo sdílíte obrazovku s formulářem, který nechápete, a Gemini nahlas poradí, které pole vyplnit a proč. Model tak v reálném čase vidí totéž, co vy, a reaguje na to hlasem, ne jen na text, který mu popíšete.

Hodí se to hlavně v situacích, kdy nemáte volné ruce na psaní: v autě, při vaření, na procházce se psem. Pro psaní delšího textu nebo práci s dokumenty zůstává praktičtější klasické textové okno, hlasový režim je doplněk pro konkrétní chvíle, ne náhrada za psaní.

Video a zvuk jako běžný vstup, ne výjimka

Gemini od základu zvládá i multimodální vstup, tedy zpracování obsahu, který není jen text. Nahrajete videozáznam schůzky, přednášky nebo tutoriálu, a model ho umí shrnout, najít konkrétní pasáž podle popisu obsahu nebo vypsat časové značky k jednotlivým tématům. Podobně to funguje se zvukovou nahrávkou, třeba diktafonovým záznamem rozhovoru.

Praktický rozdíl oproti pouhému přepisu řeči na text je v tom, že Gemini rozumí i vizuální stránce videa, ne jen tomu, co v něm zazní. Rozpozná, co se na obrazovce děje, přečte text na snímku prezentace, popíše graf, který se mihne ve videu. Obecnější vysvětlení, co multimodalita znamená a proč se dnes stala standardem napříč velkými modely, najdete v textu o multimodalitě.

Kombinace dlouhého kontextu a rozumění videu se hodí i na věci, které by jinak zabraly celé odpoledne. Učitel, který natočí dvouhodinovou nahrávku semináře, může Gemini požádat, ať vypíše časové značky ke každému probíranému podtématu a k nim přidá krátké shrnutí. Vznikne tak obsah, který by ručním proklikáváním záznamu hledal desítky minut, a učitel ho dostane v přehledu na jednu obrazovku.

Na co si dát pozor

Deep Research umí znít sebejistě i tam, kde sesbíral protichůdné informace z různých zdrojů. U důležitých rozhodnutí, finančních, právních nebo zdravotních, beru report jako podklad k dalšímu ověření, ne jako konečnou odpověď.

Upravené fotky přes Nano Banana vypadají čím dál věrohodněji, a to platí i pro fotky jiných lidí. Než upravenou fotku s cizí tváří sdílíte dál, počítejte s tím, že jde poznat čím dál hůř, co je originál a co úprava, a chovejte se podle toho zodpovědně.

Gemini Live sdílí kameru nebo obrazovku v reálném čase, což znamená, že model vidí přesně to, co mu ukážete. Vypněte sdílení ve chvíli, kdy byste v záběru nechtěli mít něco citlivého, stejně jako byste to nechtěli ukázat cizímu člověku přes rameno.

Dlouhé kontextové okno nezaručuje, že si model zapamatuje úplně všechno stejně dobře. U extrémně dlouhých podkladů se vyplatí důležité závěry ještě jednou ověřit dotazem na konkrétní část textu, ne spoléhat jen na první souhrnnou odpověď.

Shrnutí

Gemini jako obyčejný chatbot je jen výchozí bod. Dlouhé kontextové okno umožní pracovat s celou knihou nebo sadou dokumentů najednou. Nano Banana posouvá editaci fotek k úpravám, které vypadají jako by vznikly v profesionálním studiu. Deep Research odvede hodiny vyhledávání za vás a Gemini Live přidává hlasový a vizuální rozměr tam, kde se nehodí psát. Kdo řeší jednoduchý dotaz, žádnou z těchto vrstev nepotřebuje. Kdo pracuje s objemnými podklady nebo fotkami, tam se rozdíl oproti základnímu chatu ukáže nejvíc.