Loni na jaře jsem sháněl plakát na sousedskou slavnost. Nic velkého, jeden obrázek na nástěnku a na Facebook, s názvem akce, datem a časem přímo v obrázku. Zkusil jsem tři generátory a všechny mi vrátily hezkou letní scénu s nápisem, který vypadal jako čeština viděná přes matné sklo. Jednou tam stálo „Sousedská slavnast“, podruhé „Sabota“, potřetí písmena, která v naší abecedě vůbec nejsou. O rok později jsem skoro stejné zadání napsal do Gemini. Přišel plakát, kde název, datum i čas seděly. Včetně háčků a čárek.

Ten posun má jméno, a poněkud potrhlé: Nano Banana. Takhle Google označuje obrazovou část Gemini, tedy model, který obrázky vytváří a upravuje. Lidé jím dnes přebarvují rodinné fotky, chystají plakáty na nástěnku i zkoušejí, jak by vypadala nová kuchyň. Pořád je to ale nástroj, u kterého se vyplatí vědět, kde má hranice.

Odkud se vzal ten banán

Jméno nevymyslelo marketingové oddělení. Vzniklo jako přezdívka anonymního modelu, který se objevil ve veřejném srovnávači, kde lidé porovnávají výstupy skrytých modelů a hlasují, který je lepší. Nikdo nevěděl, čí to je, a rychle bylo vidět, že s fotkami zachází o parník líp než tehdejší konkurence. Když se Google k modelu přihlásil, nechal přezdívku žít dál. Suché technické označení dnes zná málokdo, banán zná každý. Pod jednou značkou se přitom skrývá víc modelů. Vývojářská dokumentace Googlu jich vede hned několik: původní Nano Bananu (technicky Gemini 2.5 Flash Image), silnější Nano Bananu Pro postavenou na Gemini 3 Pro a novější rychlou dvojici Nano Banana 2 a Nano Banana 2 Lite. V aplikaci Gemini tuhle nabídku takhle rozepsanou nevidíte, dostanete výchozí model a která verze zrovna kreslí, poznáte spíš podle výsledku než podle popisku. Nejsilnější varianta bývá vázaná na placené předplatné, jenže rozdělení se mění po měsících.

Praktický dopad je nudný, ale užitečný. Když někde čtete, co Nano Banana umí, ověřte si, o kterou verzi jde. Rozdíl mezi rychlou a silnou variantou je vidět hlavně na nápisech a na jemných detailech.

Neupravujete. Povídáte si

Největší rozdíl oproti běžnému grafickému programu poznáte během první minuty. V Photoshopu vyberete vrstvu, nástroj a masku. Tady napíšete větu.

Nahrajete fotku a řeknete „vyměň pozadí za podzimní park v podvečerním světle“. Model vrátí upravený snímek. Vy pokračujete: „obličej i bundu nech úplně stejné, jen to světlo posuň víc zprava“. A pak: „ten odpadkový koš vlevo vymaž“. Konverzace jede dál a model si drží, co jste mu řekli předtím. Tohle je část, kterou lidé bez grafického vzdělání ocení nejvíc. Nemusíte umět odborně pojmenovat, co chcete. Stačí to popsat jako sousedovi přes plot.

Má to jeden háček, na který se přijde až po čtvrtém kole. Každá úprava je nové vykreslení celého obrázku, ne zásah do jednoho místa. Drobné odchylky se sčítají. Po několika kolech bývá pleť o něco hladší, okraje o něco ostřejší a scéna nenápadně „hezčí“, než byla na začátku. Když jde o věrnost originálu, vyplatí se vrátit k původní fotce a zadat úpravu znovu jinak, než stavět desátou úpravu na deváté.

Text v obrázku, který jde přečíst

Nápisy uvnitř obrázku byly dlouho slabina všech generátorů. Důvod je v principu: model nepíše písmena, model maluje to, jak písmena obvykle vypadají. Rozdíl mezi „č“ a „ć“ je pro něj otázka pravděpodobnosti, ne pravopisu. U angličtiny to bylo znát, u češtiny s háčky a čárkami to byla katastrofa.

Google u Nano Banany Pro uvádí, že model dokáže do obrázku vykreslit čitelný text ve víc jazycích, od krátkého sloganu po delší odstavec, a pracovat přitom s různými řezy písma i s kaligrafií. V našich pokusech to na krátkých českých nadpisech sedělo spolehlivě, u delších bloků textu se pořád stane, že se jedno písmeno ztratí nebo se čárka posune nad špatnou samohlásku. Pár věcí ten výsledek znatelně zlepší:

  • Přesné znění napište do uvozovek. Model pak s textem zachází jako s citací, ne jako s námětem.
  • Řekněte, kam text patří. „Nadpis přes horní třetinu“, „drobný text u dolního okraje“.
  • Popište charakter písma slovy. „Silné bezpatkové písmo“, „ručně psané, mírně nakloněné“.
  • Kratší je bezpečnější. Tři slova projdou skoro vždycky, pět řádků je loterie.

A pak výsledek přečtěte. Znak po znaku, ne od oka. Chyby v nápisu si na plakátu všimne úplně každý.

Věrnost: ať je to na páté fotce pořád stejný člověk

Druhá věc, kvůli které Nano Banana vyčnívá, se špatně předvádí na jediném obrázku. Jde o to, aby model při úpravě nezměnil to, co měnit neměl. Starší generátory tímhle trpěly. Požádali jste o změnu barvy trička a vrátil se člověk s trochu jiným nosem. Vygenerovali jste postavu podruhé a byl to už někdo jiný. Nano Banana se podoby drží výrazně líp: tvář, střih vlasů, tvar produktu i barevnost zůstávají rozpoznatelné napříč několika obrázky. Google k variantě Pro uvádí, že umí zkombinovat až čtrnáct vstupních obrázků a udržet přitom podobu až pěti lidí v jedné scéně.

Kde to reálně pomůže? Znám učitelku, která si k vlastní čítance nechala udělat sérii ilustrací s jednou dětskou postavou. Osm obrázků, osm situací, pokaždé stejné dítě ve stejné bundě. Před dvěma lety by to znamenalo buď ilustrátora, nebo osm obrázků s osmi různými dětmi. Limit tam ale je. Sedí obrys, tvář i hlavní barvy. Menší rozlišovací detaily se posouvají: vzor na svetru, náušnice, přesný tvar loga na tričku, nápis na kšiltovce. Když na nich záleží, počítejte s doděláním v grafickém programu.

Model, který o scéně něco ví

Jedna vlastnost se na první pohled schová, přitom vysvětluje dost z toho, proč výstupy působí promyšleněji než dřív. Silnější varianta Nano Banany stojí na Gemini 3 Pro, tedy na modelu, který Google staví na uvažování nad zadáním, ne jen na vykreslení obrazu. Obrazová část si tak může půjčit znalosti z textové.

Prakticky to znamená, že zadání nemusí být jen popis scény. Můžete si říct o schéma, jednoduchou infografiku nebo náčrt, kde text a obrázek drží pohromadě, a model dopíše i obsah, který jste mu nenadiktovali. Zkusil jsem si nechat udělat vysvětlovací schéma k rozdílu mezi wi-fi a mobilními daty a dostal jsem obrázek, který se dal beze změny promítnout na přednášce pro seniory. Nadšení mírní jedna věc. Model ta doplněná tvrzení nikde neověřuje. Popisky pod ikonami vypadají autoritativně, ale platí u nich totéž co u textového chatbota: může se splést a nedá vám o tom vědět. U schématu s čísly nebo daty čtěte každou položku.

Jak to vyzkoušet krok za krokem

Postup je krátký. Nic si předem neinstalujete.

  1. Otevřete Gemini. Přihlášení, rozhraní a základní ovládání popisuje návod na Gemini, zvláštní účet jen kvůli obrázkům nepotřebujete.
  2. Nahrajte fotku do konverzace, nebo rovnou napište, co má model vytvořit od nuly.
  3. Zadejte jednu změnu, ne pět najednou. Model zvládne víc pokynů, jenže kontrola výsledku je pak nepřehledná.
  4. Napište i to, co se měnit nemá. Tahle věta rozhoduje o věrnosti víc než všechno ostatní.
  5. Pokračujte dalším pokynem v téže konverzaci. K první verzi se dá vrátit kdykoli.
  6. Poměr stran i rozlišení si vyžádejte rovnou v zadání, ne až při ořezu.

Ukázka zadání, které v praxi funguje:

„Uprav tuhle fotografii. Pozadí vyměň za podzimní park v podvečerním světle. Obličej, účes i bundu nech přesně jako na originálu. Do horní třetiny napiš čitelně ‚Podzimní běh, 12. října’. Použij silné bezpatkové písmo. Formát na výšku 4:5.“ Poměr stran je detail, na který se snadno zapomene. Dokumentace Googlu uvádí u obrazových modelů celou řadu formátů včetně 1:1, 4:5, 9:16, 16:9 nebo 21:9 a rozlišení podle verze modelu až do 4K, u nejlehčích variant jen do 1K. Ořezávat čtverec na širokoúhlý formát až dodatečně obvykle znamená useknout to nejdůležitější. Obecná pravidla, jak obrazové zadání poskládat, rozebírá text o tom, jak napsat prompt pro generování obrázku.

Kde model pořád klopýtá

Recenze, která končí u chvály, není recenze. Tady jsou místa, kde jsem narazil.

Delší text v obrázku zůstává rizikový. Slogan ano, odstavec s pravidly soutěže ne. Logo je vždycky překreslení, ne kopie. Když modelu podstrčíte firemní značku a necháte ji zasadit do scény, vrátí se vám něco velmi podobného. Podobné logo je ale v grafice zhruba totéž co skoro správné IČO.

Model má sklon věci zkrášlovat. Pleť se vyhladí, oblečení srovná, nepořádek v pozadí zmizí i tehdy, když jste o to nežádali. U rodinné fotky je to milé.

U dokumentace stavu bytu před rekonstrukcí je to problém.

A stejné zadání dvakrát nedá stejný výsledek. Když se vám něco povede, stáhněte si to hned.

Vodoznak, který na obrázku neuvidíte

Google do všech obrázků vygenerovaných svými modely vkládá SynthID, tedy digitální vodoznak neviditelný pro lidské oko. Podle DeepMindu přežije i ořez nebo kompresi a rozpoznat ho umí Googlův vlastní nástroj. Vedle toho existuje viditelná značka. Do rohu obrázku se propíše jiskra Gemini. U předplatného Google AI Ultra a v nástroji Google AI Studio ji Google podle svého oznámení odstraňuje.

Pro čtenáře z toho plyne jedna nepříjemná věc. Chybějící viditelný vodoznak neznamená vůbec nic. A protože neviditelnou značku nosí jen obrázky z Googlu, ani její nepřítomnost nic nedokazuje, ověřování původu obrázků je zatím spíš slib než hotová věc.

Pro koho to je a kdy sáhnout jinam

Nano Banana dává smysl, když upravujete vlastní fotky, potřebujete produkt zasadit do jiného prostředí, chystáte plakát nebo příspěvek s krátkým nápisem, nebo si chcete rychle ukázat, jak by něco vypadalo. Za pár minut máte něco, co dřív znamenalo večer v editoru.

Nesedne na věci, kde rozhoduje přesnost do posledního pixelu: firemní vizuální identita, tiskovina s danou typografií, cokoli, co má sloužit jako doklad skutečnosti. Ve zpravodajství upravená fotka místa události nemá co dělat. Pokud vás zajímá spíš výtvarný rukopis než věrnost, hledejte jinde. Midjourney a podobné nástroje míří na atmosféru a stylizaci, ne na to, aby vaše babička vypadala jako vaše babička. Přehled toho, jak se jednotlivé generátory liší a proč vlastně fungují tak, jak fungují, najdete v průvodci generováním obrázků. Obrazová část je ostatně jen jeden kousek Gemini, ostatní funkce shrnuje text o tom, co Gemini umí.

Na co si dát pozor

Cizí tvář není váš materiál. Upravit fotku kamarádky a poslat ji do skupinového chatu je jedna věc, zveřejnit ji je druhá. Souhlas si vyžádejte předem, ne potom.

Nahrané fotky odcházejí na cizí servery. Doklady, lékařské zprávy, smlouvy ani fotky cizích dětí tam nemají co dělat, i kdyby úprava trvala vteřinu. Google ve své nápovědě uvádí věkové hranice: generovat obrázky mohou uživatelé od třinácti let, upravovat je až od osmnácti. U dětského účtu s tím počítejte.

Podmínky komerčního užití se u obrazových modelů mění rychle. Než výstup použijete v reklamě nebo na produktu, přečtěte si aktuální podmínky přímo u Googlu, ne shrnutí ve fóru. A poslední věc, spíš etická. Když upravenou fotku publikujete tam, kde ji někdo může brát jako záznam skutečnosti, napište to k ní. Popiska stojí pět slov a ušetří spoustu vysvětlování.

Shrnutí

Nano Banana posunula dvě věci, na kterých generátory obrázků léta klopýtaly: čitelný text uvnitř obrázku a věrnost při opakovaných úpravách. Pro běžnou práci s vlastními fotkami je to dnes nejrychlejší cesta od nápadu k použitelnému výsledku, zvlášť pokud už Gemini používáte k něčemu jinému. Pořád ale platí, že model odhaduje, jak by věc měla vypadat, nekopíruje ji. Nejužitečnější návyk, který si z toho můžete odnést, je banální: mít po ruce originál. Upravená fotka je dnes hezčí než skutečnost skoro vždycky. Sem tam je dobré vědět, o kolik.