První obrázek, který jsem si nechal vygenerovat, měl zobrazovat „starou knihovnu za soumraku”. Dostal jsem místnost plnou knih, ano, ale s podivným osvětlením, které nepřipomínalo soumrak ani vzdáleně, a s regálem, co mizel kdesi v nesmyslné perspektivě. Až později jsem pochopil, že problém nebyl v generátoru. Problém byl v tom, že jsem zadání napsal jako básník, ne jako režisér.

Textové prompty pro chatboty a obrazové prompty pro generátory obrázků fungují na jiném principu, i když obojí lidé souhrnně nazývají „psaní promptů”. U textu model rozumí souvislostem a domýšlí kontext. U obrázku model potřebuje mnohem konkrétnější popis vizuální scény, protože nedomýšlí náladu ani logiku prostoru tak, jak by to udělal textový model při psaní věty.

Ze čeho se skládá dobrý obrazový prompt

Obrazový prompt funguje nejlíp, když popisuje scénu vrstvu po vrstvě, podobně jako byste ji popisovali fotografovi, který obraz nikdy neviděl a musí si ho poskládat jen z vašich slov.

Subjekt. Co nebo kdo je na obrázku hlavní. Ne „žena”, ale „žena středního věku v tvídovém kabátě”. Ne „pes”, ale „hnědý retrívr s mokrou srstí”. Konkrétnost tady dělá největší rozdíl mezi generickým a použitelným výsledkem.

Prostředí a kontext. Kde se scéna odehrává. „V kavárně u okna”, „na horské louce za mlhy”, „v opuštěné tovární hale”. Prostředí určuje světlo, barvy i celkovou náladu obrázku, generátor bez něj domýšlí neutrální pozadí, které málokdy sedí na to, co jste chtěli.

Kompozice a úhel pohledu. Zda jde o portrét zblízka, celek postavy, pohled shora nebo záběr z úrovně očí. Fotografická terminologie tady funguje spolehlivě, protože generátory se učily i na popiscích profesionálních fotografií. Fráze jako „širokoúhlý záběr”, „makro detail” nebo „pohled z ptačí perspektivy” model chápe přesně.

Osvětlení. Jedna z nejpodceňovanějších částí promptu, a přitom jedna z nejvlivnějších. „Měkké ranní světlo”, „ostré poledne bez stínů”, „svit jediné svíčky” změní atmosféru obrázku výrazněji než změna barvy oblečení postavy.

Styl. Fotorealismus, akvarel, kresba tužkou, styl konkrétního uměleckého směru. Sem patří i odkaz na techniku, třeba „digitální malba” nebo „film noir fotografie”. Styl je ta část promptu, kterou lidé nejčastěji vynechají, a přitom právě ona rozhoduje o tom, jestli výsledek vypadá jako fotka, ilustrace nebo malba.

Ukázka: od slabého k silnému promptu

Slabý prompt: „hezká krajina s horami.”

Výsledek bude generický, sestavený z nejběžnějších horských motivů, jaké generátor zná, bez jasné identity. Model nemá důvod zvolit konkrétní roční období, denní dobu ani kompozici, takže zvolí to nejpravděpodobnější průměrné řešení.

Silný prompt: „skalnaté horské pásmo za východu slunce, ranní mlha v údolí, širokoúhlý záběr, teplé oranžové a růžové tóny, fotorealistický styl, ostré detaily skal v popředí.”

Tady má generátor jasné zadání pro každou vrstvu: subjekt (skalnaté hory), čas (východ slunce), atmosféru (mlha v údolí), kompozici (širokoúhlý záběr), barevnost (oranžová a růžová) a styl (fotorealismus s ostrými detaily). Výsledek bude výrazně bližší tomu, co jste si při zadávání představovali.

Negativní prompty: co říct, že nechcete

Některé nástroje pro generování obrázků nabízejí samostatné pole pro negativní prompt, tedy popis toho, co se na obrázku objevit nemá. Jiné, hlavně novější konverzační generátory integrované do chatbotů, negativní požadavky zvládají zahrnout přímo do běžného textového zadání jako doplňkovou instrukci.

Typické použití negativního promptu: vyloučení rozmazaných detailů, deformovaných rukou, nechtěného textu v obraze nebo konkrétních barev, které nechcete. „bez textu, bez vodoznaku, bez rozmazaných okrajů” je běžná formulace u nástrojů, které negativní pole podporují.

Užitečnost negativního promptu se liší podle konkrétního generátoru a jeho aktuální verze, protože se schopnosti modelů v tomhle ohledu rychle vyvíjejí. Pokud narazíte na opakovaný problém, třeba generátor pořád přidává do scény lidi, i když jste o ně nežádali, zkuste ho explicitně vyloučit místo toho, abyste to řešili opakovaným generováním dokola.

Práce se stylem a referencemi

Odkaz na konkrétní umělecký styl, třeba „impresionismus” nebo „styl japonské rytiny”, generátor obvykle rozpozná spolehlivě, protože jde o dobře zdokumentované kategorie. U odkazů na konkrétní žijící umělce buďte obezřetní, řada nástrojů takové požadavky omezuje nebo je vůbec neumožňuje kvůli otázkám autorských práv, a pravidla se u jednotlivých služeb liší.

Bezpečnější a často účinnější cesta je popsat vlastnosti stylu místo jména autora. Místo „v stylu malíře X” zkuste „silné tahy štětcem, syté barvy, viditelná textura plátna”. Popis vlastností funguje spolehlivěji napříč různými generátory a nenaráží na omezení spojená s konkrétními jmény.

Poměr stran a technické parametry

Kromě popisu scény má smysl zadat i formát výstupu, hlavně pokud víte, k čemu obrázek použijete. Čtvercový formát pro příspěvek na sociální síť, širokoúhlý pro banner na web, na výšku pro mobilní tapetu. Většina generátorů nabízí volbu poměru stran přímo v rozhraní jako samostatnou možnost mimo textové pole, ale někdy jde zadat i slovně, třeba „na výšku, formát vhodný pro mobilní telefon”.

Pokud generátor umožňuje zadat i přibližné rozlišení nebo kvalitu výstupu, vyšší hodnota obvykle znamená delší dobu generování a někdy i vyšší náklady, pokud služba účtuje podle spotřeby. Pro rychlé testování nápadu stačí nižší kvalita, na finální verzi, kterou chcete tisknout nebo použít ve velkém formátu, zvolte nejvyšší dostupnou možnost.

Iterace: jak obrázek postupně doladit

Stejně jako u textových promptů, ani u obrázků nemusí sedět první pokus. Většina nástrojů umožňuje generovaný obrázek dál upravovat popisem změny, místo abyste psali celý prompt znovu od začátku. „Ponech kompozici, ale změň barvu oblohy na večerní” nebo „přibliž záběr víc na postavu v popředí” jsou typické doplňující instrukce.

Některé generátory nabízejí i takzvané inpainting, tedy možnost označit konkrétní část obrázku myší a popsat, co se v tom výřezu má změnit, zatímco zbytek obrázku zůstane netknutý. Tahle funkce se hodí, když je devadesát procent obrázku v pořádku a jen jeden detail, třeba ruka nebo pozadí, nesedí.

Praktický postup, který mi funguje nejlíp: nejdřív vygenerovat několik variant s jednodušším promptem, vybrat tu kompozičně nejbližší představě, a teprve tu dál doladit detailním popisem. Snažit se trefit dokonalý výsledek na první zadání obvykle vede jen k opakovanému přepisování dlouhého promptu od nuly.

Na co si dát pozor

Generátory obrázků mají dodnes potíže se specifickými detaily, hlavně s rukama, textem uvnitř obrázku a fyzikálně přesnými odrazy nebo stíny. Pokud potřebujete obrázek s čitelným textem, například pro plakát, počítejte s tím, že bude pravděpodobně potřeba text dodat dodatečně v grafickém editoru.

Druhá věc: u komerčního použití vygenerovaných obrázků si ověřte licenční podmínky konkrétního nástroje. Pravidla ohledně vlastnictví a použití výstupů se mezi jednotlivými službami liší a v čase se mění, takže se nedají zobecnit jednou platnou odpovědí.

Shrnutí

Dobrý obrazový prompt popisuje scénu vrstvu po vrstvě: subjekt, prostředí, kompozici, osvětlení a styl. Čím konkrétnější popis, tím míň prostoru zbývá generátoru domýšlet a tím blíž bude výsledek vaší představě. Vyzkoušejte si rozdíl na jednom obrázku podle vzoru výše, rozdíl mezi slabým a silným zadáním uvidíte hned na první generování.