Mám doma fotku dědy u motorky z roku 1974. Stojí v mírném předklonu, ruku na řídítkách, a tváří se, jako by za chvíli něco řekl. Vyfotil jsem ten papír telefonem, nahrál snímek do generátoru videa a připsal jednu větu: lehce se nadechne a otočí hlavu ke kameře. Po třech minutách se to stalo. Napodruhé se mu z rukávu vysunula třetí ruka.

Technika, které se říká image to video, tedy generování videa z obrázku, se dnes chová přesně takhle rozporuplně. Zvládne věci, které před dvěma lety uměly jen filmové ateliéry. A pak vám bez varování přidělá končetinu, protože jste jí nechali příliš volnosti.

Čím se video z fotky liší od videa z textu

Generátor videa umí pracovat ve dvou režimech a to, který si vyberete, mění skoro všechno.

Když zadáváte jen text, model si vymyslí celý záběr. Kompozici, obličeje, světlo, barvy, prostředí. Máte nad výsledkem malou kontrolu a při každém spuštění dostanete něco jiného. U image to video dáte modelu hotovou fotku, ta se stane prvním snímkem klipu a model už neřeší, co v záběru je. Řeší jedinou úlohu: co se v té scéně pohne a kam.

Představte si režiséra, který přijde na hotovou scénu. Kulisy stojí, herci jsou nalíčení, světla svítí. Jeho práce se zúží na to, komu řekne „teď se otoč“, právě proto vychází image to video spolehlivěji než volné generování z textu. Model má míň prostoru si vymýšlet.

Má to i odvrácenou stranu. Co je na fotce špatně, zůstane špatně i ve videu. Rozmazaný obličej zůstane rozmazaný, model ho neopraví, jen ho rozhýbe.

Jaká fotka se rozhýbe a jaká ne

Za rok zkoušení jsem si udělal jednoduché síto.

Funguje snímek, který má jeden zřetelný hlavní motiv, ostré hrany a dost velké rozlišení. Postava, zvíře, auto, strom ve větru, hladina vody. Kolem motivu by měl být prostor, do kterého se může pohyb rozvinout. Neuspějete se skupinovou fotkou z dovolené, kde je na pláži dvacet lidí. Model neví, komu má dát přednost, a rozhýbe všechny naráz. Výsledek vypadá jako mumraj z hororu.

Špatně dopadají i snímky s výrazným rozostřením pozadí, protože model si tu měkkou plochu vyloží po svém a začne v ní tvořit obrazce. Fotky v ostrém protisvětle, kde je postava jen silueta, taky ne. A screenshoty, plakáty nebo koláže s textem skončí nečitelnou změtí písmen, protože písmo je pro generátory videa dodnes noční můra.

Se starými papírovými fotkami se to dá zachránit. Snímek nejdřív vyčistěte, doostřete a případně zvětšete rozlišení, teprve pak ho posílejte do generátoru. Postupy popisuje článek o úpravě fotek pomocí AI, u dědovy fotky mi právě odstranění zrnitosti pomohlo víc než pět dalších pokusů se zadáním.

Postup, který dá použitelný klip

  1. Vyberte snímek s jedním jasným motivem. Ideálně na výšku nebo na šířku podle toho, kde video skončí. Ořezávat ho potom už nechcete, generátory pracují v pevných poměrech stran.
  2. Nahrajte ho do režimu pro video z obrázku. V rozhraní bývá označený jako Image to Video nebo prostě jako pole pro nahrání souboru vedle pole na zadání.
  3. Popište jediný pohyb. Ne tři. Jeden. „Muž pomalu otočí hlavu doprava“ projde, „muž otočí hlavu, zvedne ruku a usměje se“ se rozpadne v polovině klipu.
  4. Přidejte pohyb kamery, pokud ho chcete. Pomalé přiblížení nebo posun do strany dodá klipu filmový dojem. Kombinace pohybu kamery a pohybu postavy naráz je nejčastější příčina podivností.
  5. Nechte vygenerovat nejkratší variantu. Pětivteřinový klip stojí nejmíň kreditů a řekne vám, čemu model nerozuměl. Až pak jděte do delší a kvalitnější verze.
  6. Poznamenejte si zadání, které vyšlo. Za tři dny si ho nevybavíte a povedený popis pohybu je to jediné, co se z pokusů dá skutečně recyklovat.

Většina nástrojů umí i variantu se dvěma snímky, kdy nahrajete první a poslední obrázek a model dopočítá cestu mezi nimi. Hodí se to na proměny: prázdná a plná místnost, zima a léto ze stejného místa, portrét zepředu a z profilu. Výsledek bývá stabilnější, protože model má oba konce pevně dané a nemá kam utéct.

Prompt popisuje pohyb, ne obsah

Tohle je věc, kterou většina lidí napoprvé splete. Do zadání napíšou, co na fotce vidí. Model to ale vidí taky. Potřebuje vědět, co se má změnit. Osvědčila se mi krátká kostra: kdo se hýbe, jak se hýbe, co dělá kamera, jaké je světlo. Třeba takhle:

Muž u motorky se pomalu nadechne a otočí hlavu ke kameře. Kamera se nepatrně přibližuje. Jemný vítr v listí na pozadí, klidný přirozený pohyb, letní odpolední světlo.

Do pole pro negativní prompt, tedy pro popis toho, co ve videu vidět nechcete, patří obvyklí podezřelí: deformované ruce, změna obličeje, text v obraze, náhlý střih, roztřesená kamera. Dvě věci mi zabraly nejvíc. Zaprvé psát zadání anglicky. Česky vám rozumí skoro všechny generátory, ale u popisů pohybu bývá anglická verze poslušnější. Zadruhé nepsat román. Tři až čtyři věty model navedou, odstavec na šest řádků ho rozhodí.

Kde to zkusit a co dostanete zdarma

Bezplatné tarify se u generátorů videa liší mnohem víc, než by člověk čekal, a mění se každých pár měsíců. Tenhle přehled odpovídá stavu k srpnu 2026, před registrací si ceník projděte znovu.

Kling dává bezplatným účtům denní příděl kreditů, který se každé ráno obnoví. Pro občasné zkoušení je to nejpříjemnější model, protože nemáte pocit, že utrácíte poslední zásobu. Kling je zároveň na rozpohybování fotky obzvlášť silný a má štětec, kterým ručně vyznačíte, co se má hýbat. Podrobně ho rozebírá samostatný návod na Kling AI.

Runway funguje jinak. Bezplatný účet dostane 125 jednorázových kreditů, které sice nevyprší, ale taky se neobnoví. Vystačí na pár krátkých klipů a pak jste na konci. Placené tarify začínají na 12 dolarech měsíčně při roční platbě. Runway zato nabízí vlastní modely Gen-4.5 a Gen-4 Turbo a vedle nich i cizí modely včetně Klingu, Veo a Seedance, takže z jednoho rozhraní vyzkoušíte několik generátorů naráz.

Veo 3.1 od Googlu se dostalo do aplikace Gemini 13. ledna 2026 spolu s funkcí Ingredients to Video, která pracuje s referenčními obrázky. Nahrajete postavu, objekt a pozadí, a model je poskládá do jednoho záběru se zachováním podoby postavy napříč klipy. Pro lidi, kteří potřebují stejnou tvář ve více záběrech, je to zatím nejpohodlnější cesta.

Luma naopak bezplatnou variantu na ceníku vůbec neuvádí. Nejlevnější tarif s modely řady Ray3 stojí 30 dolarů měsíčně. Kdo chce jen zkusit, jestli ho image to video baví, začne jinde.

Rozdíl mezi denním přídělem a jednorázovými kredity zní jako detail, ale rozhoduje o tom, jestli si techniku osaháte. Použitelný klip mi obvykle zabere tři až šest pokusů. Se 125 kredity, které se neobnoví, si tedy pořádně vyzkoušíte jednu jedinou fotku.

Kde generátory pořád selhávají

Ruce zůstávají problémem číslo jedna. Prsty v rychlejším pohybu se slévají, množí a mizí. Když má postava na fotce ruce v záběru, počítejte s tím, že polovina pokusů skončí v koši. Obličej mezi prvním a posledním snímkem občas ujede. Postava na konci klipu vypadá jako sourozenec té na začátku, u rodinných fotek to zamrzí nejvíc, protože právě tam poznáte i milimetrový rozdíl.

Fyzika drží dobře u vody, látky a listí. Selhává u složitých mechanismů, u chůze v davu a u čehokoliv, co má být v záběru dvakrát ve stejné podobě. A délka. Klipy se dnes počítají na vteřiny, ne na minuty. Kdo si naplánuje, že večer vyrobí minutovou vzpomínkovou koláž z deseti záběrů, skončí nad ránem se čtyřmi použitelnými.

Na co si dát pozor

Fotky žijících lidí jsou první zastávka. Rozpohybovat snímek kolegy tak, aby na videu mrkal a mluvil, je technicky triviální a lidsky citlivé. Bez jeho souhlasu to nedělejte a hotové video nikdy nešiřte jako záznam skutečné události. U fotek zemřelých příbuzných je to jiné, ale ne jednodušší. Rozhýbaná fotka babičky umí zasáhnout mnohem hlouběji, než čekáte, a ne vždy příjemně. Než takový klip pošlete do rodinné skupiny, zeptejte se, jestli o něj ostatní stojí. Já jsem dědovu motorku nakonec nikam neposlal.

Evropská pravidla už jsou v platnosti. Nařízení AI Act ukládá v článku 50 poskytovatelům systémů, které generují syntetický obraz, zvuk, video nebo text, povinnost označit výstup strojově čitelným způsobem tak, aby šel rozpoznat jako uměle vytvořený. Tahle část nařízení se používá od 2. srpna 2026. Jak konkrétně to váš nástroj řeší, zjistíte v jeho nápovědě. Soukromí bych taky nepodceňoval. Fotka, kterou nahrajete, odchází na cizí server a stává se součástí provozu služby. U dokladů, pracovních materiálů a snímků dětí zvažte, jestli vám ten pětivteřinový klip za to stojí.

Poslední věc jsou podmínky komerčního užití, ty se řídí zvoleným tarifem a u bezplatných variant bývají výrazně omezené, často včetně vodoznaku ve výsledku. Než klip nasadíte na firemní web nebo do reklamy, projděte si aktuální licenční ujednání přímo u služby.

Čím začít dnes večer

Vezměte fotku, kterou znáte nazpaměť. Vlastní portrét, snímek psa, výhled z okna. Na známém obrázku okamžitě uvidíte, co model trefil a kde si vymýšlí. U cizí fotky to skoro nejde.

Napište jednu větu o jednom pohybu, nechte vygenerovat nejkratší klip a podívejte se, co se vrátí. Pokud vás výsledek zaujme, druhý pokus už bude o dost lepší, protože budete vědět, co model ze zadání přeslechl.

Ta dědova motorka se nakonec rozjela přesně tak, jak jsem si ji představoval. Tři vteřiny, jeden nádech, jedno otočení hlavy. Na technologii, která ještě před dvěma lety uměla hlavně slepovat rozmazané skvrny, je to slušný posun. Filmy z toho ale zatím nebudou.