Do pole na zadání jsem napsal jednu větu: starší pán v montérkách stojí v dílně, otočí se ke kameře a řekne „tak tohle jsem nečekal“. Za necelé dvě minuty jsem měl osmivteřinový klip. Pán se otočil, rty se hýbaly v rytmu té repliky, v pozadí bzučela zářivka a někde vzadu cvaklo železo o ponk. Zvuk jsem přitom nikam nezadával. Vznikl současně s obrazem, ze stejného modelu.
Tím se Veo liší od generátorů, které dodají němý obraz a ozvučení nechají na vás. Za tu pohodlnost ale platíte jinde: osmi vteřinami stopáže a hlasem, který si nevyberete.
Zvuk, který nikdo nepřidával
Veo je model pro generování videa od Google DeepMind. Aktuální verze nese označení Veo 3.1 a její hlavní argument je právě zvuková stopa. Model vyrobí ruchy prostředí, kroky, vítr, provoz za oknem, hudbu, když si o ni řeknete, a mluvené repliky postav i s přibližně sedící artikulací.
Zní to jako detail. Není. Do loňska vypadala běžná práce s AI videem tak, že jste vygenerovali obraz a pak sháněli zvuk zvlášť. Ruchová knihovna, generátor hlasu, střihový program, ruční synchronizace. Většina lidí to vzdala u druhého kroku a video pustila s hudbou přes celé, protože to bylo rychlejší. Kdo se zvukem pracuje pravidelně, najde přehled samostatných nástrojů v textu o generování hlasu a hudby pomocí AI. U Veo 3.1 se zvuk generuje vždycky, není to přepínač, který byste zapomněli zapnout. Což má i odvrácenou stranu: když chcete čistý obraz bez ruchů, musíte zvukovou stopu odstranit až potom.
Jednu věc od modelu nečekejte.
Nevyberete si konkrétní hlas. Napíšete, že postava mluví unaveně a chraplavě, a model vám nějaký takový hlas přidělí. Při dalším generování stejného zadání může znít jinak. Casting je tady loterie a musíte s ní počítat.
Kde Veo najdete a čím se ta místa liší
Veo není samostatná aplikace s vlastním přihlášením. Sedí uvnitř několika produktů Googlu a záleží na tom, který si vyberete.
Aplikace Gemini je nejjednodušší vstup. Napíšete zadání do chatu jako kterýkoli jiný dotaz a video se vygeneruje přímo v konverzaci. Nic se nenastavuje, nic se neskládá. Hodí se, když chcete jeden klip a nemáte ambici ho dál upravovat. Přihlášení a základní ovládání celé aplikace popisuje návod na Gemini.
Flow je nástroj postavený rovnou kolem generování videa. Najdete tam skládání scén za sebe, prodlužování klipů, práci s referenčními obrázky a vkládání objektů do hotového záběru. Google ho popisuje jako kreativní studio a odpovídá tomu i rozhraní, které víc připomíná střižnu než chat. Používat ho můžou lidé od osmnácti let a dostupnost se liší podle země.
Google AI Studio a Gemini API míří na vývojáře. Tady se generování volá z kódu, dá se to zapojit do vlastní aplikace nebo dávkově vyrobit padesát variant jedné reklamy. Pro běžného čtenáře zbytečné, pro firmu, která chce videa vyrábět ve velkém, jediná rozumná cesta.
Google Vids je pracovní nástroj na videoprezentace, kde se generovaný záběr použije jako součást delšího firemního videa.
Uvnitř těchto míst narazíte ještě na víc variant samotného modelu. Vedle plné verze nabízí Google odlehčené řady Fast a Lite. Sázejí na rychlost a kvality plné verze nedosahují. U varianty Lite k tomu odpadá část funkcí, mimo jiné nejvyšší rozlišení a prodlužování klipu. Na rychlé ohmatání kompozice se hodí, na finální záběr do reklamy spíš ne.
Kolik toho vygenerujete, určují kredity. Bezplatná varianta Flow má denní příděl, placené tarify Google AI (Plus, Pro a Ultra) měsíční. Konkrétní čísla i ceny se liší podle země a Google je průběžně mění, takže je má smysl ověřit přímo v tarifech, ne v článku. Počítejte s tím, že kredit spotřebuje i pokus, který se nepovede.
Zadání, ze kterého vyleze použitelný klip
Prompt pro video se píše jinak než dotaz do chatbota. Nechcete odpověď, chcete záběr. Model tedy potřebuje vědět, co má v obraze být, jak se to hýbe, odkud se na to díváme a jak to zní. Osvědčila se mi tahle kostra:
- Kdo nebo co je v záběru, včetně vzhledu a oblečení.
- Kde se scéna odehrává a v jakou denní dobu.
- Jaký je pohyb postavy nebo objektu, jedna jasná akce.
- Co dělá kamera, jestli stojí, jede, obletuje.
- Jaké je světlo, protože světlo dělá s výsledkem víc než většina ostatních slov.
- Jak to zní, tedy ruchy a případná replika.
Repliku pište do uvozovek. Dokumentace Googlu na to upozorňuje výslovně a v praxi to funguje: text v uvozovkách model bere jako mluvené slovo, zbytek jako popis.
Ukázka zadání, které mi dalo použitelný výsledek:
Detailní záběr na ruce pekaře, který sype mouku na dřevěný stůl v malé pekárně, časné ráno, teplé světlo z jednoho okna zprava. Kamera pomalu jede zprava doleva, mělká hloubka ostrosti. V pozadí tiše hučí trouba a šustí papírové sáčky. Pekař polohlasně řekne: „Ještě chvilku.“
Všimněte si, co v zadání není. Není tam druhá postava, není tam změna prostředí a není tam příběh se začátkem a koncem, do osmi vteřin se vejde jedna situace. Když jsem se tam pokoušel nacpat dvě akce po sobě, model si vybral jednu a druhou odbyl, nebo je smíchal do nesmyslu.
Pro srovnání zadání, se kterým nepochodíte: „hezké video o naší pekárně, ať to vypadá profesionálně“. Model z něj nepozná, kde stojí kamera ani co se má hýbat, a vrátí obecnou reklamní vatu, jakou jste viděli stokrát. Přídavná jména typu profesionální, moderní nebo kvalitní mu neříkají nic. Slovesa a konkrétní podstatná jména ano.
Hodně z těchto principů se přenáší z generování obrázků. Kdo si je osahal na statické grafice, má napůl vyhráno. Podrobněji je rozebírá text o tom, jak napsat prompt pro generování obrázku. Ještě jedna věc z praxe. Když se první výsledek netrefí, nepřepisujte celé zadání. Změňte jednu věc, typicky světlo nebo pohyb kamery, a pusťte generování znovu. Model má v sobě dost náhody na to, abyste po přepsání pěti slov najednou nepoznali, které z nich výsledkem pohnulo.
A pak je tu čeština. Model ji zvládne, ale u mluvených replik mi výslovnost občas ujela do podivného přízvuku, u delší věty se to pozná víc než u dvou slov. Kdo potřebuje čistý český dabing, udělá líp, když nechá video němé a hlas doplní zvlášť.
Osm vteřin je málo. Co se s tím dá dělat
Veo 3.1 generuje klipy dlouhé čtyři, šest nebo osm vteřin. Rozlišení si volíte mezi 720p, 1080p a 4K. Poměr stran je klasický 16:9, nebo na výšku 9:16 pro sociální sítě.
Podmínka kolem délky funguje obráceně, než by člověk čekal. Jakmile sáhnete po 1080p nebo 4K, po referenčních obrázcích nebo po prodlužování klipu, délka musí být osm vteřin. Kratší varianty tedy zůstávají u 720p. Delší video se skládá. Model umí navázat na konec existujícího klipu a přidat dalších sedm vteřin, a tohle prodloužení jde podle dokumentace opakovat až dvacetkrát. Na papíře se tak dostanete k necelým dvěma a půl minutám v jednom kuse.
Háček je v rozlišení. Prodlužovat se dá jen v 720p, takže dlouhá stopáž a maximální kvalita se navzájem vylučují. Druhý háček je v tom, že s každým navázáním se výsledek trochu vzdaluje od původního záběru. Osvětlení se posune a obličej se lehce promění, u oblečení začne materiál žít vlastním životem. Po třetím prodloužení už to na velké obrazovce poznáte.
Praktická rada z toho plyne jednoduchá: berte Veo jako generátor záběrů, ne jako generátor filmů. Šest samostatně vygenerovaných záběrů, sestříhaných za sebe v běžném editoru, vypadá skoro vždycky líp než jeden dvacetivteřinový, který vznikl trojím prodlužováním.
Když nechcete začínat od prázdné plochy
Textové zadání je jen jeden ze vstupů. Zajímavější věci začnou, když modelu dáte obrázek.
Z fotky do videa. Nahrajete snímek a popíšete, co se má stát. Produkt na stole se rozzáří, člověk na portrétu se nadechne a otočí hlavu, statická krajina dostane mraky, které se hýbou. Pro firmy je tohle nejpraktičtější použití, protože výchozí obraz je jejich skutečný produkt, ne vymyšlený.
První a poslední snímek. Zadáte dva obrázky, počáteční a koncový, a model dopočítá cestu mezi nimi. Hodí se na přechody a na proměny, kde víte, kde záběr začíná a kde má skončit.
Referenční obrázky. Ve Flow se jim říká ingredience. Nahrajete několik snímků postavy, předmětu nebo výtvarného stylu a model se jich drží napříč generováním. Právě tohle částečně řeší starý problém AI videa, kdy se hlavní hrdina v každém záběru trochu proměnil.
Flow k tomu přidal i vkládání objektů do hotové scény, včetně dopočítaných stínů a nasvícení, a v ohlášeních se mluvilo také o mazání nechtěných prvků. Fungovat to bude různě podle záběru. U jednoduchého pozadí je výsledek slušný, u složité scény s odrazy si model vymyslí nesmysl.
Kde to pořád drhne
Veo je dobré. Není neomylné a slibovat opak by bylo nefér.
Nejnápadnější slabinou zůstává text v obraze. Cedule, etikety, nápisy na tričku. Model je namaluje tak, že na první pohled vypadají správně, a při zastavení jsou z toho písmena, která v žádné abecedě neexistují. Když v záběru potřebujete čitelný nápis, počítejte s dodatečnou úpravou. Druhou slabinou jsou složité interakce. Ruka, která bere předmět do dlaně, prsty, které něco pevně drží, dvě postavy, které si něco podávají. Fyzika se ve Veo 3.1 znatelně zlepšila, ale právě tady se pořád objevují drobné chyby. Při běžném přehrání si jich nevšimnete, při zpomalení vás praští do očí.
Třetí věc je nahodilost. Stejné zadání dá pokaždé trochu jiný výsledek. Neexistuje tlačítko „jako minule, ale s jinou kamerou“. Kdo chce konkrétní záběr, musí počítat s několika pokusy, a to stojí kredity i čas. Jedno generování zabere jednotky minut, u vyššího rozlišení klidně víc, takže z pěti variant jednoho záběru je půlhodina čekání u obrazovky.
A ještě jedna slabina, méně technická. Veo neumí režii. Umí záběr. Rozhodnutí, co má být vidět a proč, zůstává na člověku, a je to ta část práce, kterou model nesundá z ramen ani náhodou.
Na co si dát pozor
Každé video vygenerované modelem Veo nese neviditelnou značku SynthID, tedy technologii Googlu na označování a rozpoznávání obsahu vytvořeného AI. Značka se nedá jednoduše odstranit přeuložením souboru. Berte to jako fakt, se kterým při publikování počítáte, ne jako překážku. Pokud generujete přes Gemini API, hotové video zůstává na serveru dva dny a potom se maže. Stáhněte si ho hned. Ve Flow a v aplikaci Gemini vám videa zůstanou v účtu, ale i tam platí staré pravidlo: co chcete mít jistě, mějte u sebe.
Právní stránku nepodceňujte. Generování podoby konkrétního žijícího člověka, loga cizí firmy nebo postavy z filmu je problém bez ohledu na to, že to model technicky svede. Podmínky komerčního použití se navíc liší podle tarifu a země, takže než výstup nasadíte do placené kampaně, projděte si aktuální pravidla poskytovatele. Širší souvislosti okolo zneužití generovaného obsahu rozebírá text o bezpečnosti a soukromí u AI.
Pro koho se Veo nehodí? Pro toho, kdo potřebuje produkt vykreslený na milimetr a v přesných barvách. Pro dokumentární práci, kde má být obraz doložený. A pro každého, kdo počítá s tím, že si sedne k počítači a za odpoledne bude mít tříminutový film. Za odpoledne budete mít několik osmivteřinových záběrů, a jestli z nich vznikne film, rozhodne střih.
Shrnutí
Veo 3.1 vygeneruje nejvýš osmivteřinový klip i se zvukem, ruchy a mluvenou replikou. Spustíte ho v aplikaci Gemini, ve Flow, v Google Vids nebo přes API. Delší stopáž z něj poskládáte prodlužováním, nebo střihem několika samostatně vygenerovaných záběrů. Zadání pište jako popis jedné situace, repliku dejte do uvozovek a nesnažte se do osmi vteřin vměstnat příběh. Kdo chce začít dnes, ať zkusí tohle: vezměte jednu vlastní fotku, klidně produktu na stole nebo výhledu z okna, nahrajte ji do Flow a napište k ní jednu větu o tom, co se má rozhýbat. Za dvě minuty uvidíte víc než z deseti přečtených návodů. A až se výsledek objeví, pusťte si ho se zvukem. Právě tam je ten rozdíl, kvůli kterému se o Veo mluví.