První klip ze Sory jsem si pustil ztlumeně, ze zvyku. U generovaného videa nikdy nic slyšet nebylo, tak proč zesilovat. Trvalo mi pár vteřin, než mi došlo, že si tím odřezávám půlku výsledku. Ve scéně čekala žena v pláštěnce pod plechovým přístřeškem zastávky. Pršelo a kolem projel autobus. Se zapnutým zvukem tam byl déšť bubnující do plechu i to, jak voda odstříkla zpod kol. Zadání mělo dvě věty. Nenatáčel to nikdo a ruchy k tomu nikdo nedodělával.
Právě zvuk je na druhé generaci Sory to nové. Převádět text na video uměly modely i dřív, jenže výsledek byl němý a hudbu i ruchy si k němu člověk sháněl sám v editoru, nadšení z prvního povedeného klipu ale vydrží zhruba tři generování. Pak přijde scéna, kterou model odmítne nebo ji udělá po svém, a od té chvíle je užitečnější vědět, co po Soře nemá smysl chtít. Ještě jeden pojem na začátek, ať se v tom neztratíte. Text-to-video znamená přesně to, co říká: na vstupu je popis scény větami, na výstupu hotový videoklip. Žádná časová osa, žádné ruční dolaďování jednotlivých snímků. Píšete zadání a čekáte.
Rozdíl, který je slyšet
OpenAI představilo Soru 2 na konci září 2025 spolu se samostatnou aplikací. Hlavní změnu proti první verzi shrne jedna věta: model generuje obraz a zvuk najednou. Repliky postav, kroky, ruch ulice, dozvuk v místnosti. Zvuk se nepřilepuje k hotovému videu, vzniká s ním zároveň. Té schopnosti pracovat s několika druhy dat současně se odborně říká multimodalita a Sora je její dost názorná ukázka.
Druhá změna se hledá slovy hůř, zato se pozná rychle. Předměty a postavy se chovají věrohodněji ve chvíli, kdy se něco nepovede. Když hráč v záběru netrefí koš, míč se odrazí od desky. Starší modely měly sklon výsledek po svém „opravit“ a míč prostě skončil v síti, protože takhle sportovní záběry obvykle vypadají.
Pozor na to, jak si tohle přeložíte. Model fyzice nerozumí. Odhaduje, jak podobný záběr vypadá, a odhaduje ho líp než dřív. Jakmile po něm chcete situaci, kterou lidé běžně nenatáčejí, iluze se rozpadne během vteřiny.
Kde Soru najdete a co k tomu potřebujete
Ke generování stačí účet u OpenAI, tedy stejný, se kterým se přihlašujete do ChatGPT. Co všechno k tomu účtu patří vedle chatu, shrnuje přehled, co umí ChatGPT. Sora existuje ve webové podobě a jako mobilní aplikace. Aplikace je zároveň sociální síť. Má feed s videi ostatních lidí, lajky, sdílení a všechno, co k tomu patří. Komu jde jen o vlastní klipy, tomu to po pár dnech leze na nervy, protože se k tvorbě prokousává cizí zábavou. Na webu je klid a lépe se tam píšou delší zadání.
Dostupnost se liší podle země a v čase se měnila. Sora se rozjížděla nejdřív ve Spojených státech a Kanadě, další trhy se přidávaly postupně. Aktuální stav si tedy ověřte přímo ve svém účtu, ne podle půl roku starého článku (včetně tohohle), stejně opatrní buďte u limitů. Kolik generování máte zahrnutých, jak dlouhý klip svede placený tarif a v jakém rozlišení, se u těchhle služeb mění po měsících.
Placená varianta obvykle znamená delší klipy, vyšší rozlišení a kratší čekání ve frontě. Pro první seznámení to nepotřebujete. Potřebujete trpělivost, protože ve špičce se čeká.
Vývojáři se k modelu dostanou i přes API, tedy programové rozhraní, kterým se generování volá z vlastní aplikace. Účtuje se jinak než běžný tarif a pro první video to rozhodně řešit nemusíte.
První video krok za krokem
Postup je krátký. Zajímavé věci se dějí až u třetího bodu.
- Přihlaste se do Sory účtem OpenAI a otevřete tvorbu nového videa.
- Vyberte poměr stran a délku. Na výšku pro mobil, na šířku pro web a projekci. Delší klip spotřebuje víc z vašeho limitu a déle se generuje.
- Napište zadání. Konkrétní scéna, ne téma. Rozdíl mezi „vaření“ a „muž krájí cibuli v ranní kuchyni“ rozhodne o výsledku víc než všechna ostatní nastavení dohromady.
- Spusťte generování. Podle vytížení to trvá desítky sekund až jednotky minut.
- Výsledek si pusťte na celou obrazovku a se zvukem. Na malém náhledu v telefonu vypadá dobře skoro všechno.
- Co se nepovedlo, neopravujte v hlavě. Použijte úpravu hotového klipu (v aplikaci se jí říká remix) nebo přepište v zadání jeden detail a pusťte to znovu.
- Video stáhněte. V souboru zůstane vodoznak, k tomu se ještě dostaneme.
Nejčastější chyba začátečníka nemá s technikou nic společného, lidé napíšou scénář na půl minuty a čekají, že se vejde do desetisekundového klipu. Model si poradí po svém: vezme začátek, zbytek zahodí a vy máte pocit, že vás neposlouchá. Přitom jste mu zadali víc, než se do stopáže vejde.
Počítejte také s tím, že první pokus bývá k ničemu. Já mám z pěti generování obvykle jedno, které bych někomu ukázal, a jedno další, které jde použít po zkrácení. Kdo čeká hotový výsledek napoprvé, bude zklamaný.
Vyplatí se proto první pokusy dělat krátké a v nižším nastavení. Až když scéna sedí a víte, že vám zadání odpovídá, pusťte ji znovu delší a ve vyšší kvalitě. Ušetříte si čekání i limit.
Prompt, který nekončí náhodným klipem
Zadání pro video má proti zadání pro obrázek dvě vrstvy navíc. Vedle toho, co je v záběru, řešíte pohyb a zvuk. Držte se přitom čtyř věcí:
- kdo nebo co je v záběru, jak to vypadá a kde to stojí,
- jedna akce, která se během těch několika sekund stane,
- odkud a jak se na scénu díváte, tedy kamera a světlo,
- co je slyšet a co slyšet být nemá.
Slabé zadání: „muž vaří v kuchyni“.
Použitelné zadání: „Střední záběr, šedesátiletý muž v kostkované košili krájí cibuli na dřevěném prkénku v malé panelákové kuchyni. Ranní světlo z okna vlevo, kamera se velmi pomalu přibližuje. Slyšet je krájení, syčení pánve a tiché rádio v pozadí. Bez hudby, bez titulků.“ Ta poslední věta není zbytečná. Generátory rády doplní hudební podkres a nápisy, o které nikdo nestál. Zákaz zabere jen někdy, ale zabere.
Ještě jeden příklad, tentokrát bez lidí, protože ti se generují nejhůř. „Hladina rybníka za svítání, nízká mlha nad vodou, kamera se pomalu posouvá doleva, v dálce zakráká volavka, jinak ticho.“ Krajina, voda a mlha patří k tomu, co Soře jde nejlíp. V takovém záběru nemá co zkazit na anatomii ani na nápisech.
Když chcete, aby postava něco řekla, napište repliku doslova a v uvozovkách, ideálně krátkou. Do deseti sekund se vejde jedna věta, ne dialog dvou lidí. Delší repliku model zkrátí nebo ji zrychlí do nesrozumitelna.
Když se výsledek nepovede, měňte v zadání vždycky jen jednu věc a pusťte generování znovu. Kdo přepíše rovnou půlku promptu, nikdy nezjistí, co vlastně zabralo. Nejrychleji se na výsledku projeví změna kamery a světla. Nejhůř se prosazují zákazy, protože model občas udělá přesně to, co jste zakázali. U obrázku popisujete stav, u videa děj. Zbytek řemesla se ale hodně překrývá, takže kdo si prošel návod, jak napsat prompt pro generování obrázku, začíná u videa s náskokem.
A dvě věci z vlastního zkoušení. Anglické zadání mi dává o něco stabilnější výsledky než české, i když model česky rozumí. Českou repliku zadávejte jen tehdy, když vám nevadí přízvuk znějící jako čtení z fonetického přepisu. U ruchů a hudby je jazyk jedno, potíž dělá mluvené slovo.
Cameo: vlastní obličej jako rekvizita
Funkce, kvůli které se o aplikaci nejvíc mluvilo, se jmenuje cameo. Jednou nahrajete krátké ověřovací video, ve kterém podle pokynů otočíte hlavu a něco přečtete. Aplikace si tím ověří, že jste to opravdu vy a že před kamerou stál živý člověk, ne fotka podržená před objektivem. Od té chvíle můžete sami sebe vkládat do generovaných scén a stejné právo dát vybraným lidem. Souhlas jde kdykoli odvolat. A uvidíte i videa, ve kterých vaše podoba vystupuje, přestože je vytvořil někdo jiný z těch, komu jste přístup dali.
Beru to jako rozumně navržený mechanismus, který ale nikdo nevymyslel z lásky k soukromí. Vznikl proto, že generovat cizí tvář je nejkratší cesta k průšvihu. Obličej z fotky, snímek obrazovky z videohovoru ani portrét kolegy do Sory nenahrávejte. Ověření tam je přesně proto, aby se to nedělalo. Kdo chce vědět, co dělat, když se jeho tvář objeví někde, kde být neměla, najde postup v textu o bezpečnosti a soukromí u AI.
Pět záběrů, pět různých košil
Sora generuje krátké klipy, běžně v řádu jednotek až desítek sekund podle tarifu. Delší vyprávění z nich musíte poskládat sami, a právě tam začíná potíž.
Ve webové verzi bývá k dispozici i práce s časovou osou, kde rozložíte pokyny na navazující úseky. Dostupnost téhle funkce se liší podle tarifu, takže se podívejte, co konkrétně máte v účtu. Druhá cesta je vygenerovat několik klipů zvlášť a sestříhat je v běžném editoru.
Tady narazíte na to, co zlobí nejvíc, tedy na kontinuitu. Ten samý člověk vypadá v každém klipu trochu jinak. Košile změní odstín, kuchyň má jinak vysoké skříňky, světlo přijde z druhé strany. Na dvou záběrech si toho nevšimnete, na pěti ano. Lidé, kteří ze Sory dělají delší věci, si proto popis postavy uloží jako přesnou formulaci a používají ji pořád stejnou, slovo od slova. Pomůže to, ale nespasí.
Co Soře pořád nejde
- Text v obraze. Nápisy na cedulích a obalech vycházejí zkomolené a u delších slov to nespraví ani desáté opakování.
- Jemná motorika. Ruce, prsty na nástroji, práce s drobnými předměty a nářadím. Klasika, se kterou generátory bojují od začátku.
- Česká mluva. Rozumí, ale mluví s přízvukem.
- Reálné osoby a chráněné postavy. Po vlně stížností držitelů práv se pravidla utáhla a část zadání skončí odmítnutím.
- Odmítnutí obecně. Moderace je opatrná a občas zablokuje i nevinnou scénu. Přeformulování většinou pomůže.
- Přesnost zadání. Když napíšete pět požadavků, model splní tři a na dva zapomene.
Většina těch omezení jde obejít, když s nimi počítáte dopředu. Nápisy do videa nezadávejte promptem, dopište je potom v editoru. Českou repliku si namluvte sami a v Soře generujte jen obraz s ruchy, detail rukou nahraďte polocelkem, kde na prstech tolik nesejde.
Nic z toho nedělá ze Sory špatný nástroj. Jen to posouvá, na co ji použít. Atmosférický záběr, vtip pro kamarády nebo ilustrační video do prezentace ano. Firemní video, kde musí sedět logo, produkt a text na obrazovce, ne.
Komu se to vyplatí a komu ne
Sora 2 dává největší smysl lidem, kteří potřebují krátký obrazový nápad a nemají štáb. Kreativec si v ní udělá hrubý náčrt scény dřív, než někdo zaplatí kameramana. Učitelka si vyrobí ilustrační záběr, který by jinak sháněla ve fotobance. Na sociální sítě to sedí, protože formát je krátký a divák je zvyklý na leccos.
Nesedí to tam, kde jde o přesnost. Dokument, produktové video, cokoli, co má o skutečném světě něco tvrdit. Vygenerovaná scéna se tváří jako záznam reality a není jím. Rozdíl mezi ilustrací a záznamem přestává být na první pohled vidět. To je hlavní důvod, proč jsou u videa pravidla přísnější než u generovaných obrázků.
Kdo hledá jistotu, že mu výsledek projde u klienta bez připomínek, ať zatím zůstane u kamery. Kdo si chce zkusit, co dnešní modely svedou, má v Soře nejrychlejší cestu.
Na co si dát pozor
Stažené video nese pohyblivý vodoznak a v souboru zůstávají údaje o původu podle standardu C2PA, tedy podle společného značení, ke kterému se přihlásila velká část technologických i mediálních firem včetně OpenAI. Nástroje na odstranění vodoznaku se objevily prakticky hned. Odstraňovat ho je v rozporu s podmínkami služby a stopa v metadatech tam často zůstane i po něm.
Když AI video zveřejňujete, napište to k němu. Platformy si označení postupně vynucují samy a divák, který na původ přijde až po vás, si to bude pamatovat.
U komerčního použití si přečtěte podmínky, které platí pro váš tarif a zemi, práva k výstupu a rozsah dovoleného použití se u generátorů liší a mění se. Neřiďte se tím, co platilo u jiného nástroje nebo co jste četli loni.
A poslední věc. Vygenerovaná scéna z místa, kde se opravdu něco stalo, nadělá víc škody než užitku, i když to myslíte dobře. Zpravodajské situace, nehody, soudní spory a všechno, kde si lidé mohou video splést se záznamem, raději nechte být.
Shrnutí
Sora 2 je generátor krátkých scén se zvukem, ne filmová kamera. Napište konkrétní scénu, popište kameru, světlo i zvuk, počítejte s několika pokusy a delší video složte z kratších kusů. Vlastní podobu si ohlídejte přes cameo a cizí tvář do aplikace netahejte.
Než začnete generovat, položte si jednu otázku: šlo by ten záběr natočit telefonem za pět minut? Když ano, natočte ho. Sora se vyplatí tam, kde by natáčení znamenalo štáb, cestu a rozpočet, který nikdo nedá.