Babiččin recept na buchtu měl na kartě rukopis, který dnes rozluští málokdo z rodiny. Vyfotil jsem ho mobilem, poslal fotku do chatbota a požádal ho, ať mi text přepíše a množství surovin převede z hrnků na gramy. Do minuty jsem měl čitelný recept i s přepočtem. Model přitom neuměl nic, co bych mu předtím musel vysvětlovat. Prostě se podíval na obrázek a rozuměl mu stejně samozřejmě, jako kdybych mu poslal větu.
Tahle schopnost pracovat s víc druhy vstupu najednou, textem, obrázkem, zvukem, se říká multimodalita. Tenhle text vysvětlí, co se za ní skrývá, na jakých konkrétních příkladech to funguje nejlíp a kde jsou aktuální hranice.
Modalita je jen jiné slovo pro způsob
Slovo multimodalita pochází z latinského modus, tedy způsob. Multimodální model umí zpracovat víc způsobů vstupu než jen text: fotografie, nákresy, hlasové nahrávky, někdy i video.
První velké jazykové modely, jako raný GPT-3, uměly jen jedno: číst a psát text. Když jste jim poslali fotku, nedokázaly s ní nic udělat, protože jejich vnitřní svět byl postavený čistě na slovech. Multimodální modely tenhle svět rozšířily o další smysly.
Změna přišla postupně. Nejdřív modely uměly popsat obrázek, pak k tomu přibyl zvuk, pak schopnost sledovat krátké video snímek po snímku. Dnešní velké modely od OpenAI, Googlu i Anthropic zvládají text, obrázek i zvuk v jednom rozhovoru bez přepínání mezi různými nástroji.
Jak model „vidí”, když nemá oči
Uvnitř modelu neexistuje žádný obrázek v tom smyslu, v jakém ho vidíte vy. Existují jen čísla.
Text se před zpracováním rozseká na tokeny a každý token se převede na vektor, tedy seznam čísel, který zachycuje jeho význam. Obrázek prochází podobným krokem: rozseká se na malé čtvercové výřezy, podobně jako byste fotku rozstříhali na dlaždice, a každá dlaždice se převede na vektor stejného druhu, jaký používá text. Technice, která tohle rozřezání a převod na čísla dělá, se říká vision transformer, obdoba textového transformeru uzpůsobená obrazu. Poprvé ji v roce 2020 popsal tým Google Research v článku nazvaném „An Image Is Worth 16x16 Words”. Název odkazuje přesně na tenhle princip: obrázek se rozřeže na čtverečky o velikosti šestnáct krát šestnáct pixelů a s každým z nich model zachází jako se slovem ve větě.
Jakmile má model text i obraz ve stejné číselné podobě, může s nimi pracovat společně, ve stejné vrstvě, stejným mechanismem. Neexistuje tak dvojí model slepený dohromady, jeden na text a druhý na obrázky. Existuje jeden model, který jen dostává vstup v různých převlecích. Tomu, jak model tyhle vektory vůbec vyrábí a proč to funguje, se podrobněji věnuje text o tom, jak funguje LLM.
Zvuk funguje obdobně. Nahrávka hlasu se rozseká na krátké úseky, ty se převedou na vektory a model s nimi počítá stejně jako s tokeny věty. Proto dnešní hlasový režim v chatbotech nezní jako starý převod „řeč na text a pak text na řeč”. Model často pracuje se zvukem přímo, což je i důvod, proč umí zachytit tón hlasu, přízvuk nebo pauzu, ne jen slova.
Rozumět a vytvářet je dvojí schopnost
Multimodalita znamená dvě různé věci a je snadné je zaměnit.
Rozumět víc druhům vstupu znamená, že model dokáže popsat fotku, přečíst graf v PDF nebo zareagovat na mluvenou otázku. Tohle dnes zvládají všechny velké chatboty. Vytvářet víc druhů výstupu znamená, že model sám vygeneruje obrázek, hlas nebo hudbu. Tahle část se donedávna nechávala na specializované nástroje.
Generování kvalitních obrázků ze slovního popisu má vlastní rodinu nástrojů a vlastní pravidla, jak psát zadání, což popisuje průvodce generováním obrázků. Generování hlasu, hudby a klonování hlasu má podobně vlastní přehled v textu o AI zvuku. Hranice mezi „chatbotem, co rozumí” a „generátorem, co tvoří” se ale rok od roku ztrácí, protože čím dál víc velkých modelů umí obojí přímo v jednom okně.
Kde se to hodí v praxi
Popis obrázku pomáhá nejvíc tam, kde by psaní zabralo víc času než vyfocení. Pojišťovací agent vyfotí poškozený nárazník a model rovnou navrhne popis škody pro formulář. Kuchař vyfotí obsah lednice a dostane pár nápadů na večeři z toho, co doma má. Senior s horším zrakem si nechá přečíst drobné písmo na letáku od lékárny nahlas.
Hlas se hodí tam, kde jsou ruce zaneprázdněné nebo psaní nejde. Řidič nadiktuje poznámku z porady, aniž by sundal ruce z volantu. Rodič ukládá dítě a šeptem požádá asistenta, ať najde ukolébavku. V mobilní aplikaci dnes jde vést i plynulý hlasový rozhovor, kdy model odpovídá zpátky hlasem, ne jen textem na obrazovce.
Kombinace kamery a hlasu má i míň všední, o to důležitější použití. Aplikace Be My Eyes spojila v roce 2023 nevidomé uživatele přímo s modelem od OpenAI: člověk namíří telefon na okolí, model nahlas popíše, co vidí, přečte štítek na konzervě nebo poradí, kudy vede volný průchod. Dřív na tohle sloužili dobrovolníci na druhém konci telefonátu, teď to zvládne telefon sám, kdykoliv ve dne v noci.
Kombinace obojího je běžná u kontroly dokumentů. Vyfotíte smlouvu, řeknete nahlas, na co se konkrétně ptáte, a model odpoví na základě obou vstupů zároveň. Student vyfotí zadání z matematiky, které nechápe, a místo výsledku si nechá rozepsat postup krok za krokem. Turista vyfotí jídelní lístek v cizím jazyce a model mu ho rovnou přeloží i s vysvětlením, co která položka znamená.
Novinkou poslední doby je živý režim, kterým se chlubí ChatGPT i Gemini. Telefon díky němu sleduje obraz z kamery nepřetržitě a model komentuje, co vidí, v reálném čase, podobně jako průvodce, který jde s vámi a mluví průběžně, ne až na konci prohlídky. Zatím to funguje nejlíp na jednoduché úkoly, popis okolí, pomoc při sestavování nábytku podle návodu, kontrola, jestli je zapojený kabel na správném místě.
Podobný princip stojí i za vyhledáváním podle obrázku místo slov. Vyfotíte rostlinu na parapetu, houbu v lese nebo součástku z rozebraného spotřebiče a model rovnou odpoví, co na fotce je, místo aby člověk hádal, jak tu věc vůbec pojmenovat do vyhledávače. U hub je ale na místě zdrženlivost. Nejistý odhad z fotky nikdy nenahradí zkušeného mykologa, a u jedlosti je omyl otázkou zdraví, ne pohodlí.
Kde jsou hranice
Multimodální model není dokonalý pozorovatel. Umí si obrázek špatně vyložit stejně, jako si umí vymyslet fakt v textu. Spočítat přesný počet lidí na fotce z dálky, přečíst rozmazaný nápis nebo rozeznat jemný detail na lékařském snímku mu občas nejde, a odpověď zní přitom stejně sebejistě jako ta správná.
Generování videa je zatím nejméně vyzrálá část multimodality. Nástroje jako Sora od OpenAI nebo Veo od Googlu umí vytvořit krátké, vizuálně působivé klipy, ale plynulé, dlouhé a fakticky konzistentní video je pořád spíš ukázka síly než běžný pracovní nástroj.
Zpracování obrázku nebo zvuku navíc stojí model víc výpočetního výkonu než čistý text, a odpověď proto někdy trvá déle nebo se u placených tarifů počítá jinak. U dlouhého videa nebo hodinové nahrávky se to pozná nejvíc, model ji nezpracuje stejně bleskově jako pár vět.
Na co si dát pozor
Fotky dokladů, rodinných příslušníků nebo interních firemních materiálů posílejte do chatbota s rozmyslem. Co se s obrázkem po odeslání děje a jak dlouho se uchovává, se liší podle poskytovatele a podle nastavení účtu, a stojí za to to jednou zkontrolovat v nastavení soukromí.
Na fotkách a nahrávkách často nejsou jen vaše vlastní údaje. Kolega v pozadí videohovoru, cizí tvář na skupinové fotce, hlas dítěte na nahrávce, to všechno jsou údaje někoho jiného, kdo se sdílením do AI služby nesouhlasil. Stojí za to se nad tím zamyslet stejně jako nad vlastní fotkou.
U citlivějších oblastí, zdravotní snímek, podpis na smlouvě, výsledek testu, berte popis od modelu jako první orientaci, ne jako potvrzení. Rozhodnutí, které má reálné důsledky, si nechte ověřit od člověka, který za něj ponese odpovědnost.
Babiččin recept a googlování rukou
Vrátím se k receptu na buchtu. To, co se stalo v té minutě mezi fotkou a přepsaným textem, není kouzlo. Je to model, který se naučil číst obrázky stejně přirozeně, jako se předtím naučil číst věty, a teď obojí propojuje v jedné odpovědi.
Další pokročilá technika ve stejné rubrice, fine-tuning, mění hlavně to, jak model mluví. Multimodalita mění to, co všechno dokáže vnímat. Kdo dnes takové modely v praxi nabízí a jak se od sebe liší, ukazuje přehled velkých AI modelů 2026.
Nejvíc se to hodí přesně tam, kde by popsat věc slovy trvalo déle než ji ukázat. Vyfoťte, nahrajte, a nechte na modelu, aby si zbytek poskládal sám. Kontrolu výsledku si ale nechte pro sebe, hlavně tam, kde chyba něco stojí.
Recept na buchtu jsem nakonec upekl podle přepočtu, který mi model vytvořil z babiččina rukopisu. Vyšel skoro stejně jako u ní. To „skoro” je možná to nejpřesnější slovo pro celou multimodalitu: blíž lidskému vnímání než kdy dřív, ale pořád ne úplně totéž.