Multimodalita
Schopnost AI zpracovávat a kombinovat různé typy vstupů najednou – text, obrázek, zvuk, video
Co je multimodalita
Multimodalita je schopnost AI pracovat s několika typy vstupu a výstupu najednou: s textem, obrazem, zvukem i videem. Jazykový model tedy nečte pouze to, co do něj napíšete. Podívá se na obrázek, poslechne si nahrávku a odpoví na obojí naráz.
Prakticky to znamená hlavně tohle: modelu jde poslat screenshot reportu z Google Ads a ptát se na něj normální větou. Nebo fotku produktu a nechat si k ní napsat popisek do e-shopu.
Proč to v marketingu šetří čas
Dřív se všechno muselo převyprávět do textu. Chtěli jste komentář k výkonu kampaní, tak jste čísla vypsali ručně nebo exportovali do tabulky. Teď stačí výřez obrazovky. Podobně u kreativy: nahrajete vizuál z Meta Ads a ptáte se, co na něm brzdí čitelnost, místo abyste ho zdlouhavě popisovali slovy.
Stejným směrem to jede i ven. Z jednoho zadání vypadne text i obrázek, z nahraného hovoru přepis a shrnutí.
Opatrný bych byl u čísel. Model si obrázek vykládá po svém a u drobných hodnot v grafu se plete. Hodnoty ze screenshotu proto beru jako návrh, ne jako výsledek měření, a proti původnímu reportu si je porovnám. Platí tu totéž co jinde u AI, kontrola faktů zůstává na člověku; viz halucinace AI.
Nejčastěji tuhle vlastnost využívám při rychlém ohledání cizího účtu. Klient pošle screenshot z Google Ads, já ho hodím do modelu s otázkou, co v té struktuře vypadá divně, a mám během chvíle seznam míst, kam se podívat. Rozhodnutí pak dělám sám v účtu, ale první přehled je hotový mnohem dřív.