Takémultimodální AI, multimodální neuronová síť, VLM, vision-language modelPokročilý
Definice
Multimodální model je model strojového učení, který zpracovává a propojuje více typů vstupů, například text, obraz, zvuk, video nebo tabulková data. Místo izolované analýzy jedné modality hledá společné významové reprezentace, takže může popsat obrázek, odpovědět na otázku k dokumentu nebo spojit řeč s vizuálním kontextem.
Proč multimodalita mění vstup modelu
Multimodální model nepracuje jen s jedním druhem dat. Text, obraz, zvuk, video nebo strukturované záznamy převádí do reprezentací, které lze navzájem porovnávat a kombinovat. Praktický rozdíl proti běžnému large language modelu je v tom, že význam otázky nemusí být obsažen pouze ve slovech. Část informace může ležet ve snímku obrazovky, v grafu, v lékařském snímku nebo v mluvené větě.
Multimodalita je důležitá hlavně tam, kde člověk běžně používá více smyslů najednou. Uživatel například pošle fotografii závady a přidá dotaz, co je potřeba opravit. Model musí propojit vizuální znaky s jazykovým záměrem, nikoli jen samostatně rozpoznat objekty a samostatně generovat text.
Spojení modalit ve společném prostoru
Multimodální model obvykle používá specializované části pro jednotlivé modality. Obrazový enkodér převádí pixely na vektory, textový enkodér pracuje se slovy nebo tokeny a zvukový enkodér zachycuje průběh signálu. Společná část modelu pak hledá vztahy mezi těmito reprezentacemi. Příkladem je párování popisku s obrázkem, odpověď na otázku k dokumentu nebo vyhledání videa podle slovního zadání.
Významná část kvality závisí na tom, jaká trénovací data model viděl. Datová sada složená z obrázků a popisků učí model spojovat vizuální prvky s jazykem. Data z řeči a přepisů zase pomáhají propojit akustický signál s významem vět. Špatné párování, jednostranný jazyk nebo chybějící kontext vedou k tomu, že model působí plynule, ale chápe situaci mělce.
Cena multimodálního zpracování
Multimodální model bývá náročnější než model zaměřený na jednu modalitu. Obrázky, audio i video zvětšují vstup, zvyšují požadavky na paměť a prodlužují inferenci. U videa navíc vzniká otázka, které snímky vybrat, jak zachovat časovou souvislost a kolik detailu poslat do modelu. Produktový návrh proto často omezuje rozlišení, délku nahrávky nebo počet souborů v jednom dotazu.
Nasazení vyžaduje také bezpečnostní vrstvu. V obrázku může být osobní údaj, ve zvuku hlas konkrétní osoby a v dokumentu obchodní tajemství. Multimodální vstup navíc otevírá nové způsoby útoku, například instrukci ukrytou v obrázku nebo neviditelný text v dokumentu. Validace vstupu, audit výstupu a omezení oprávnění jsou stejně důležité jako kvalita modelu.
Výstup není totéž co porozumění
Multimodální model může přesvědčivě popsat scénu, ale zároveň přehlédnout malý detail, špatně číst text v obrázku nebo domyslet souvislost, která ve vstupu není. Takové selhání je příbuzné halucinaci u jazykových modelů, jen se projevuje napříč modalitami. Kritické aplikace proto kombinují model s OCR, detektory objektů, pravidly, RAG nebo lidskou kontrolou.
Příklady z praxe
Třídění pojistné události
Pojišťovna umožní klientovi nahrát fotografii poškozeného auta a připsat dotaz, zda má škoda projít rychlým schválením. Multimodální model spojí viditelné poškození s textovým popisem události a předvyplní kategorii případu. Likvidátor pak kontroluje návrh místo ručního čtení všech podkladů od začátku.
Zpracování účtenky z fotografie
Účetní aplikace pošle modelu fotografii účtenky a přesnou instrukci, jaký výstup očekává. Multimodální model musí přečíst text v obrázku, rozlišit položky a převést výsledek do strukturovaného formátu. Produkční systém by výstup ještě porovnal s OCR nebo účetními pravidly.
{ "messages": [ { "role": "user", "content": [ {"type": "text", "text": "Najdi na účtence položky s DPH 21 % a vrať je jako JSON."}, {"type": "image_url", "image_url": "https://example.com/uctenka.jpg"} ] } ] }
Časté omyly
- MýtusMultimodální model je jen LLM s přidaným OCR.
- Ve skutečnostiMultimodální model může OCR používat, ale princip je širší. Model propojuje reprezentace různých modalit, takže může pracovat i s obrazovými vztahy, zvukem, videem nebo kombinací několika vstupů najednou.
- MýtusČím víc modalit model přijímá, tím je automaticky chytřejší.
- Ve skutečnostiVětší počet modalit nezaručuje lepší úsudek. Nekvalitní párování dat, slabé vyhodnocení nebo příliš dlouhý vstup mohou výkon zhoršit a zvýšit náklady.
Časté dotazy
- Může multimodální model pracovat s textem a obrázkem najednou?
- Multimodální model může pracovat s textem a obrázkem v jednom úkolu, pokud byl pro takové vstupy navržen nebo doladěn. Typický příklad je otázka položená k fotografii, snímku obrazovky nebo naskenovanému dokumentu. Model převádí text i obraz na vnitřní reprezentace a hledá mezi nimi vztah. Kvalita odpovědi ale závisí na rozlišení, čitelnosti, trénovacích datech a omezeních konkrétního systému.
- Potřebuje multimodální model speciální trénovací data?
- Multimodální model obvykle potřebuje trénovací data, která propojují více modalit, například dvojice obrázek a popisek, video a titulky nebo zvuk a přepis. Samotný velký objem textu nestačí k dobrému porozumění obrazu nebo zvuku. Některé systémy kombinují předtrénované enkodéry, takže nemusí učit všechno od nuly, ale sladění modalit stále vyžaduje kvalitní párovaná data.
- Proč multimodální model někdy špatně popíše obrázek?
- Multimodální model může špatně popsat obrázek kvůli nízkému rozlišení, neobvyklé scéně, malému textu, špatnému ořezu nebo slabému zastoupení podobných příkladů v trénovacích datech. Model také někdy doplní pravděpodobnou informaci podle kontextu, i když ve vstupu není vidět. Kritické použití proto vyžaduje ověření, například OCR, specializovaný detektor nebo lidskou kontrolu.
- Kdy dává multimodální model větší smysl než běžný jazykový model?
- Multimodální model dává větší smysl než čistě jazykový model ve chvíli, kdy rozhodující informace není jen v textu. Příkladem je analýza grafu, kontrola uživatelského rozhraní ze screenshotu, zpracování účtenky nebo odpověď na otázku k fotografii. Pokud vstup i výstup zůstávají pouze textové, může být jednodušší a levnější použít běžný jazykový model.
Zdroje
- Multimodal Deep Learning(otevře se v novém okně)
- Learning Transferable Visual Models From Natural Language Supervision(otevře se v novém okně)
- Flamingo: a Visual Language Model for Few-Shot Learning(otevře se v novém okně)
- Transformers(otevře se v novém okně)