Takémultimodální AI, multimodální neuronová síť, VLM, vision-language modelPokročilý

Definice

Multimodální model je model strojového učení, který zpracovává a propojuje více typů vstupů, například text, obraz, zvuk, video nebo tabulková data. Místo izolované analýzy jedné modality hledá společné významové reprezentace, takže může popsat obrázek, odpovědět na otázku k dokumentu nebo spojit řeč s vizuálním kontextem.

Kategorie: Umělá inteligenceAktualizováno

Proč multimodalita mění vstup modelu

Multimodální model nepracuje jen s jedním druhem dat. Text, obraz, zvuk, video nebo strukturované záznamy převádí do reprezentací, které lze navzájem porovnávat a kombinovat. Praktický rozdíl proti běžnému large language modelu je v tom, že význam otázky nemusí být obsažen pouze ve slovech. Část informace může ležet ve snímku obrazovky, v grafu, v lékařském snímku nebo v mluvené větě.

Multimodalita je důležitá hlavně tam, kde člověk běžně používá více smyslů najednou. Uživatel například pošle fotografii závady a přidá dotaz, co je potřeba opravit. Model musí propojit vizuální znaky s jazykovým záměrem, nikoli jen samostatně rozpoznat objekty a samostatně generovat text.

Spojení modalit ve společném prostoru

Multimodální model obvykle používá specializované části pro jednotlivé modality. Obrazový enkodér převádí pixely na vektory, textový enkodér pracuje se slovy nebo tokeny a zvukový enkodér zachycuje průběh signálu. Společná část modelu pak hledá vztahy mezi těmito reprezentacemi. Příkladem je párování popisku s obrázkem, odpověď na otázku k dokumentu nebo vyhledání videa podle slovního zadání.

Významná část kvality závisí na tom, jaká trénovací data model viděl. Datová sada složená z obrázků a popisků učí model spojovat vizuální prvky s jazykem. Data z řeči a přepisů zase pomáhají propojit akustický signál s významem vět. Špatné párování, jednostranný jazyk nebo chybějící kontext vedou k tomu, že model působí plynule, ale chápe situaci mělce.

Cena multimodálního zpracování

Multimodální model bývá náročnější než model zaměřený na jednu modalitu. Obrázky, audio i video zvětšují vstup, zvyšují požadavky na paměť a prodlužují inferenci. U videa navíc vzniká otázka, které snímky vybrat, jak zachovat časovou souvislost a kolik detailu poslat do modelu. Produktový návrh proto často omezuje rozlišení, délku nahrávky nebo počet souborů v jednom dotazu.

Nasazení vyžaduje také bezpečnostní vrstvu. V obrázku může být osobní údaj, ve zvuku hlas konkrétní osoby a v dokumentu obchodní tajemství. Multimodální vstup navíc otevírá nové způsoby útoku, například instrukci ukrytou v obrázku nebo neviditelný text v dokumentu. Validace vstupu, audit výstupu a omezení oprávnění jsou stejně důležité jako kvalita modelu.

Výstup není totéž co porozumění

Multimodální model může přesvědčivě popsat scénu, ale zároveň přehlédnout malý detail, špatně číst text v obrázku nebo domyslet souvislost, která ve vstupu není. Takové selhání je příbuzné halucinaci u jazykových modelů, jen se projevuje napříč modalitami. Kritické aplikace proto kombinují model s OCR, detektory objektů, pravidly, RAG nebo lidskou kontrolou.

Příklady z praxe

  1. Třídění pojistné události

    Pojišťovna umožní klientovi nahrát fotografii poškozeného auta a připsat dotaz, zda má škoda projít rychlým schválením. Multimodální model spojí viditelné poškození s textovým popisem události a předvyplní kategorii případu. Likvidátor pak kontroluje návrh místo ručního čtení všech podkladů od začátku.

  2. Zpracování účtenky z fotografie

    Účetní aplikace pošle modelu fotografii účtenky a přesnou instrukci, jaký výstup očekává. Multimodální model musí přečíst text v obrázku, rozlišit položky a převést výsledek do strukturovaného formátu. Produkční systém by výstup ještě porovnal s OCR nebo účetními pravidly.

    {
      "messages": [
        {
          "role": "user",
          "content": [
            {"type": "text", "text": "Najdi na účtence položky s DPH 21 % a vrať je jako JSON."},
            {"type": "image_url", "image_url": "https://example.com/uctenka.jpg"}
          ]
        }
      ]
    }

Časté omyly

MýtusMultimodální model je jen LLM s přidaným OCR.
Ve skutečnostiMultimodální model může OCR používat, ale princip je širší. Model propojuje reprezentace různých modalit, takže může pracovat i s obrazovými vztahy, zvukem, videem nebo kombinací několika vstupů najednou.
MýtusČím víc modalit model přijímá, tím je automaticky chytřejší.
Ve skutečnostiVětší počet modalit nezaručuje lepší úsudek. Nekvalitní párování dat, slabé vyhodnocení nebo příliš dlouhý vstup mohou výkon zhoršit a zvýšit náklady.

Časté dotazy

Může multimodální model pracovat s textem a obrázkem najednou?
Multimodální model může pracovat s textem a obrázkem v jednom úkolu, pokud byl pro takové vstupy navržen nebo doladěn. Typický příklad je otázka položená k fotografii, snímku obrazovky nebo naskenovanému dokumentu. Model převádí text i obraz na vnitřní reprezentace a hledá mezi nimi vztah. Kvalita odpovědi ale závisí na rozlišení, čitelnosti, trénovacích datech a omezeních konkrétního systému.
Potřebuje multimodální model speciální trénovací data?
Multimodální model obvykle potřebuje trénovací data, která propojují více modalit, například dvojice obrázek a popisek, video a titulky nebo zvuk a přepis. Samotný velký objem textu nestačí k dobrému porozumění obrazu nebo zvuku. Některé systémy kombinují předtrénované enkodéry, takže nemusí učit všechno od nuly, ale sladění modalit stále vyžaduje kvalitní párovaná data.
Proč multimodální model někdy špatně popíše obrázek?
Multimodální model může špatně popsat obrázek kvůli nízkému rozlišení, neobvyklé scéně, malému textu, špatnému ořezu nebo slabému zastoupení podobných příkladů v trénovacích datech. Model také někdy doplní pravděpodobnou informaci podle kontextu, i když ve vstupu není vidět. Kritické použití proto vyžaduje ověření, například OCR, specializovaný detektor nebo lidskou kontrolu.
Kdy dává multimodální model větší smysl než běžný jazykový model?
Multimodální model dává větší smysl než čistě jazykový model ve chvíli, kdy rozhodující informace není jen v textu. Příkladem je analýza grafu, kontrola uživatelského rozhraní ze screenshotu, zpracování účtenky nebo odpověď na otázku k fotografii. Pokud vstup i výstup zůstávají pouze textové, může být jednodušší a levnější použít běžný jazykový model.

Zdroje

  1. Multimodal Deep Learning(otevře se v novém okně)arXiv, 2011
  2. Learning Transferable Visual Models From Natural Language Supervision(otevře se v novém okně)arXiv, 2021
  3. Flamingo: a Visual Language Model for Few-Shot Learning(otevře se v novém okně)arXiv, 2022
  4. Transformers(otevře se v novém okně)Hugging Face

Související pojmy

Potřebujete to vyřešit v praxi?

Poradíme, jak na to ve vašem projektu

Vysvětlit pojem je jedna věc, navrhnout kolem něj funkční řešení druhá. Ozvěte se a probereme, co dává smysl u vás.