← Vissza a szótárhoz
Technikai fogalmak

Multimodális modell

Multimodal Model

A multimodális modell olyan AI, amely egyszerre dolgoz fel többféle adattípust — szöveget, képet, hangot, videót. A modern AI eszközök (GPT-4o, Gemini, Claude) ma már mind multimodálisak.

Mit jelent a multimodális modell?

A multimodális modell (multimodal model) olyan AI rendszer, amely egyszerre több típusú adatot képes feldolgozni — szöveget, képet, hangot, videót, sőt akár táblázatot vagy programkódot. A „modális" szó azt jelenti: információs csatorna, érzékelési mód.

A korábbi AI rendszerek egy modalitást kezeltek: egy LLM csak szöveget, egy computer vision modell csak képet. A multimodális modell egyetlen rendszerben kombinálja ezeket — és ezért képes pl. egy fotóra adott szöveges kérdésre választ adni.

A leghíresebb mai multimodális modellek:

  • GPT-4o (OpenAI) — szöveg + kép + hang
  • Claude 3.5/3.7 Sonnet (Anthropic) — szöveg + kép + dokumentum (PDF)
  • Gemini 2.0 (Google) — szöveg + kép + hang + videó
  • Llama 3.2 Vision (Meta) — szöveg + kép, nyílt forráskódú

Hogyan működik?

A multimodális modell úgy „tanul", hogy különböző típusú bemeneteket közös belső reprezentációba alakít — jellemzően embeddingekké. Egy macska szöveges említése („cat") és egy macska képe közeli vektort kap a modell belső terében — így a modell „tudja", hogy ugyanarról a fogalomról van szó, függetlenül attól, hogyan érkezett be.

A motorja továbbra is a transformer architektúra, csak kiterjesztett bemeneti rétegekkel: van „kép-encoder", „hang-encoder", és ezek mind ugyanabba a közös térbe vetítenek.

Üzleti példa

Egy magyar építőipari KKV-nak havi 200-300 e-mail érkezik az ügyfelektől, amelyek fotókat is tartalmaznak: „Ez a hiba van a homlokzaton, mit gondoltok, mit kell csinálni?" Korábban ezeket az e-maileket egy junior felmérő mérnök szortírozta — egyenként megnézte a képet, beazonosította a hibatípust, és továbbította a megfelelő szakembernek.

Egy multimodális modellre (Claude 3.5 Sonnet) épülő automata e-mail-feldolgozó másodperc alatt elemzi a fotót és az e-mailt együtt:

  • Beazonosítja a hibatípust (vakolat-leválás, vízbeázás, repedés stb.)
  • Megbecsüli a sürgősséget (kis kozmetikai hiba vs. szerkezeti probléma)
  • Generál egy első verziójú válaszlevelet a felmérési időpont-javaslattal
  • Hozzárendeli a megfelelő szakember kollégához

A junior felmérő napi 4 órát szabadult fel, és ezt az időt terepi szemlékre használhatja — ami közvetlenül több bevétel.

Mit kell tudni egy cégvezetőnek?

A multimodális modellek egy új korszakot nyitnak, mert hirtelen olyan üzleti problémákra vannak válaszok, amik korábban csak emberi munkával voltak megoldhatók: vizuális minőségellenőrzés, fotó-alapú segélykérés, hang-alapú megrendelés.

Két dolog fontos:

  1. Költség. A multimodális hívások (pl. képes kérdés) drágábbak, mint a tisztán szövegesek — egy közepes méretű kép 1.000-2.000 tokennek számít. Tervezz ezzel.
  2. Pontosság ≠ szöveg-szintű. A multimodális modellek a szöveg területén már szinte tökéletesek, de a kép-értelmezés még hibázhat. Vizuális azonosításnál (pl. terméktipus, hibatípus) emberi felülvizsgálat kell az első hónapokban, amíg méri a hibaarányt.

A közeljövőben a videó is komolyabb modalitás lesz (Sora, Veo, Runway). Ez sok B2C üzletet érint majd: tartalomgyártás, marketing, oktatóanyag-készítés. Aki most kezd kísérletezni multimodális AI-val, 2-3 évre előre kerül a versenyben.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.