← Vissza a szótárhoz
Technikai fogalmak

Embedding

Embedding

Az embedding az a technika, amellyel szövegeket, képeket vagy hangokat számvektorokká alakítunk — így tud az AI „jelentést” számolni, és ezért működik a szemantikus keresés és a RAG.

Mit jelent az embedding?

Az embedding (magyarul „beágyazás") az a technika, amellyel egy szöveget, képet, hangot vagy bármilyen adatot számvektorrá — több száz vagy ezer számból álló listává — alakítunk. Ez a vektor a tartalom „jelentésének" matematikai kódolása: hasonló jelentésű dolgok közeli vektorokat kapnak, eltérő jelentésűek pedig távoliakat.

Egyszerű analógia: minden szót elhelyezünk egy térben. A „macska" és a „kutya" közel kerülnek egymáshoz (mindkettő háziállat), a „macska" és a „bank" pedig messze. A különleges az, hogy ez a tér több száz dimenziós — sokkal árnyaltabb, mint amit emberi fejjel el tudnánk képzelni.

Mire használjuk?

Az embedding a modern AI rejtett munkása. Számos alkalmazás épül rá:

  • Szemantikus keresés. A felhasználó kérdését embedding-be alakítjuk, majd kikeressük a hozzá legközelebbi vektorú dokumentumokat. A „CRM beállítás" kérdésre a „CRM konfigurálás" cikket is megtaláljuk — kulcsszó-egyezés nélkül is.
  • RAG (visszakereséses generálás). Az embedding a RAG kulcskomponense — ezen alapul, hogy az LLM meg tudja találni a releváns dokumentumokat válasz előtt.
  • Ajánlórendszerek. „Aki ezt nézte, ezt is" — termékek embedding-jei közti hasonlóság alapján.
  • Klaszterezés / szegmentáció. Ügyfelek, dokumentumok, e-mailek csoportosítása tartalom alapján.
  • Duplikátum-felismerés. Két szöveg „ugyanazt mondja-e" — kulcsszó-egyezés helyett jelentés-egyezés.

Az embeddingeket általában egy transformer alapú modell (pl. OpenAI text-embedding-3, Cohere, Mistral) generálja, és vektor-adatbázisban (pl. Pinecone, Weaviate, Qdrant) tároljuk őket.

Üzleti példa

Egy magyar HR tanácsadó cég 12 év alatt 40.000 önéletrajzot halmozott fel. Az új álláshirdetésekhez korábban kulcsszavas keresést használtak („Java fejlesztő, 5 év tapasztalat"), ami sok jó jelölt elkerült (mert nem pontosan ezeket a szavakat használták az önéletrajzukban).

Az összes önéletrajzot embeddingekké alakították (egyszer, kb. 2 nap GPU-időbe került). Az új álláshirdetést is embeddinggé alakítják, és a vektor-adatbázis mp-en belül kihozza a 50 leghasonlóbb jelöltet — szemantikailag, nem kulcsszó alapján.

Eredmény: a HR menedzserek napi 2-3 órája szabadult fel a tömeges önéletrajz-szelektálásból, és a „rejtett gyöngyszem" jelöltek aránya megduplázódott.

Mit kell tudni egy cégvezetőnek?

Az embedding nagyon olcsó és gyors. Egy 10.000 szavas dokumentum embedding-be alakítása 1 másodperc, és kevesebb mint 1 forintba kerül. Nem ez a szűk keresztmetszet a cégnél — hanem a vektor-adatbázis kiválasztása és karbantartása, illetve a metaadatok rendben tartása (kihez tartozik az adat, mikor frissült).

Két dolgot érdemes tudni:

  1. Az embedding modell verziója fontos. Ha modell-frissítés van, az új embeddingek nem kompatibilisek a régiekkel — újra kell generálni mindent. Ez 6-12 havi tervezést igényel.
  2. Az embedding nem ért nyelveket egyformán. A magyar nyelvre tanított vagy multilingual modellek lényegesen jobbak, mint a csak angolra tanítottak. Magyar tartalomhoz mindenképpen multilingual modellt válasszunk (pl. OpenAI text-embedding-3-large).

Az embedding az alaptechnológia, ami belső keresőkből, dokumentumkezelőkből, chatbotokból mind-mind valódi értékteremtő AI-rendszert csinál. Kis befektetés, nagy hozam — különösen az ismétlődő keresés/visszakeresés feladatokon.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.