← Vissza a szótárhoz
Technikai fogalmak

Transformer

Transformer

A transformer egy 2017-ben bemutatott neurális hálózati architektúra, amely a modern nagy nyelvi modellek (GPT, Claude, Gemini) alapja — az AI-robbanás ezen a felfedezésen áll.

Mit jelent a transformer?

A transformer egy speciális neurális hálózat-architektúra, amelyet 2017-ben mutatott be a Google "Attention Is All You Need" című tanulmányában. Ez az architektúra forradalmasította a nyelvi feldolgozást, és közvetlen alapja a modern AI-robbanásnak — a ChatGPT, a Claude, a Gemini és minden mai LLM transformer alapú.

A „transformer" elnevezés onnan jön, hogy a modell átalakítja (transform) a bemenetet kimenetté: szöveget szöveggé, kérdést válasszá, magyart angollá. Az újdonsága nem a feladat, hanem az, hogyan csinálja ezt sokkal hatékonyabban, mint a korábbi módszerek.

Miért volt áttörés?

A 2017 előtti nyelvi modellek (RNN, LSTM) szóról szóra dolgoztak: minden új szó feldolgozása előtt át kellett menniük az eddigieken. Ez lassú volt, és hosszú szövegeknél „elfelejtették" az elejét.

A transformer újdonsága az önfigyelem (self-attention) mechanizmus. Ezzel a modell egyszerre látja az összes szót a bemenetben, és minden szóhoz kiszámolja, hogy a többi szó mennyire fontos a megértéshez. Például a „A bank szélén ültem" mondatban a „bank" jelentését (pénzintézet vagy folyópart?) a „szélén" szóból érti meg.

Két óriási előnye:

  1. Párhuzamosíthatóság. A self-attention egyszerre tudja az összes szót feldolgozni — így GPU-n drasztikusan gyorsabban tanítható, mint az RNN-ek.
  2. Hosszú összefüggések. A transformer nem felejt: egy 2000 szavas szövegben is megjegyzi a 100. szó kontextusát.

Ez tette lehetővé, hogy LLM-eket milliárd paraméterre méretezzünk — a párhuzamosítás nélkül 10-szer ennyi időbe és pénzbe került volna a tanítás.

Üzleti példa

Egy magyar SaaS cég egy belső dokumentum-keresőt épített transformer-alapú embeddingekkel (a transformer architektúra része). A korábbi kulcsszavas keresés („CRM beállítás" → 47 találat, ebből 6 releváns) helyett szemantikus keresést kaptak: a felhasználó kérdést ír be („Hogyan állítom be az új ügyféltípust?"), és a transformer megérti a szándékot, nem csak a szavakat. A találati listán első helyen áll a releváns dokumentum — még akkor is, ha az nem tartalmazza a „beállítás" szót, csak a „konfigurálás"-t.

A támogatási tikettek 41%-kal csökkentek 4 hónap alatt, mert a felhasználók maguk megtalálják a választ.

Mit kell tudni egy cégvezetőnek?

A transformer nem közvetlenül használható eszköz — egy architektúra, amire mások építenek modelleket (GPT, Claude, BERT). A cégednek ezt nem kell „megépíteni", hanem felhasználni a kész modelleken keresztül (API hívással vagy beépített AI eszközökkel).

A gyakorlati következménye: minden modern AI-eszköz transformer-alapú, tehát alapvetően ugyanaz a "motor" hajtja őket. A különbség a tanítóadatban, a finomhangolásban és a méretben van. Ha valaki a céged előtt „transformer megoldást" emleget, az nem valódi differenciátor — szinte minden nyelvi AI az.

A transformer fontosabb tudni-érdekes tényei a tanulmány előtti és utáni átmenethez köthetők: 2017-ig a nyelvi AI lassan és inkrementálisan fejlődött, 2017 után exponenciálisan. Ez a pont az, ahol a „mai AI" elkezdődött.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.