← Vissza a szótárhoz
Technikai fogalmak

Felügyelt tanulás

Supervised Learning

A felügyelt tanulás az a gépi tanulási módszer, amelynél a modell címkézett példák alapján tanul — minden bemenethez megadjuk a helyes választ.

Mit jelent a felügyelt tanulás?

A felügyelt tanulás (supervised learning) a gépi tanulás három fő ága közül a leggyakrabban használt. Lényege: a modell címkézett példák alapján tanul. Minden tanítási adatpont egy (bemenet, helyes kimenet) páros — a „felügyelt" szó arra utal, hogy van egy „tanár" (ember vagy más rendszer), aki előre megmondja, mi a helyes válasz.

Két fő típusa van:

  • Osztályozás (classification): diszkrét kategóriába sorol — pl. „spam" vs. „nem spam".
  • Regresszió (regression): folytonos értéket jósol — pl. egy lakás várható ára.

Példák a hétköznapokban:

  • Spamszűrő: emberek által „spam"-nek vagy „inbox"-nak címkézett e-mailek tanítják.
  • Hitelminősítés: korábbi hitelek + visszafizetési előzmények alapján.
  • Képfelismerés: emberek által felcímkézett képek („ez kutya", „ez macska").

Hogyan működik a folyamat?

A felügyelt tanulás négy lépésből áll:

  1. Adatgyűjtés és címkézés — ez gyakran a teljes munka 60-70%-a. Például egy ügyféllevél-osztályozónál minden levélhez kategóriát kell adni.
  2. Modellválasztás — döntési fa, neurális hálózat, vagy más algoritmus.
  3. Tanítás — a modell a címkézett példákon iteratívan beállítja a belső paramétereit.
  4. Validáció — előre félretett, nem látott adatokon mérjük, mennyire pontos a modell.

A modern AI fejlesztésben a fine-tuning is felügyelt tanulás: meglévő, általános modellt tanítunk tovább saját címkézett adatokon.

Üzleti példa egy KKV-nál

Egy 30 fős magyar pénzügyi tanácsadó cég napi 200 ügyféllevelet kapott — a kérdések nagy részét 6 visszatérő kategóriába lehet sorolni (számlanyitás, befektetési kérdés, panasz, stb.). Az asszisztens kollégák naponta 1,5-2 órát töltöttek a levelek manuális címkézésével.

Az automatizáció: 800 korábbi e-mail manuális címkézése után tanítottak egy felügyelt modellt, amely 92%-os pontossággal sorolja a leveleket. A bizonytalan eseteket (8%) továbbra is ember nézi át. Eredmény: napi 90 perc szabadult fel kollégánként, és a válaszidő 24 óráról 4 órára csökkent.

Mit kell tudni egy cégvezetőnek?

A felügyelt tanulás legnagyobb költsége nem a modell, hanem az adat. A jó címkézett adat aranyat ér — minden új projektnél a kérdés: van-e meglévő, használható címkézett adatunk, vagy építeni kell.

Két fontos szabály:

  1. Minőség > mennyiség: 1.000 jól címkézett példa többet ér, mint 10.000 felületesen címkézett.
  2. Ne automatizálj olyat, amit te se tudnál egyértelműen címkézni: ha az emberek között 60%-os egyetértés van, hogy mi a „helyes válasz", akkor a modell sem fog 90% felett teljesíteni.

Ha az adat természeténél fogva nincs címkézve, akkor inkább a felügyelet nélküli tanulás felé kell fordulni.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.