← Vissza a szótárhoz
Technikai fogalmak

Megerősítéses tanulás

Reinforcement Learning

A megerősítéses tanulás az a gépi tanulási módszer, amelynél a modell próbálkozással és jutalom-büntetés visszacsatolással tanul — így nyertek a sakkban és Go-ban a számítógépek.

Mit jelent a megerősítéses tanulás?

A megerősítéses tanulás (reinforcement learning, RL) a gépi tanulás harmadik fő ága. Lényege: egy ágens (a tanuló rendszer) egy környezetben cselekszik, és a környezetből jutalmat vagy büntetést kap a cselekvésére. Az ágens célja: hosszú távon a lehető legtöbb jutalmat összegyűjteni.

A klasszikus analógia: úgy tanul, mint egy kisgyerek — kipróbál valamit, valami történik (jó vagy rossz), és legközelebb valószínűbben fogja ismételni azt, ami jól sült el.

A három alapfogalom:

  • Ágens — aki tanul (pl. egy sakkprogram)
  • Környezet — ahol cselekszik (pl. a sakktábla)
  • Jutalom — a visszajelzés (pl. győzelem = +1, vereség = -1)

A különbség a felügyelt tanulástól: nincs „helyes válasz" minden lépésre. Az ágens csak a végeredmény alapján tudja meg, hogy a választott útvonal jó volt-e.

Hol látható ma a hatása?

Néhány híres példa:

  • AlphaGo (DeepMind) — az emberi világbajnokot legyőző Go program. Önmaga ellen játszott milliószor, és csak a győzelem/vereség alapján tanult.
  • Önvezető autók — szimulációs környezetben tanulnak vezetni, mielőtt valódi forgalomba kerülnek.
  • Robotikai feladatok — egy robotkar megtanulja megfogni egy tárgyat anélkül, hogy bárki előre megmondaná, hogyan mozogjon.
  • RLHF (Reinforcement Learning from Human Feedback) — a modern LLM-ek (ChatGPT, Claude, Gemini) utófinomításának módszere: emberek értékelik a válaszokat, és a modell ebből tanul.

Üzleti példa egy KKV-nál

A megerősítéses tanulás üzleti környezetben ritkán alkalmazható közvetlenül — túl drága, túl kockázatos a „próbálkozz és tanulj" megközelítés egy éles ügyfélkapcsolatban. De van egy fontos kivétel: az árazás.

Egy nagyobb magyar online jegyértékesítő bevezette: az AI különböző áron kínálta a koncertjegyeket különböző felhasználóknak (kis variációval), és figyelte a konverziós rátákat. A rendszer 4 hónap alatt megtanulta, hogy az adott koncert + adott időpont + adott felhasználói szegmens kombinációra mi az optimális ár. Az árbevétel +9%-kal nőtt.

Fontos: ez közelebb áll az „A/B teszthez automatikusan", mint a klasszikus RL-hez — de a logika ugyanaz.

Mit kell tudni egy cégvezetőnek?

A megerősítéses tanulás a leginkább kutatás-jellegű terület a három tanulási módszer közül. A KKV-szektorban ritkán találkozol vele közvetlenül — de közvetve mindenhol ott van, mert a modern AI-asszisztensek (ChatGPT, Claude) viselkedését ez formálta.

Egy gyakorlati következmény: amikor egy AI-modellt használsz, és palack visszajelzést adsz (👍/👎 a válaszra), az gyakran egy RL-rendszerbe csatorna. Tehát a felhasználói visszajelzéseid hatnak a modell jövőbeli viselkedésére.

A klasszikus RL projekteket (robotika, optimalizáció) érdemes specialistákra bízni. De a reinforcement learning gondolkodásmód — kis kísérletekből, gyors visszacsatolással tanulás — minden cégnél átültethető.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.