← Vissza a szótárhoz
Technikai fogalmak

Diffúziós modell

Diffusion Model

A diffúziós modell úgy generál képet, hogy fokozatosan eltávolítja a zajt egy véletlenszerű zajképből — ez a Midjourney, a DALL·E és a Stable Diffusion technológiai alapja.

Mit jelent a diffúziós modell?

A diffúziós modell (angolul diffusion model) egy generatív AI architektúra, amely képeket — egyre gyakrabban videókat és hangot is — úgy állít elő, hogy egy teljesen véletlenszerű zajképből indulva lépésről lépésre eltávolítja a zajt, és közben kibontakozik egy értelmes kép. Ez a Midjourney, a DALL·E 3, a Stable Diffusion és az OpenAI Sora videómodell mögött álló technológia.

A diffúziós modell ma a legjobban teljesítő képgeneráló architektúra. A korábbi domináns megoldás, a GAN sok problémája (pl. „mode collapse", azaz hogy a modell csak néhány típusú képet tud előállítani) eltűnt vele, és a generált képek minősége is jobb lett.

Hogyan működik?

Két lépésből áll a tanítás:

  1. Forward (zajosítás): vesz egy valódi képet, és lépésenként egyre több zajt ad hozzá, amíg már csak véletlen pixelhalmaz marad. A modell megfigyeli, hogyan alakul át a kép a zajba.
  2. Reverse (zajtalanítás): a modell megtanulja visszafelé csinálni ezt a folyamatot — egy zajképből hogyan lehet rekonstruálni egy értelmes képet.

Generáláskor a felhasználó beír egy szöveges promptot („egy fáradt cégvezető a laptop előtt, késő este"), a modell pedig egy zajképből indulva, ~30-100 lépésen keresztül zajtalanítva állítja elő a kívánt képet — közben minden lépésben „odanéz" a promptra is, hogy a megfelelő irányba húzza a képet.

Üzleti példa

Egy 12 fős marketing ügynökség heti 60-80 közösségi média posztot készít az ügyfeleinek. Régen ezekhez stockfotót vásároltak (1.500-3.000 Ft / kép), vagy fotózást szerveztek. Most diffúziós modellel (pl. Midjourney + Stable Diffusion saját szerveren) egyedi, márkára szabott vizuálokat készítenek, ami:

  • Olcsóbb: a Midjourney 30 USD/hó, korlátlan kép — a stockfotók 200.000+ Ft/hó-t hoztak
  • Egyedibb: nem ugyanaz a kép, mint amit minden konkurens is használ
  • Gyorsabb: 30 másodperc per kép, nem 30 perc keresgélés

A márkakonzisztencia kulcskérdés — itt segít a fine-tuning, amellyel a modellt „rátaníthatod" a saját vizuális stílusodra.

Mit kell tudni egy cégvezetőnek?

Két dolog fontos:

  • Jogi kérdések: a diffúziós modellek copyrighttal védett képeken is tanultak. Az EU AI Act és más szabályozások egyre szigorúbban kezelik. Üzleti használathoz olyan modellt válassz, amely tisztított adathalmazon tanult (pl. Adobe Firefly).
  • Markamegjelenés: a generált képek felismerhetően AI-szagúak, ha nem figyelsz rá. Egy tapasztalt művészeti vezető (vagy prompt engineering szakértő) kell ahhoz, hogy a vizuálok a saját márkádhoz illjenek, ne pedig egy „generikus AI esztétikába" csússzanak.

A diffúziós modell nem helyettesíti a kreatívot — hanem megsokszorozza a teljesítményét.

Szeretnéd ezt a gyakorlatban is alkalmazni?

Beszéljünk arról, hogyan használjuk ezt a fogalmat valós cégekben — stratégiától a megvalósításig.