A generatív AI működése és hatása · Lecke 03

A finomhangolástól az emberi visszajelzésig

Az előtanítás után a modell tud fogalmazni, de még nem jó asszisztens. Nem érti, hogy egy kérdésre segítőkész, világos választ várunk. Ebben a leckében megnézzük, hogyan alakítja a finomhangolás és az emberi visszajelzés a nyers rendszert azzá az udvarias, hasznos beszélgetőtárssá, amit ma használunk.

Vissza a tananyaghoz


Miért nem elég az előtanítás

Az előző leckében láttuk, hogy az előtanítás során a modell a következő szó megjóslását gyakorolja hatalmas szövegmennyiségen. Ennek a végén valóban jól fogalmaz, de van egy fontos korlátja. Csak azt tanulta meg, hogyan folytatódik valószínűleg egy szöveg, azt nem, hogy mit várunk tőle egy beszélgetésben. Ha egy nyers, csak előtanított modellnek felteszünk egy kérdést, könnyen előfordul, hogy nem válaszol rá, hanem egyszerűen folytatja a szöveget. Egy kérdésre például további kérdéseket sorol, mert a látott szövegekben a kérdések gyakran így csoportosultak.

Ez logikus, ha belegondolunk. Az előtanított modell célja nem a segítségnyújtás volt, hanem a valószínű folytatás előállítása. Attól, hogy valaki jól tudja folytatni a szöveget, még nem lesz jó asszisztens. Hiányzik belőle az a szándék, hogy megértse a kérést, és arra adjon hasznos, közvetlen választ. Éppen ezt a hiányt pótolja a következő két lépés, a finomhangolás és az emberi visszajelzés.


Csak előtanított modell

  • Jól folytatja a szöveget
  • Nem feltétlen válaszol a kérdésre
  • Nincs benne segítő szándék
  • Nem tudja, mi számít hasznos válasznak

Finomhangolt, visszajelzéssel

  • Megérti, hogy választ várunk
  • Közvetlen, hasznos feleletet ad
  • Igazodik a kért hangnemhez
  • Elutasítja a nyilvánvalóan káros kérést

Mit jelent a finomhangolás

A finomhangolás egy második, célzottabb tanulási szakasz. Ebben a modellt már nem véletlenszerű internetes szöveggel képezzük, hanem gondosan összeállított példákkal, amelyek megmutatják, hogyan néz ki egy jó válasz. Egy tipikus példa egy kérdésből és a hozzá tartozó, minőségi feleletből áll. A modell ezekből a mintákból megtanulja, hogy amikor valaki kérdez, arra segítőkészen és lényegre törően kell reagálni. Mintegy megmutatjuk neki, milyen viselkedés az elvárt, és ő ehhez igazítja magát.

Fontos érteni, hogy a finomhangolás nem tanít teljesen új tudást a modellnek. A világról szóló ismeretek nagy része már az előtanításból megvan. A finomhangolás inkább a viselkedést formálja. Ráirányítja a meglévő képességeket egy hasznos irányba. Kicsit olyan ez, mint amikor egy tehetséges, de tapasztalatlan új munkatársnak megmutatjuk, hogyan fogalmazzon egy ügyfélnek szóló levélben. A tudás megvolt benne, csak a megfelelő formát és szándékot kellett hozzátennünk.


  1. ElőtanításA modell hatalmas szövegmennyiségen megtanulja a nyelvet és a világ általános összefüggéseit. Jól fogalmaz, de még nem asszisztens.
  2. FinomhangolásGondosan összeállított kérdés és válasz példákkal megmutatjuk, hogyan néz ki egy hasznos, segítőkész felelet.
  3. Emberi visszajelzésEmberek több lehetséges választ rangsorolnak, és ebből a modell megtanulja, melyik felel meg jobban az elvárásainknak.

Az emberi visszajelzés szerepe

A harmadik lépés az, ahol az emberi ítélet közvetlenül alakítja a modellt. Ennek során a rendszer egy kérdésre több különböző választ állít elő, emberek pedig megítélik, melyik a jobb. Melyik világosabb, melyik hasznosabb, melyik udvariasabb, melyik kerüli el a káros vagy félrevezető tartalmat. Ezekből az összehasonlításokból a modell fokozatosan megtanulja, milyen válaszokat részesítünk előnyben, és a jövőben ezek felé húz. Ezt a folyamatot szokás emberi visszajelzésen alapuló megerősítéses tanulásnak nevezni.

Ennek a lépésnek köszönhető sok olyan tulajdonság, amit magától értetődőnek veszünk a mai asszisztenseknél. Hogy udvariasan válaszol, hogy igyekszik érthetően fogalmazni, hogy visszautasít bizonyos veszélyes kéréseket. Egyik sem jött volna magától az előtanításból. Mindegyik abból ered, hogy emberek jelezték, mit tartanak jó válasznak, és a modell ehhez igazodott. Fontos ugyanakkor látni, hogy ez a folyamat emberi döntéseket tükröz, tehát a modell viselkedésébe azoknak az embereknek az értékítéletei is beépülnek, akik a visszajelzést adták.


Miért érdemes ezt tudni

Vezetőként ezt a három lépést azért hasznos ismerni, mert megmutatja, hogy a kész asszisztens viselkedése nem véletlen. Tudatos formálás eredménye. A modell segítőkészsége, hangneme és óvatossága mind emberi döntések nyomán alakult ki. Ez két dolgot jelent a gyakorlatban. Egyrészt a rendszerek viselkedése irányítható és javítható, tehát idővel jobbá válhat. Másrészt, mivel emberi ítéletek épülnek bele, a modell nem semleges és nem tévedhetetlen, hanem tükrözi azokat a szempontokat, amelyek szerint betanították. Aki ezt érti, reálisabban tud dönteni arról, mire és hogyan használja ezeket az eszközöket.


Egy szemléletes példa

Képzeljük el, hogy két lehetséges válasz készül ugyanarra a kérdésre, „Hogyan mondjam el egy munkatársnak, hogy csúszik a projekt". Az egyik válasz száraz és nyers, csak felsorolja a tényeket. A másik empatikus, világos, és javaslatot is tesz a következő lépésre. Az emberi visszajelzés szakaszában emberek éppen az ilyen párokat rangsorolják, és jelzik, hogy a második típusú válasz a jobb. A modell ezekből a döntésekből ezerszám tanul, és fokozatosan eltolódik a segítőkészebb, átgondoltabb válaszok felé. Így épül be a viselkedésébe az, amit mi jó hangvételnek és hasznosságnak tartunk.

Ez a példa arra is rávilágít, hogy a modell udvariassága és tapintata nem valamiféle beépített jóság, hanem sok emberi döntés lenyomata. Ebből két dolog következik. Egyrészt a rendszer tükrözi azoknak az embereknek a szempontjait és kulturális hátterét, akik a visszajelzést adták, tehát nem semleges. Másrészt, mivel a viselkedés tanult és formálható, idővel finomítható és javítható is. A finomhangolás és a visszajelzés együtt teszi lehetővé, hogy egy nyers, csak szöveget folytató rendszerből olyan asszisztens váljon, amellyel valóban együtt lehet dolgozni.


3

Három lépés visz a hasznos asszisztensig. Az előtanítás megtanítja a nyelvet, a finomhangolás megmutatja a jó válasz formáját, az emberi visszajelzés pedig a mi elvárásainkhoz igazítja. A puszta előtanítás jól fogalmazó, de nem segítőkész modellt ad.


← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →