Mi az a token
Amikor beírunk egy mondatot, mi szavakban látjuk. A modell ezt először feldarabolja apró egységekre, amelyeket tokeneknek hívunk. Egy token gyakran egy egész rövid szó, de sokszor egy szó töredéke, egy szótő, egy rag vagy éppen egy írásjel. A magyar nyelvben, a sok toldalék miatt, egy hosszabb szó több tokenre is eshet. A modell mindig ezekkel a kis darabokkal dolgozik. A következő szó megjóslása valójában a következő token megjóslása, egyesével építve fel a választ.
Ezt nem kell részletesen érteni ahhoz, hogy jól használjuk a rendszert, de két dolog miatt hasznos tudni róla. Egyrészt a token az az egység, amiben a szolgáltatók a szöveg hosszát mérik, tehát a hosszabb beszélgetés több tokent jelent. Másrészt segít megérteni, miért nem tökéletes a modell bizonyos feladatokban, például a betűk pontos számolásában, hiszen nem betűnként, hanem tokenenként látja a szöveget.
Egy mondat tokenekre bontva
A generatív AI szöveget ír.
A kontextusablak
A második kulcsfogalom a kontextusablak. Ez azt jelenti, hogy a modell egyszerre csak egy adott mennyiségű szöveget képes figyelembe venni. Ide tartozik minden, amit az adott beszélgetésben odaadtunk neki, a kérdéseink, a korábbi válaszai, a beillesztett dokumentum, az utasításaink. Ezt szokás úgy elképzelni, mint a modell rövid távú munkamemóriáját. Amíg egy információ ezen az ablakon belül van, addig a modell hivatkozni tud rá és számol vele. Amint valami kicsúszik belőle, a modell számára gyakorlatilag megszűnik létezni.
Az ablak mérete modellenként változik, és az újabb rendszereknél egyre nagyobb. De bármilyen nagy is, mindig véges. Ez azt jelenti, hogy egy nagyon hosszú beszélgetésben vagy egy terjedelmes dokumentum feldolgozásakor a legkorábbi részletek egy ponton túl kieshetnek a modell látóköréből. Nem azért, mert elfelejti őket rossz szándékból, hanem mert egyszerűen nem fér bele többé abba a mennyiségbe, amit egyszerre kezelni tud.
Gyakorlati következmények
Ennek a két fogalomnak több hasznos következménye van a mindennapi használatban. Az első a hosszú beszélgetésekre vonatkozik. Ha egy csevegés nagyon elnyúlik, érdemes időnként összefoglalni a fontos pontokat, vagy új beszélgetést kezdeni a lényeg beillesztésével. Így biztosítjuk, hogy a számunkra fontos információ az ablakon belül maradjon, és ne csússzon ki észrevétlenül.
A második következmény a dokumentumok kezelésére vonatkozik. Ha egy nagyon hosszú anyagot adunk a modellnek, előfordulhat, hogy nem fér bele egyszerre a kontextusablakba. Ilyenkor segít, ha részletekre bontjuk, vagy csak a valóban lényeges szakaszokat illesztjük be. A harmadik tanulság az, hogy a modell mindig csak azt tudja, amit odaadtunk neki az adott beszélgetésben, vagy amit az előtanításból általánosságban ismer. Nem lát bele a fájljainkba, a levelezésünkbe vagy a friss hírekbe, hacsak ezt kifejezetten a rendelkezésére nem bocsátjuk.
Van egy negyedik, gyakran figyelmen kívül hagyott következmény is. Egy hosszú beszélgetésben nemcsak a legkorábbi részletek csúszhatnak ki az ablakból, hanem a modell figyelme is megoszlik a sok korábbi üzenet között. Ezért, ha egy adott ponton fontos, hogy a modell egy konkrét szabályra vagy adatra összpontosítson, érdemes azt közvetlenül a kérés mellé újra odaírni, nem pedig arra hagyatkozni, hogy tíz üzenettel korábban már említettük. Ez az apró szokás sokat javít a hosszabb munkamenetek megbízhatóságán.
A határok nem hibák
Fontos szemléleti pont, hogy ezek a korlátok nem hibák, hanem a rendszer természetéből fakadó jellemzők. A token azért van, mert a modell így képes egyáltalán szöveget kezelni. A kontextusablak azért véges, mert egy rendszernek mindig van egy határa, ameddig egyszerre figyelni tud. Aki ezeket ismeri, nem csalódik akkor, amikor a modell egy hosszú beszélgetés elején említett részletre már nem emlékszik pontosan. Ehelyett tudatosan úgy alakítja a munkát, hogy a fontos információ mindig kéznél legyen a modell számára. Ez a fajta tudatosság az egyik legnagyobb különbség a kezdő és a rutinos felhasználó között.
Miért téveszti el néha az egyszerűt
Sokakat meglep, hogy egy modell, amely bonyolult kérdésekre kiválóan válaszol, néha elrontja a látszólag legegyszerűbb feladatot. Klasszikus példa, amikor arra kérjük, számolja meg, hány adott betű van egy szóban, és téves számot ad. Ennek pontosan a token a magyarázata. A modell nem betűnként látja a szöveget, hanem tokenekben, azaz nagyobb darabokban. Ami nekünk egy sor különálló betű, az a modell számára néhány összevont egység. Ezért a betűk pontos megszámlálása nem az erőssége, még akkor sem, ha közben egy nehéz gondolatmenetet könnyedén követ.
Ez a jelenség jól mutatja, hogy a modell másképp látja a világot, mint mi. Nem érdemes hibának bélyegezni, hanem inkább tudni kell róla, és a feladatot ehhez igazítani. Ha valami pontosan a betűk vagy karakterek szintjén dől el, akkor arra vagy egy hagyományos eszköz alkalmasabb, vagy külön figyelmet igényel. Ez a szemlélet visszavezet a tananyag egyik fő gondolatához. Nem a modell mindenhatóságában kell bíznunk, hanem abban, hogy ismerjük az erősségeit és a gyengéit, és ennek megfelelően használjuk.
Két fogalom, egy tanulság. A token a szöveg apró építőeleme, a kontextusablak pedig a modell egyszerre kezelhető munkamemóriája. Mivel ez az ablak véges, a fontos információt tartsuk benne, például összefoglalással vagy a lényeg újbóli beillesztésével.
Workshop
AI Transformation Day
Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.
Érdekel a program →