Miért nem karakter és miért nem szó
A karakterszintű modell mindent le tud írni, de a hosszú szövegen minden karakter egy lépés, és az ablak gyorsan elfogy. A szószintű modell tömör, de a szótára véges, és az ismeretlen szavaknál elakad. A gyakorlati válasz a kettő közötti résztokenes út, a gyakori darabok egyben, a ritkák darabokban.
A bevett módszer a bájtpáronkénti kódolás. A szöveg bájtokból indul, és a leggyakoribb szomszédos párokat lépésről lépésre összevonjuk, amíg a szótár a kívánt méretre nő. Karpathy külön videója ezt nulláról építi meg, a minbpe jegyzetfüzetben, a valódi, éles tokenizálók logikája szerint.
A furcsaságok forrása
Ami ebből a mindennapokra következik
A tokenizálás megértése nagyon gyakorlati tudás. A magyar nyelvű rendszereknél a költségbecslés és a kontextustervezés innen indul. A furcsa modellhibák egy részénél az első kérdés az, hogyan esett szét tokenekre a bemenet. És a saját, szűk feladatú modelleknél a szótár mérete tervezési döntés, aminek ára és haszna van.
Karpathy megfogalmazása találó. A tokenizálás körüli bosszúságok a mélytanulás előtti világból visszamaradt gépezet számlái, és a modellek sok híres gyengesége nem a hálóban, hanem itt keletkezik.
Források és további olvasnivaló
A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg.