A mennyiség mítosza
A leggyakoribb kérdés, hogy hány példa kell. A tapasztalat és a kutatások iránya egybevág. Egy szűk feladatra pár száz kifogástalan példa is látványos javulást hoz, pár ezer jó példa pedig a legtöbb céges feladatot lefedi. A mennyiségnél sokkal többet számít a tisztaság, mert a modell a hibákat ugyanolyan szorgalmasan tanulja meg, mint az erényeket.
Ez visszavezet az adatközpontú alapszabályhoz. A rossz példa nem semleges, hanem méreg. Ezer példából száz hibás nem tíz százalék veszteség, hanem beépített hibázási hajlam.
A szintetikus adat helye
A nagy modellel gyártott tanítópélda a finomhangolás bevett eszköze lett, és jól használva sokat ér. A tipikus munkamenet az, hogy a nagy modell legyártja a példák első hullámát, ember válogatja és javítja, és a kis modell ezen tanul. Így a nagy modell tudásának egy szelete átcsorog a kicsibe, ezt hívja a szakma desztillálásnak.
Két korlát tartozik hozzá. A szintetikus példát ember nézze át, mielőtt tanítóadat lesz, mert a nagy modell hibái különben átöröklődnek. És a szolgáltatók felhasználási feltételei eltérnek abban, szabad-e a kimenetükön rivális modellt tanítani, ezt a választott szolgáltatónál ellenőrizni kell.
Források és további olvasnivaló
A tananyag gerince a Hugging Face ingyenes smol-course kurzusa, amely kis nyelvi modellek instrukciókövetésre hangolását és igazítását tanítja. Az adatminőség módszertana az Adatközpontú AI tananyagban, a szintetikus adat leckében is.