A beágyazás megjelenése
Ha három karakter előzményből akarunk jósolni, a táblázat kombinatorikusan felrobban. A megoldás az, hogy minden karakter kap egy kis számvektort, egy beágyazást, és a modell ezekkel a vektorokkal dolgozik tovább. A beágyazás a modern nyelvi modellek egyik alapköve, és itt látszik meg, hogyan tanulja meg magától, melyik karakterek viselkednek hasonlóan.
Az előzményvektorokat egy rejtett réteg gyúrja össze, és a kimenet a következő karakter eloszlása. Ez a többrétegű perceptron nyelvi modell, egy valódi kis neurális háló, amelynek már van kontextusablaka, az a néhány karakter, amennyit lát. A nagy modellek százezres ablaka ugyanennek a fogalomnak a felnőtt változata.
A műszerfal
Ebben a szakaszban tanítja meg a sorozat a szakma műszereit is. A veszteséggörbe olvasását, a tanulási ütem hangolását, a validációs és tanítóveszteség szétnyílásának jelentését. Ezek a műszerek minden későbbi, nagyobb modellnél ugyanazok, és a finomhangolási munkában is ezek mondják meg, jó úton járunk-e.
A kontextusablak itt válik kézzelfoghatóvá. A modell szó szerint nem látja, ami az ablakon kívül esik. Ez a mondat a nagy modellek használatánál is az egyik legfontosabb, csak ott könnyű elfelejteni.
Források és további olvasnivaló
A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg.