Nyelvi modell nulláról · Lecke 04

Többrétegű háló és a kontextusablak

Több karakternyi előzményből jóslunk, beágyazásokkal és rejtett réteggel. Itt születik meg a kontextusablak fogalma.

Vissza a tananyaghoz


A beágyazás megjelenése

Ha három karakter előzményből akarunk jósolni, a táblázat kombinatorikusan felrobban. A megoldás az, hogy minden karakter kap egy kis számvektort, egy beágyazást, és a modell ezekkel a vektorokkal dolgozik tovább. A beágyazás a modern nyelvi modellek egyik alapköve, és itt látszik meg, hogyan tanulja meg magától, melyik karakterek viselkednek hasonlóan.

Az előzményvektorokat egy rejtett réteg gyúrja össze, és a kimenet a következő karakter eloszlása. Ez a többrétegű perceptron nyelvi modell, egy valódi kis neurális háló, amelynek már van kontextusablaka, az a néhány karakter, amennyit lát. A nagy modellek százezres ablaka ugyanennek a fogalomnak a felnőtt változata.

1
Beágyazótábla. Karakterből vektor. Tanulható, és a hasonló szerepű karakterek egymás mellé sodródnak.
2
Rejtett réteg. A kontextus vektorai összegyúrva, nemlinearitással. Itt keletkezik a kifejezőerő.
3
Mini-batch és tanulási ütem. A gyakorlati fogások, amiktől a tanítás órák helyett percek alatt fut.
4
Túlillesztés és felosztás. Tanító, validációs és tesztkészlet. A modell ne a neveket magolja, hanem a nyelvet tanulja.

A műszerfal

Ebben a szakaszban tanítja meg a sorozat a szakma műszereit is. A veszteséggörbe olvasását, a tanulási ütem hangolását, a validációs és tanítóveszteség szétnyílásának jelentését. Ezek a műszerek minden későbbi, nagyobb modellnél ugyanazok, és a finomhangolási munkában is ezek mondják meg, jó úton járunk-e.


A kontextusablak itt válik kézzelfoghatóvá. A modell szó szerint nem látja, ami az ablakon kívül esik. Ez a mondat a nagy modellek használatánál is az egyik legfontosabb, csak ott könnyű elfelejteni.


Források és további olvasnivaló

A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg.