Nyelvi modell nulláról · Lecke 06

A figyelem és a kicsi GPT

A sorozat csúcspontja. Megépül a figyelem mechanizmus, és belőle egy működő, kicsi GPT, Shakespeare-en tanítva.

Vissza a tananyaghoz


A probléma, amit a figyelem megold

A korábbi modellek a kontextust összegyúrták, és a gyúrásban elveszett, mi honnan jött. A figyelem mechanizmus ötlete az, hogy minden pozíció maga dönti el, a korábbi pozíciók közül melyikre mennyire figyel. Minden token kibocsát egy kérdést, egy kulcsot és egy értéket, a kérdések és kulcsok illeszkedése adja a figyelmi súlyokat, és az értékek ezekkel súlyozva folynak össze.

A videó ezt lépésről lépésre, mátrixműveletekként építi fel, és a végén ott áll a transformer blokk, figyelem, előrecsatolt réteg, reziduális kapcsolatok és normalizálás. Ebből a blokkból egymásra rakva születik meg a kicsi GPT, ami Shakespeare szövegén tanulva meglepően hihető álshakespeare-t ír.

1
Kérdés, kulcs, érték. A figyelem három vetülete, és a maszk, amitől a modell nem leshet a jövőbe.
2
Több fej. Párhuzamos figyelmek, amik más-más mintázatokra szakosodnak.
3
A blokk. Figyelem plusz előrecsatolás, reziduálisokkal és normalizálással. A modern modellek legóeleme.
4
A skálázás sejtése. Ugyanez a szerkezet, több blokkal, szélesebb rétegekkel és több adattal, ez a nagy modellek receptje.

Amit a kicsi GPT megtanít a nagyokról

A saját kis GPT két illúziót oszlat el. Az egyik, hogy a szöveggyártás mögött értés van, holott láthatóan eloszlásból mintavételezés történik, és mégis megdöbbentően jó. A másik, hogy a nagy modellek elvben mások, holott a különbség mennyiségi, adat, méret és a tanítás utáni igazítás. A sorozat záró nagy videója ezt a hidat is megmutatja, a GPT-2 újraépítésével.


Innen nézve a saját korábbi tananyagaink is összeérnek. A transzformerek kurzus a fogalmi mélyítés, a finomhangolás kurzus a tanítás utáni élet, ez a sorozat pedig a gépezet maga, csavarokig lebontva.


Források és további olvasnivaló

A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg. A fogalmi párhoz a Transzformerek és a figyelem mechanizmus tananyag.