A probléma, amit a figyelem megold
A korábbi modellek a kontextust összegyúrták, és a gyúrásban elveszett, mi honnan jött. A figyelem mechanizmus ötlete az, hogy minden pozíció maga dönti el, a korábbi pozíciók közül melyikre mennyire figyel. Minden token kibocsát egy kérdést, egy kulcsot és egy értéket, a kérdések és kulcsok illeszkedése adja a figyelmi súlyokat, és az értékek ezekkel súlyozva folynak össze.
A videó ezt lépésről lépésre, mátrixműveletekként építi fel, és a végén ott áll a transformer blokk, figyelem, előrecsatolt réteg, reziduális kapcsolatok és normalizálás. Ebből a blokkból egymásra rakva születik meg a kicsi GPT, ami Shakespeare szövegén tanulva meglepően hihető álshakespeare-t ír.
Amit a kicsi GPT megtanít a nagyokról
A saját kis GPT két illúziót oszlat el. Az egyik, hogy a szöveggyártás mögött értés van, holott láthatóan eloszlásból mintavételezés történik, és mégis megdöbbentően jó. A másik, hogy a nagy modellek elvben mások, holott a különbség mennyiségi, adat, méret és a tanítás utáni igazítás. A sorozat záró nagy videója ezt a hidat is megmutatja, a GPT-2 újraépítésével.
Innen nézve a saját korábbi tananyagaink is összeérnek. A transzformerek kurzus a fogalmi mélyítés, a finomhangolás kurzus a tanítás utáni élet, ez a sorozat pedig a gépezet maga, csavarokig lebontva.
Források és további olvasnivaló
A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg. A fogalmi párhoz a Transzformerek és a figyelem mechanizmus tananyag.