Nyelvi modell nulláról · Lecke 05

A tanítás finomságai

Aktivációk, gradiensek, normalizálás. A rész, amit mindenki átugrana, és amiből a gyakorlati szakértelem lesz.

Vissza a tananyaghoz


Miért itt terem a szakértelem

A sorozat középső, legkevésbé csillogó része a tanítás egészségéről szól, és Karpathy szerint is ez választja el a felhasználót a szakembertől. Mi történik a hálóban tanítás közben, milyen eloszlásúak az aktivációk, merre folynak a gradiensek, és mitől hal el vagy robban fel a tanulás.

A videók megmutatják a tipikus betegségeket. A telítődő nemlinearitást, amin keresztül nem folyik gradiens. A rossz inicializálást, amitől az első lépések a kárt hozzák helyre a tanulás helyett. És a rétegek közötti eloszlások vándorlását, amire a válasz a normalizálás.

1
Inicializálás. A súlyok kezdő skálája nem részlet, hanem a tanulás feltétele. A helyes skála levezethető és ellenőrizhető.
2
Aktiváció-statisztikák. Hisztogramok rétegenként. Az egészséges háló eloszlásai stabilak, a betegé szélre tapadnak.
3
Batch normalizálás. A rétegek kimenetének kordában tartása, előnyeivel és furcsaságaival együtt.
4
A visszaterjesztés még egyszer, tenzorokon. A backprop ninja gyakorlat, kézzel, mátrixokon. Aki ezt megcsinálja, annak nincs több fekete doboz.

A mélyebb háló

A szakasz vége felé a modell fává mélyül, a karaktereket fokozatosan, párosával összegző szerkezetbe, a WaveNet ihletésű architektúrába. A tanulság kettős. A mélység növeli a kifejezőerőt, és minden mélyítés újra előhozza a tanítási egészség kérdéseit. A szerszámok, amiket az előző lecke adott, itt vizsgáznak.


Ez a lecke ad választ arra is, miért ilyen drága a jó gépi tanulási szakember. Nem a keretrendszer hívása a tudás, hanem a beteg tanítás felismerése és meggyógyítása. Ezt pedig csak az tudja, aki látta már egészségesen és betegen is.


Források és további olvasnivaló

A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg.