A híd a nagy modellekhez
A sorozatban megépített kicsi GPT és a ma használt nagy modellek között három lépcső van. A lépték, tehát több blokk, szélesebb rétegek, sokkal több adat és gépidő. A tanítás utáni igazítás, az instrukciókövetés és a preferencia-hangolás, amitől a folytatóból asszisztens lesz. És a köréépített rendszer, az eszközhasználat, a visszakeresés, a védőkorlátok. Mindhárom lépcsőhöz van külön tananyag az Academyn.
Mit kezdj ezzel a tudással
A szemlélet, ami megmarad
A sorozat legnagyobb ajándéka nem a kód, hanem a szemlélet. Minden réteg megérthető, ha hajlandók vagyunk a legkisebb működő változatát megépíteni. Ez a hozzáállás a nyelvi modelleken túl is működik, és a cégeknél is ezt tanítom. A kis, működő, megértett rendszer többet ér, mint a nagy, homályos, hitt rendszer.
Ha a nyolc leckéből egyetlen mondat marad meg, ez legyen. A nyelvi modell nem varázslat, hanem veszteségcsökkentés, és aki a veszteséget érti, az a modellt is.
Források és további olvasnivaló
A tananyag Andrej Karpathy ingyenes Neural Networks: Zero to Hero videósorozatát követi, amelyben minden sor kód a szemünk előtt születik meg. A folytatáshoz a Modell finomhangolás a gyakorlatban, a RAG architektúra és a A modern AI stack tananyag.