Modell finomhangolás a gyakorlatban · Lecke 05

Preferencia-hangolás, DPO és társai

Az instrukciókövetés után jön az ízlés. Hogyan tanulja meg a modell, hogy két jó válasz közül melyik a jobb.

Vissza a tananyaghoz


Amit a példapár nem tud

A felügyelt finomhangolás megtanítja, milyen egy jó válasz. Azt viszont nem tudja megtanítani, mi a különbség két elfogadható válasz között, melyik a tömörebb, az udvariasabb, a cégünk hangján szólóbb. Ehhez páros ítéletek kellenek, ugyanarra a kérdésre egy előnyben részesített és egy elutasított válasz.

A klasszikus út, az emberi visszajelzéses megerősítéses tanulás, külön jutalommodellt és bonyolult tanítási kört igényel. A közvetlen preferencia-optimalizálás, a DPO, ezt egyszerűsítette le. A páros ítéletekből közvetlenül tanul, külön jutalommodell nélkül, és ettől a preferencia-hangolás a kis csapatok számára is elérhetővé vált.

1
Előfeltétel. A DPO instrukciókövető modellre épül. Előbb a felügyelt hangolás, aztán a preferencia.
2
A párok forrása. A saját rendszerünk két kimenete, amiből a kolléga választ. A napi munka ítéletei a legolcsóbb és legjobb preferencia-adat.
3
A tipikus haszon. Hangnem, tömörség, formátumfegyelem, a visszautasítások stílusa. Nem új tudás, hanem csiszolás.
4
A mérték. A túlhangolt modell modoros lesz és butul. Kis lépések, gyakori kiértékelés.

Céges környezetben a preferencia-adat gyűjtése beépíthető a munkamenetbe. Ahol a kolléga amúgy is jóváhagyja vagy javítja a kimenetet, ott minden döntése egy preferencia-pár, és fél év alatt összegyűlik az, amiért máshol külön annotálási projektet indítanak.


Források és további olvasnivaló

A tananyag gerince a Hugging Face ingyenes smol-course kurzusa, amely kis nyelvi modellek instrukciókövetésre hangolását és igazítását tanítja. A megerősítéses tanulás hátteréhez a Reinforcement learning és RLHF tananyag.


← Az adat, amin az egész múlikKiértékelés finomhangolás után →