Amit a példapár nem tud
A felügyelt finomhangolás megtanítja, milyen egy jó válasz. Azt viszont nem tudja megtanítani, mi a különbség két elfogadható válasz között, melyik a tömörebb, az udvariasabb, a cégünk hangján szólóbb. Ehhez páros ítéletek kellenek, ugyanarra a kérdésre egy előnyben részesített és egy elutasított válasz.
A klasszikus út, az emberi visszajelzéses megerősítéses tanulás, külön jutalommodellt és bonyolult tanítási kört igényel. A közvetlen preferencia-optimalizálás, a DPO, ezt egyszerűsítette le. A páros ítéletekből közvetlenül tanul, külön jutalommodell nélkül, és ettől a preferencia-hangolás a kis csapatok számára is elérhetővé vált.
Céges környezetben a preferencia-adat gyűjtése beépíthető a munkamenetbe. Ahol a kolléga amúgy is jóváhagyja vagy javítja a kimenetet, ott minden döntése egy preferencia-pár, és fél év alatt összegyűlik az, amiért máshol külön annotálási projektet indítanak.
Források és további olvasnivaló
A tananyag gerince a Hugging Face ingyenes smol-course kurzusa, amely kis nyelvi modellek instrukciókövetésre hangolását és igazítását tanítja. A megerősítéses tanulás hátteréhez a Reinforcement learning és RLHF tananyag.