Az adapter útjai
A kész LoRA adapter kétféleképp élhet tovább. Külön fájlként az alapmodell mellett, ami rugalmas, mert egy alapmodellhez több feladat-adapter tartozhat, és cserélhető. Vagy beolvasztva egyetlen modellfájlba, ami egyszerűbb üzemeltetést ad. Kis rendszernél az olvasztás, sok feladatnál az adapterek a jó irány.
A kvantálás
A futtatási költség fő fogása a kvantálás, a súlyok kisebb pontosságú tárolása. A gyakorlatban a mérsékelt kvantálás alig mérhető minőségvesztéssel felezi vagy negyedeli a memóriaigényt, és ettől fér el egy közepes modell egy erősebb munkaállomáson vagy egy olcsó szerveren. A durva kvantálásnál a minőség már látványosan kopik, ezért a kvantált változatot ugyanazzal a kiértékelő készlettel újra kell mérni.
Saját futtatás mellett szól
- Érzékeny adat, ami nem hagyhatja el a céget
- Nagy, kiszámítható terhelés, ahol a bérelt ár fáj
- Kötött válaszidő igény helyi hálózaton
- A szállítói függés tudatos kerülése
Bérelt futtatás mellett szól
- Ingadozó vagy kis terhelés
- Nincs üzemeltetői kapacitás a modell alá
- Gyors indulás kell, hetek helyett napok
- A csúcsmodellek kellenek, nem a sajátunk
Az üzemeltetés minimuma
A saját modell nem telepítés, hanem üzem. Kell hozzá naplózás, a kérések és válaszok mérése, verziókezelés, hogy tudjuk, melyik adapter fut, és visszaút, ha az új változat gyengébb. Ez ugyanaz a fegyelem, mint bármely éles rendszernél, és enélkül a finomhangolt modell az első csendes romlásnál hitelét veszti.
A jó hír, hogy a kis modell itt is kifizetődik. Amit egy fogyasztói kártyán hangoltunk, az jellemzően szerény vason fut élesben, és a teljes életciklus, tanítás, mérés, futtatás, egyetlen csapat kezében maradhat.
Források és további olvasnivaló
A tananyag gerince a Hugging Face ingyenes smol-course kurzusa, amely kis nyelvi modellek instrukciókövetésre hangolását és igazítását tanítja. A futtatási réteg részleteihez a A modern AI stack és az Ingyenes és nyílt LLM hozzáférés tananyag.