Adatközpontú AI · Lecke 02

Címkehibák és a magabiztos tanulás

A tanítóadat egy része rosszul van címkézve, és ez lehúzza az egész rendszert. Hogyan találjuk meg a hibákat gépi segítséggel.

Vissza a tananyaghoz


A címkehiba mindenhol ott van

Ahol ember címkéz, ott hiba is van. Elfáradás, félreértett útmutató, kétértelmű eset, elcsúszott sor a táblázatban. Az MIT kurzus egyik központi témája az, hogy ezt nem kell elfogadni adottságként, mert a hibás címkék jelentős része gépi módszerrel megtalálható.

Az alapötlet, amit magabiztos tanulásnak hívnak, hétköznapi nyelven így hangzik. Tanítsunk egy modellt a meglévő adaton, és nézzük meg, hol tér el nagyon magabiztosan a modell véleménye a címkétől. Ahol a modell szinte biztos abban, hogy a példa más kategóriába tartozik, mint amit a címke mond, ott jó eséllyel a címke a hibás, nem a modell.


A munkamenet

1
Gyanúlista készítése. A modell és a címke ütközéseiből rangsor készül, a legmagabiztosabb ütközések előre.
2
Emberi átnézés felülről. Nem a teljes adatot nézzük át, csak a gyanúlista tetejét. Ez a különbség a heteken át tartó audit és a néhány órás munka között.
3
Javítás vagy kidobás. A hibás címke javítható, a menthetetlen példa törölhető. Mindkettő jobb, mint bent hagyni.
4
Újratanítás és mérés. A javított adaton újra tanítunk, és a javulást mérjük, nem érezzük.

Hol jön ez elő egy magyar cégnél

Nem csak gépi tanulási projektben. Ugyanez a logika működik az ügyfélszolgálati jegyek kategorizálásánál, a CRM-ben lévő iparági besorolásoknál, a termékadatoknál. Egy ügyfelemnél a támogatási jegyek harmada rossz kategóriában volt, és emiatt tűnt úgy, hogy a rendszer rosszul irányít. A javítás után ugyanaz a rendszer jól működött.


A fontos elv az, hogy a gép rangsorol, az ember dönt. A gyanúlista nem ítélet, hanem sorrend, ami az emberi figyelmet oda irányítja, ahol a legtöbb hibát találja óránként.


Források és további olvasnivaló

A tananyag gerince az MIT ingyenes Introduction to Data-Centric AI kurzusa.