A címkehiba mindenhol ott van
Ahol ember címkéz, ott hiba is van. Elfáradás, félreértett útmutató, kétértelmű eset, elcsúszott sor a táblázatban. Az MIT kurzus egyik központi témája az, hogy ezt nem kell elfogadni adottságként, mert a hibás címkék jelentős része gépi módszerrel megtalálható.
Az alapötlet, amit magabiztos tanulásnak hívnak, hétköznapi nyelven így hangzik. Tanítsunk egy modellt a meglévő adaton, és nézzük meg, hol tér el nagyon magabiztosan a modell véleménye a címkétől. Ahol a modell szinte biztos abban, hogy a példa más kategóriába tartozik, mint amit a címke mond, ott jó eséllyel a címke a hibás, nem a modell.
A munkamenet
Hol jön ez elő egy magyar cégnél
Nem csak gépi tanulási projektben. Ugyanez a logika működik az ügyfélszolgálati jegyek kategorizálásánál, a CRM-ben lévő iparági besorolásoknál, a termékadatoknál. Egy ügyfelemnél a támogatási jegyek harmada rossz kategóriában volt, és emiatt tűnt úgy, hogy a rendszer rosszul irányít. A javítás után ugyanaz a rendszer jól működött.
A fontos elv az, hogy a gép rangsorol, az ember dönt. A gyanúlista nem ítélet, hanem sorrend, ami az emberi figyelmet oda irányítja, ahol a legtöbb hibát találja óránként.
Források és további olvasnivaló
A tananyag gerince az MIT ingyenes Introduction to Data-Centric AI kurzusa.