Az átlag hazudik
Egy rendszer lehet összességében kilencven százalékos úgy, hogy a legfontosabb ügyféltípusnál hatvan. Az összesített pontszám ezt elfedi, a szeletenkénti mérés megmutatja. Az adatközpontú kiértékelés lényege, hogy az adatot értelmes szeletekre bontjuk, ügyféltípus, termékvonal, nyelv, időszak szerint, és minden szeletre külön nézzük a teljesítményt.
A szeletek kijelölése üzleti döntés. Ott kell külön mérni, ahol a tévedés ára más, vagy ahol a szerződés mást ígér.
A hibaboncolás
Ez a négy lépés a leghasznosabb rutin, amit ebből a tananyagból haza lehet vinni. Nem igényel eszközt, csak fegyelmet, és minden AI rendszernél működik, a kis belső csetbottól a nagy éles rendszerig.
A tesztadat szent
Egy hiba van, ami az összes mérést érvényteleníti, ha a tesztadat beszivárog a tanításba. Ha a rendszer olyan példákon vizsgázik, amiket látott tanulás közben, az eredmény szép lesz és hamis. A tesztkészletet ezért külön kell tartani, dátumozni, és ugyanolyan gondosan tisztítani, mint a tanítóadatot, mert a hibás címke a tesztben azt jelenti, hogy a jó rendszert büntetjük.
A kiértékelő adat karbantartása a legjobb megtérülésű adatmunka. Kicsi, ezért olcsó rendben tartani, és minden fejlesztési döntés rajta múlik.
Források és további olvasnivaló
A tananyag gerince az MIT ingyenes Introduction to Data-Centric AI kurzusa. A mérés módszertanáról bővebben a Context engineering és evalok tananyagban.