A tanítóadat emlékszik
A modellek képesek megjegyezni a tanítóadatuk egyes darabjait, és megfelelő kérdéssel elő is lehet hívni belőlük. Ha a tanítóadatban személyes adat, ügyféladat vagy üzleti titok van, az a modellen keresztül szivároghat. Ezért az adatközpontú munka része a bekerülő adat átvilágítása is, nem csak a minősége, hanem a tartalma szerint.
A szivárgás iránya
Két irányba lehet baj. Kifelé, amikor a modell válaszaiban jelenik meg olyasmi, aminek nem kellene, és befelé, amikor a kurálás során dolgozó emberek és eszközök látnak olyan adatot, amihez amúgy nem lenne joguk. A második ritkábban kap figyelmet, pedig az adatjavítási munka pont azzal jár, hogy valaki végignézi az adatot. A kurálási munkához ezért hozzáférési szabály is tartozik.
A gyakorlati minimum
Nem kell hozzá nagy apparátus. Egy lista arról, milyen adattípus nem kerülhet tanító vagy visszakeresési anyagba. Egy anonimizálási lépés a bekerülés előtt. Egy felelős, aki a kérdéses eseteket eldönti. És a meglévő adatvédelmi szabályzat kiterjesztése arra, hogy az AI rendszerekbe épült adat is adat.
Az adatközpontú AI nem áll szemben az adatvédelemmel, hanem feltételezi. Aki tudja, mi van az adatában, az tudja megvédeni is. A rendezetlen adatvagyon a minőségi és a biztonsági kockázatot ugyanabból az okból termeli.
Források és további olvasnivaló
A tananyag gerince az MIT ingyenes Introduction to Data-Centric AI kurzusa. A szabályozási oldalhoz az EU AI Act és GDPR megfelelés és az AI policy és belső szabályzat tananyag.