Saját AI termék építése a gyakorlatban · Lecke 03

Az adat a nehéz rész

A cégek gyakran azt hiszik, hogy egy AI megoldásnál a fejlesztés a nagy munka. Aztán a projekt közepén kiderül, hogy az adat előkészítése kíván sokkal többet. Ebben a leckében megnézzük, miért az adat összegyűjtése, tisztítása és karbantartása a legtöbb projekt valódi súlypontja, és mit jelent ez a tervezésben egy vezetőnek.

Vissza a tananyaghoz


Amit a cégek elsőre alábecsülnek

Amikor egy szervezet belevág az első komoly AI megoldásba, a figyelem szinte mindig a látványos részre irányul. Melyik modellt válasszuk, hogyan írjuk meg a promptot, hogyan kössük be az API-t. Ezek fontos kérdések, de a tapasztalat azt mutatja, hogy nem itt dől el a projekt sorsa. A tényleges idő és energia java része máshová kerül. Az adat összeszedése, rendbe tétele és folyamatos karbantartása a legtöbb projektben nagyobb feladat, mint maga az AI rész.

Ennek egyszerű oka van. Egy modell csak azzal tud dolgozni, amit odaadunk neki. Ha a bemenet hiányos, ellentmondásos vagy elavult, a kimenet is az lesz, függetlenül attól, milyen fejlett a modell. A jó AI megoldás mögött szinte mindig ott egy adathalmaz, amelyet szétszórt helyekről kell összegyűjteni, egységes formára hozni, megtisztítani a felesleges és hibás részektől, majd frissen tartani. Ez a munka nem látványos, ezért könnyű alábecsülni, mégis ez viszi el az erőforrások nagyobbik felét.

Érdemes tisztázni, mit értünk adat alatt. Nem feltétlenül nagy táblázatokra vagy adatbázisokra kell gondolni. Sok cégnél a legértékesebb tudás dokumentumokban, levelezésben, jegyzőkönyvekben és a munkatársak fejében van, olyan formában, amelyet egy gép önmagában nem ért meg. Ahhoz, hogy egy AI megoldás ezt használni tudja, ezt a szétszórt, sokféle formájú tudást kell összegyűjteni és géppel kezelhető, egységes formába önteni. Ez a fordítás a szervezet nyelvéről a gép nyelvére önmagában jelentős munka, és rendszerint jóval a modell megjelenése előtt kezdődik.


AZ ÚT A HASZNÁLHATÓ ADATHALMAZIG Excel PDF email Nyers, szétszórt adat Gyűjtés Tisztítás Karbantartás Használható adathalmaz A modell csak a jobb szélen kezd dolgozni, előtte a teljes út emberi munka. az idő nagy része itt ide szokás tervezni
A nyers, szétszórt adattól a használható adathalmazig több lépés vezet, és a projekt ideje jórészt ezen az úton telik, nem a modellnél.

Egy fiktív céges példa

Vegyünk egy fiktív hazai céget, a Kékvonal Kft.-t, amely egy közepes méretű webshopot üzemeltet. A vezetés úgy dönt, hogy AI-alapú ügyfélszolgálati asszisztenst szeretne, amely a beérkező kérdésekre a cég saját termékadatai alapján válaszol. A terv első hallásra egyszerűnek tűnik. A gyakorlatban viszont kiderül, hogy a válaszokhoz szükséges tudás nem egy helyen van.

A termékleírások egy része a webshop adatbázisában szerepel, egy másik része egy régóta vezetett Excel táblában. A beszállítói adatlapok PDF fájlokban érkeznek, gyakran eltérő formátumban. A visszárura és a garanciára vonatkozó szabályok egy belső dokumentumban vannak, a korábbi ügyfélválaszok pedig több ezer email szálban és a ticketrendszerben. Ugyanaz a termék háromféle néven szerepel három helyen, néhány ár már nem aktuális, és van olyan leírás, amelyet évek óta nem frissítettek. Mielőtt bármilyen modell egyetlen kérdésre is válaszolni tudna, ezt az egészet össze kell szedni és rendbe kell tenni.

Fontos látni, hogy egyik forrással sincs önmagában baj. Az Excel tábla jó szolgálatot tett éveken át, a PDF adatlapok pontosak, a régi email szálak valódi, jól megválaszolt eseteket őriznek. A nehézség abból ered, hogy ezek külön szigeteken élnek, más-más logika szerint, és soha nem volt céljuk, hogy egy közös rendszer olvassa őket. Az AI projekt épp ezt a közös nézetet követeli meg, és ennek megteremtése az, ami időigényes. A Kékvonal csapata itt szembesül azzal, hogy a valódi feladat nem a modell körül van, hanem az adat körül.


  1. ÖsszegyűjtésA szétszórt forrásokból, adatbázisból, Excel táblákból, PDF fájlokból, emailekből és belső dokumentumokból egy helyre hozzuk a tartalmat.
  2. EgységesítésKözös szerkezetre alakítjuk, hogy ugyanaz a mező mindenhol ugyanazt jelentse, és a termék egy néven fusson.
  3. TisztításKidobjuk a duplikátumokat, a hibás és elavult tételeket, feloldjuk az ellentmondó adatokat.
  4. GazdagításKontextust és címkéket adunk hozzá, hogy a modell később meg tudja találni a kérdéshez tartozó releváns részt.
  5. KarbantartásA változásokat és a frissítéseket visszavezetjük, hogy az adat idővel se romoljon el.

A tisztítás a láthatatlan munka

A felsorolt lépések közül a tisztítás az, amit a legnehezebb előre felmérni, mert csak akkor derül ki, mennyi benne a munka, amikor az ember belenéz az adatba. Kiderül, hogy ugyanaz az ügyfél háromféle írásmóddal szerepel, hogy egy mező hol dátumot, hol szabad szöveget tartalmaz, hogy két rendszer ugyanarra a termékre más azonosítót használ. Ezeket a hibákat egyesével kell felismerni, és eldönteni, mi a helyes érték. Nincs olyan gomb, amely ezt magától megoldja, mert a döntéshez sokszor a szervezet saját ismerete kell.

Ez az oka annak, hogy a tisztításra szánt idő szinte mindig alá van becsülve. Kívülről egyszerű takarításnak tűnik, valójában sok apró szakmai döntés sorozata. Aki egyszer végigcsinálta, tudja, hogy itt nyerhető a legtöbb minőség, és itt veszíthető a legtöbb idő, ha valaki félvállról veszi.


Miért akad el a legokosabb modell is

Sokan azt remélik, hogy egy elég erős modell majd átlép a rendetlen adaton. Ez tévedés. Ha a Kékvonal asszisztense egy elavult árlistából dolgozik, magabiztosan rossz árat fog mondani. Ha ugyanarra a termékre három ellentmondó leírást talál, vagy találomra választ közülük, vagy összekeveri a jellemzőket. A modell nem tudja, melyik forrás a hiteles, ha ezt nem mi tisztázzuk előre helyette. A régi elv itt is igaz. Amilyen az adat, olyan a válasz. A legfejlettebb modell sem tud pontos lenni pontatlan alapon.

Ezért félrevezető úgy gondolni az AI-ra, mint egy dobozra, amelybe bármilyen nyersanyagot beledobhatunk, és a végén rendezett eredmény jön ki. A minőség nem a modellnél kezdődik, hanem jóval előtte, annál a kérdésnél, hogy rendben van-e az, amivel dolgozik. Egy gyenge adathalmazra épített, gyönyörűen felépített megoldás is használhatatlan válaszokat ad, és a felhasználó bizalmát pár rossz élmény után nehéz visszaszerezni.


5

Az AI bevezetés jó része valójában adatprojekt. Öt lépés visz el az adaton, mielőtt a modell egyáltalán dolgozni kezdene. Ezért az időt és az erőforrást már a tervezéskor erre is be kell osztani, nem csak a fejlesztésre.


A karbantartás sosem ér véget

Az adatprojektnek van egy része, amelyről a tervezéskor a legkönnyebb megfeledkezni. Az adat nem áll meg egy ponton. A Kékvonal kínálata bővül, az árak változnak, új beszállítók jönnek, régi termékek kifutnak. Ha az asszisztens mögötti adathalmaz nem követi ezeket a változásokat, a megoldás lassan, észrevétlenül romlik. Néhány hónap múlva már megbízhatatlan válaszokat ad, pedig a modell ugyanaz maradt. A karbantartás nem egyszeri lépés, hanem folyamatos feladat, amelyhez felelőst és rendszert kell rendelni.

A legtöbb projekt tervezésekor pontosan ez a rész marad ki. A csapat kiszámolja, mennyibe kerül felépíteni a megoldást, de nem számol azzal, mennyibe kerül életben tartani. Az adat frissen tartása azonban ugyanúgy erőforrást igényel, mint a felépítése. Ha ez nincs betervezve, a szép indulás után a megoldás minősége lejtőre kerül.


Amit elsőre nagy munkának hiszünk

  • A modell kiválasztása
  • A prompt megírása
  • Az API bekötése
  • A felület összerakása

Amivel a projekt ideje valójában telik

  • Az adat összegyűjtése a forrásokból
  • Egységesítés és tisztítás
  • Az ellentmondások feloldása
  • Folyamatos karbantartás

Mit jelent ez egy vezetőnek

A tanulság vezetői szinten világos. Az AI bevezetés jó része nem modellezési, hanem adatkérdés, ezért már a tervezéskor számolni kell vele. Aki az időt és az erőforrást csak a fejlesztésre osztja be, menet közben fog szembesülni azzal, hogy a projekt valódi súlypontja máshol van, és a határidők csúszni kezdenek. Ez nem a csapat hibája, hanem egy visszatérő tévedés arról, hogy hol van a nehéz rész.

Érdemes a projekt elején feltenni néhány kérdést. Hol van most az adat, és hány különböző helyen. Ki felel a minőségéért. Mennyire naprakész, és milyen gyakran változik. Van-e olyan ember és folyamat, amely a karbantartást hosszú távon fenntartja. Ezek nem technikai apróságok, hanem a projekt gerince. Ha ezekre a kérdésekre a kezdet kezdetén van válasz, az AI rész a helyére kerül. Ha nincs, a legjobban megírt megoldás is homokra épül.

A jó hír, hogy ez a munka nem vész el. Az összegyűjtött, megtisztított és karbantartott adathalmaz nem csak az adott AI megoldást szolgálja ki, hanem a szervezet közös értékévé válik, amelyre a következő projektek is építhetnek. Aki egyszer rendet tesz az adatai között, annak a második és a harmadik AI megoldása már sokkal gyorsabban elkészül. Így az első projekt adatmunkája valójában befektetés, nem pusztán költség.

A következő leckében arról lesz szó, hogy a terméket és a mögötte álló folyamatot sem elég egyszer megépíteni. Mindkettőt folyamatosan fejleszteni kell, különben a kezdeti eredmény nem tart ki sokáig.


← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →