Kis mintával induló tesztelés
A csapat nem várt egy hatalmas tesztkészletre, hanem mindössze körülbelül 20 reprezentatív lekérdezéssel kezdte a kiértékelést. Ez elég volt ahhoz, hogy a nagyobb, egyértelmű hibákat gyorsan felszínre hozzák, mielőtt a rendszert nagyobb léptékben tesztelték volna.
Ennyi reprezentatív lekérdezéssel indult a kiértékelés. Kis minta is elég a nagy, egyértelmű hibák gyors felszínre hozásához.
- Kis mintás tesztKörülbelül 20 reprezentatív lekérdezés futtatása.
- Nagy hibák javításaAz egyértelmű problémák még kis léptékben kiderülnek.
- Automatikus kiértékelésLLM-as-judge pontozza a válaszokat több szempont szerint.
- Emberi felülvizsgálatA tesztelők megfogják az automatika által átsiklott él-eseteket.
LLM-as-judge módszer
A válaszok minőségét egy másik AI ügynök értékelte ki, több szempont alapján. Ezek közé tartozott a tényszerű pontosság, a hivatkozások pontossága, a válasz teljessége, a felhasznált források minősége, valamint az, mennyire hatékonyan használta az ügynök az elérhető eszközöket. Ez a módszer sokkal gyorsabb, mint ha minden egyes választ ember nézne át, ugyanakkor nem helyettesíti teljesen az emberi ellenőrzést.
LLM-as-judge
- Gyors, nagy volumenben is skálázható
- Öt szempont szerint pontoz automatikusan
- Az él-eseteken átsiklik
Emberi felülvizsgálat
- Lassabb, de megfogja az él-eseteket
- Észreveszi a forrásválasztás hibáit
- Nem helyettesíthető, csak kiegészíthető
Amit csak emberek vettek észre
Bármennyire is hasznos az automatikus kiértékelés, az emberi tesztelők olyan él-eseteket fogtak meg, amiket az LLM-as-judge módszer átsiklott. Az egyik legfontosabb ilyen eset az volt, amikor egy ügynök egy SEO-optimalizált, de tartalmilag gyengébb forrást részesített előnyben egy hiteles akadémiai forrással szemben. Ez rávilágított arra, hogy a minőségi kiértékelésbe mindig be kell építeni emberi felülvizsgálatot is, különösen a forrásválasztás megbízhatóságának ellenőrzésére.
Amit az ügynök választott
SEO szempontból optimalizált, de tartalmilag gyengébb forrás. Az automatikus kiértékelés ezt nem jelezte hibának.
Amit választania kellett volna
Hiteles akadémiai forrás. Csak az emberi tesztelő vette észre, hogy az ügynök rosszul rangsorolt.
Workshop
AI Transformation Day
Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.
Érdekel a program →