Task és Trial
Egy task egyetlen konkrét feladatot jelent, amit az ügynöknek végre kell hajtania. Mivel egy ügynök kimenetei futtatásonként változnak, ugyanazt a taskot általában több próbán, azaz trialon keresztül futtatják, hogy megbízhatóbb képet kapjanak a teljesítményről egyetlen futtatás véletlenszerűsége helyett.
Egyetlen trial csak pillanatkép. Mivel az ügynök kimenetei futtatásonként változnak, ugyanazt a taskot több próbán át kell futtatni, különben a véletlent mérjük, nem a teljesítményt.
Grader, Transcript, Outcome
A grader a pontozó logika, ami eldönti, hogy egy adott próba sikeres volt-e. Egy taskhoz akár több grader is tartozhat, ha több szempontból is értékelni akarjuk a teljesítményt. A transcript a teljes rekord, ami tartalmazza a kimeneteket, az eszközhívásokat, és a modell gondolkodási lépéseit is.
Az outcome a végső környezeti állapot, ami sokszor fontosabb, mint amit az ügynök állít magáról. Ha az ügynök azt mondja, hogy sikeresen lefoglalt egy időpontot, az outcome azt vizsgálja, hogy a foglalás tényleg létrejött-e az adatbázisban, nem csak azt, hogy az ügynök ezt állította.
Amit az ügynök állít
Sikeresen lefoglaltam az időpontot. Ez csak egy mondat a transcriptben, önmagában nem bizonyít semmit.
Amit az outcome mutat
A foglalás tényleg létrejött az adatbázisban. A végső környezeti állapot az, ami igazolja a sikert.
Harness és Suite
Az evaluation harness az az infrastruktúra, ami az egész folyamatot futtatja, a taskok kiválasztásától a graderek lefuttatásán át az eredmények összesítéséig. Az agent harness, más néven scaffold, az a rendszer, ami lehetővé teszi, hogy egy nyelvi modell egyáltalán ügynökként működjön, eszközöket hívjon, és sok lépésen át dolgozzon.
Az evaluation suite egymáshoz kapcsolódó taskok gyűjteménye, amik együtt adnak átfogó képet egy adott képességről vagy viselkedésről. A fogalmak pontos ismerete nélkül könnyű összekeverni, hogy éppen mit mérünk, és ez félrevezető következtetésekhez vezethet.
Evaluation harness
Az az infrastruktúra, ami a mérést futtatja. Taskokat választ, trialokat indít, gradereket futtat, eredményt összesít.
Agent harness, más néven scaffold
Az a rendszer, amitől a nyelvi modell egyáltalán ügynökként működik. Eszközöket hív, és sok lépésen át dolgozik.
- Taskok kiválasztásaAz evaluation harness kijelöli, mely feladatok futnak.
- Trialok futtatásaMinden task több próbán át fut a véletlenszerűség kiszűrésére.
- Graderek lefuttatásaA pontozó logika a transcriptet és az outcome-ot is megvizsgálja.
- Eredmények összesítéseA suite szintjén áll össze az átfogó kép a képességről.
Workshop
AI Transformation Day
Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.
Érdekel a program →