Context engineering és evalok · Lecke 06

Mi az az eval

Egy AI ügynök fejlesztése méréssel kezdődik. Task, grader, transcript, outcome, ezek az alapfogalmak nélkül nem lehet objektíven eldönteni, hogy egy változtatás tényleg javított-e valamin.

Vissza a tananyaghoz


Task és Trial

Egy task egyetlen konkrét feladatot jelent, amit az ügynöknek végre kell hajtania. Mivel egy ügynök kimenetei futtatásonként változnak, ugyanazt a taskot általában több próbán, azaz trialon keresztül futtatják, hogy megbízhatóbb képet kapjanak a teljesítményről egyetlen futtatás véletlenszerűsége helyett.


Task Trial 1 Trial 2 Trial 3 Grader kiértékeli a transcriptot és az outcome-ot
Egy taskhoz több trial tartozik, mert a kimenetek futtatásonként változnak.

1

Egyetlen trial csak pillanatkép. Mivel az ügynök kimenetei futtatásonként változnak, ugyanazt a taskot több próbán át kell futtatni, különben a véletlent mérjük, nem a teljesítményt.


Grader, Transcript, Outcome

A grader a pontozó logika, ami eldönti, hogy egy adott próba sikeres volt-e. Egy taskhoz akár több grader is tartozhat, ha több szempontból is értékelni akarjuk a teljesítményt. A transcript a teljes rekord, ami tartalmazza a kimeneteket, az eszközhívásokat, és a modell gondolkodási lépéseit is.

Az outcome a végső környezeti állapot, ami sokszor fontosabb, mint amit az ügynök állít magáról. Ha az ügynök azt mondja, hogy sikeresen lefoglalt egy időpontot, az outcome azt vizsgálja, hogy a foglalás tényleg létrejött-e az adatbázisban, nem csak azt, hogy az ügynök ezt állította.


Transcript kimenet, eszközhívás, reasoning Outcome tényleges környezeti állapot Grader pass / fail ítélet
A grader mindkét forrást felhasználja, a transcript folyamatát és a valós outcome-ot is.

Amit az ügynök állít

Sikeresen lefoglaltam az időpontot. Ez csak egy mondat a transcriptben, önmagában nem bizonyít semmit.

Amit az outcome mutat

A foglalás tényleg létrejött az adatbázisban. A végső környezeti állapot az, ami igazolja a sikert.


Harness és Suite

Az evaluation harness az az infrastruktúra, ami az egész folyamatot futtatja, a taskok kiválasztásától a graderek lefuttatásán át az eredmények összesítéséig. Az agent harness, más néven scaffold, az a rendszer, ami lehetővé teszi, hogy egy nyelvi modell egyáltalán ügynökként működjön, eszközöket hívjon, és sok lépésen át dolgozzon.

Az evaluation suite egymáshoz kapcsolódó taskok gyűjteménye, amik együtt adnak átfogó képet egy adott képességről vagy viselkedésről. A fogalmak pontos ismerete nélkül könnyű összekeverni, hogy éppen mit mérünk, és ez félrevezető következtetésekhez vezethet.


Evaluation harness

Az az infrastruktúra, ami a mérést futtatja. Taskokat választ, trialokat indít, gradereket futtat, eredményt összesít.

Agent harness, más néven scaffold

Az a rendszer, amitől a nyelvi modell egyáltalán ügynökként működik. Eszközöket hív, és sok lépésen át dolgozik.


  1. Taskok kiválasztásaAz evaluation harness kijelöli, mely feladatok futnak.
  2. Trialok futtatásaMinden task több próbán át fut a véletlenszerűség kiszűrésére.
  3. Graderek lefuttatásaA pontozó logika a transcriptet és az outcome-ot is megvizsgálja.
  4. Eredmények összesítéseA suite szintjén áll össze az átfogó kép a képességről.

← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →