Multi-agent workflowk · Lecke 07

Termelési megbízhatóság

Egy hosszan futó, több ügynökből álló rendszernél a hibák nem kivételek, hanem várható események. A megbízhatóság az állapotkezelésen, a megfigyelhetőségen és a körültekintő verziófrissítésen múlik.

Vissza a tananyaghoz


Állapot fenntartása sok eszközhívás során

Egy komplex kutatási feladat során a rendszer sokszor tíz vagy száz eszközhívást is végrehajt, mire elkészül a végleges válasz. Ha ez idő alatt bármelyik lépés meghibásodik, a rendszernek nem szabad nulláról újrakezdenie a munkát. Ehelyett checkpointokat használnak, vagyis a folyamat közbenső állapotát rendszeresen elmentik, így hiba esetén a legutóbbi mentett ponttól tud folytatódni a feldolgozás.


~100

Akár ennyi eszközhívás is lefuthat egyetlen komplex kutatási feladat során. Ennyi lépésnél a hiba nem kivétel, hanem várható esemény.


  1. Közbenső állapot mentéseA rendszer rendszeresen checkpointot készít a folyamat állásáról.
  2. Hiba történikEgy eszközhívás vagy lépés meghibásodik a sok közül.
  3. Visszaállás a checkpointraA rendszer a legutóbbi mentett pontot tölti be, nem nulláról indul.
  4. Folytatás a maradék munkávalCsak a hiba utáni lépéseket kell újra végrehajtani.

checkpoint 1 checkpoint 2 hiba történik újraindítás az utolsó checkpointból, nem nulláról kész válasz
Hiba esetén a rendszer a legutóbbi checkpointból folytatja, nem kezdi elölről a munkát.

Megfigyelhetőség beszélgetéstartalom nélkül

Amikor egy ügynök elakad vagy hibázik, fontos megérteni miért, ugyanakkor az adatvédelem miatt a rendszernek nincs hozzáférése a beszélgetés tényleges tartalmához. Ez azt jelenti, hogy a megfigyelhetőségnek olyan jelzésekre kell épülnie, mint az eszközhívások sorrendje, időzítése és eredménye, nem pedig magára a szövegre. Ez a fajta megfigyelhetőség teszi lehetővé a rendszerszintű hibák felderítését anélkül, hogy a felhasználói tartalomba be kellene tekinteni.


Amihez nem nyúl a rendszer

  • A beszélgetés tényleges szövege
  • A felhasználó által megosztott tartalom
  • A válaszok tartalmi része

Amire a megfigyelhetőség épül

  • Az eszközhívások sorrendje
  • A hívások időzítése
  • A hívások eredménye, siker vagy hiba

Rainbow deployment a futó ügynökök védelmére

Amikor egy új verziót vezetnek be, nem lehet egyszerűen egyik pillanatról a másikra lecserélni a régi rendszert, mert az éppen futó, hosszabb ideig tartó ügynökfolyamatokat ez megszakítaná. Az úgynevezett "rainbow deployment" megoldás fokozatosan tereli át a forgalmat a régi verzióról az újra, úgy hogy a már elindult munkafolyamatok végig futhatnak a régi verzión, míg az új kérések már az új verziót használják.


Azonnali csere

A régi verzió egyik pillanatról a másikra leáll. A hosszan futó ügynökfolyamatok félbeszakadnak, a megkezdett munka elvész.

Rainbow deployment

A forgalom fokozatosan terelődik át. A már elindult munkafolyamatok végig futnak a régi verzión, az új kérések az újat kapják.


RAINBOW DEPLOYMENT, FOKOZATOS ÁTÁLLÁS régi verzió, futó ügynökök befejezik új verzió, új kérések ide kerülnek nincs megszakadt ügynökfolyamat
A rainbow deployment fokozatosan tereli át a forgalmat, a futó munkafolyamatok nem szakadnak meg.

← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →