A Databook szerint a megbízhatóság kulcsa az LLM-ek varianciája, nem a sebesség
Az LLM-munkafolyamatok megbízhatósága nem a sebességen, hanem a variancián múlik, különösen ügyfél-API-k mögött — állítja Frank Wittkampf a Databook blogján.

Az LLM-vezérelt munkafolyamatok megbízhatósága mögött nem a sebesség, hanem a variancia a kulcsfontosságú tényező, különösen, ha ügyfél-API-król van szó. Frank Wittkampf, a Databook blogján publikált írásában rámutat, hogy a hagyományos optimalizációs módszerek, mint a várakozás vagy a párhuzamos futtatás, gyakran újabb költségekhez vagy időtúllépésekhez vezetnek, miközben a minőségi küszöböt nem szabad átlépni. (Towards Data Science)
A Databooknál milliárdnyi tokent dolgoznak fel vállalati ügyfelek számára. Wittkampf szerint az LLM-hívások négy fő hibatípusa létezik: érvénytelen válasz, kemény hiba, válasz hiánya, vagy késedelmes válasz. Míg belső használat esetén ezek a hibák olcsón orvosolhatók, ügyfél-API mögött a folyamatnak egyszerre kell megfelelnie az idő-, költség- és token/sebességi kereteknek, miközben a minőségi követelmények is változatlanok maradnak.
Kapcsolódó: AI-ügynökök futásidőben
Három erőforrás-budget és egy minőségi küszöb
Egy ügyfél-API mögötti futtatásnak egyszerre kell megfelelnie három, nem általunk meghatározott erőforrás-keretnek: az időablaknak (ami egy kemény timeout vagy SLA formájában jelentkezhet), a költségnek (ami most már árrést jelent, nem pedig egy elnyelhető poolt), valamint a token/sebességi limitnek (TPM), amelyet az összes ügyfél között osztanak meg. Mindezek alatt egy kemény minőségi padló található, amely alatt nem szabad kereskedni – egy helyes válasz elengedhetetlen a sikerhez.
Kapcsolódó: Microsoft AI biztonság
A variancia mérnöki kihívása
Wittkampf szerint a legkevésbé látható költség a késedelem: ha egy válasz túl későn érkezik meg, az a mi oldalunkon sikerként jelenhet meg, de az ügyfél számára kudarcként. A hagyományos megoldások, mint a lassabb lépések kivárása vagy a párhuzamos másolatok futtatása, gyakran rontják a másik költségvetést. A szerző szerint az egyetlen járható út a tudatos kompromisszumok kötése mindhárom költségvetés között, anélkül, hogy a minőségi szint alá esnénk. Ez néha ellentmondásosnak tűnő stratégiákhoz vezethet, mint például egy még nem hibázott hívás leállítása vagy egy már futó hívás duplikálása.
Kapcsolódó: Salesforce AI munkafolyamatok
Gyakorlati tanácsok vállalkozásoknak
A cikkben bemutatott adatok, amelyek több mint egymillió LLM-hívás elemzésén alapulnak, azt mutatják, hogy a kiszámítható befejezési idő sokkal értékesebb, mint a gyors, de hosszú farokkal rendelkező válaszidő. A vállalkozásoknak ezért a legrosszabb eshetőségre kell tervezniük, nem a legjobb esetre. A Databook saját rendszerében a hibás válaszok aránya 20-30 másodperces megszakításokkal csökkenthető, ami megbízhatóbbá teszi a rendszert. A szerző hangsúlyozza, hogy ezek a megállapítások a Databook saját architektúráján alapulnak, és más rendszerek eltérően viselkedhetnek.
Kapcsolódó: AI-ügynökök megbízhatósága
A megbízható LLM-munkafolyamatok tervezése tehát nem csupán a sebesség optimalizálásáról szól, hanem a variancia kezeléséről és a különböző erőforrás-keretek tudatos egyensúlyozásáról. A Databook által javasolt megközelítés, bár ellentmondásosnak tűnhet, gyakorlati megoldást kínál az ügyfél-API-k mögötti megbízható működés biztosítására. A következő lépés a különböző LLM-modellek és szolgáltatók közötti útválasztás finomhangolása lehet a Databook szerint.
Kapcsolódó: AI-kódgyártás sebessége