Új útmutató védi a generatív AI-ügynököket és LLM-alkalmazásokat
A hagyományos alkalmazásbiztonság nem elegendő a generatív AI-ügynökök védelméhez, mivel viselkedésük a kódon kívülről, például a modellből vagy a promptból ered — közölte a Mend.io.

A generatív AI-ügynökök és LLM-alkalmazások gyors terjedése kihívást jelent a hagyományos biztonsági programoknak. A Mend.io új, gyakorlati útmutatója, a „Securing AI agents, MCP servers & LLM apps: A practical framework” célja, hogy ezt a rést betöltse. A dokumentum három fő mozgatórugót követ: a lényeges dolgok megtekintése, a lényeges dolgok gyorsabb javítása, valamint az AI védelme az éles környezetben, hét újrafelhasználható eszközzel. (MarkTechPost)
Miért törik meg a hagyományos AppSec?
A hagyományos alkalmazásbiztonság (AppSec) azon az alapfeltevésen nyugszik, hogy az alkalmazások pontosan azt teszik, amit a kódjuk mond. Az ügynökségi alapú AI (agentic AI) ezt a modellt megtöri. Az ügynökök viselkedése egy modellből, egy rendszer-promptból, lekérdezett kontextusból, felhasználói bevitelből és az általuk használt eszközökből alakul ki. Ez azt jelenti, hogy két azonos telepítés eltérően viselkedhet.
Az új típusú hibamódok is eltérőek: a prompt-injekció adatokon keresztül érkezik, nem kódon. Egy túlengedélyezett ügynök káros műveleteket hajthat végre anélkül, hogy sérülékenységet használt volna ki. Egy elavult modell továbbra is szolgáltat előrejelzéseket, miközben karbantartója már nem foltozza. Egy MCP-szerveren található mérgezett eszközleírás átirányíthatja egy ügynök viselkedését anélkül, hogy az alkalmazáshoz érne. Ezek egyike sem jelenik meg a CVE-adatbázisokban — állítja a Mend.io.
Az öt rétegű támadási felület és az AI-BOM
A Mend.io útmutatója egy öt rétegű támadási felület-térképet javasol: Interakció (felhasználói bevitel, dokumentumok, üzenetek), Ügynök (rendszer-utasítások, beállítások, autonómia), Integráció (MCP szerverek, eszközleírások, API-k), Modell (alap- és finomhangolt modellek, embeddingek) és Kód (AI-generált kód, keretrendszerek). Ezeken a rétegeken keresztül olyan támadások lehetségesek, mint a prompt-injekció, a kontextus-mérgezés, a túlengedélyezett eszközök, a cél-eltérítés, a mérgezett eszközleírások, az elavult modellek vagy a sérülékeny AI-generált kód.
Az ügynökök és MCP-szerverek felderítésére a cég a „shadow agents”, azaz a nem regisztrált ügynökök, az „unregistered MCP servers” és az „embedded AI frameworks” kategóriákat javasolja. A folyamatos automatizálás kulcsfontosságú, mivel az időszakos felderítés gyorsan elavul. Az Artifact 2.1 kiterjeszti az AI-BOM-ot (AI Bill of Materials) kilenc mezővel ügynökönként vagy MCP-serverenként, beleértve az identitást, a modellfüggőséget, az autonómia szintjét, az eszközengedélyeket, a hitelesítőadatok hatókörét, az adatelérést, az MCP-végpontokat, a prompt helyét és az utolsó felülvizsgálatot.
Priorizálás és automatizálás a hibaelhárításban
Az AI kibővítette a talált hibák felületét. A hibaelhárítási folyamat magában foglalja a gazdagítást, a priorizálást és a triázsolást. A priorizálási jelek, értékrendben: elérhetőség, kihasználhatósági kontextus, üzleti kontextus, ügynöki erősítés és javítás elérhetősége. Az Artifact 3.1 lefekteti az automatizálás határait: az elérhetőség és a jól ismert hibák automatizáltan értékelhetők, míg az új típusú viselkedések és a kockázatos döntések emberi felülvizsgálatot igényelnek. Minden automatizált lezárás bizonyítékkal jár; ha a rendszer nem tudja megmutatni, miért téves pozitívum egy hiba, emberi döntéshozatalra kerül.
Futtatókörnyezeti védelem és érettségi útmutató
A futtatókörnyezeti védelem magában foglalja a védőkorlátokat (guardrails), az utasítások keményítését, a szabályzatok érvényesítését és a monitorozást. A védőkorlátok beépíthetők egy Python SDK-n keresztül vagy önálló API-szerverként. Az alapvető beállítások magukban foglalják a bejövő korlátokat a prompt-injekciók, szabályzatellenes kérések és jailbreakek elkapására, valamint a kimenő korlátokat a hitelesítőadatok, személyes adatok, bizalmas kódok, nem biztonságos tartalmak és szabályzatsértések kiszűrésére. A rendszer-utasítások keményítése öt mintát követ, beleértve az utasítások és adatok szétválasztását, a hatókör korlátozását és az adversariális tesztelést. A szigorú engedélyek beállítása hatékonyabb, mint a prompt-utasítások — az eszközhozzáférés megtagadása megszünteti a veszélyes műveletek elleni utasítások szükségességét.
A Mend.io érettségi útmutatója négy szakaszt határoz meg: Feltörekvő, Fejlődő, Ellenőrzött és Vezető. Ez igazodik az NIST AI RMF, OWASP AIMA, ISO/IEC 42001 és az EU AI Act szabványokhoz. Az Artifact 5.1 egy 15 kérdésből álló önértékelés, amely alapján a szervezetek besorolhatják magukat.