ÉlőUtoljára: 7 perceMa: 30
Kutatás

Kevés súly megváltoztatásával biztonságosabbá tehető a LLaMA-2 chatbot

A LLaMA-2-7B-Chat modell súlyainak csupán 0,19%-ának megváltoztatásával a Basic ASR 53%-ra, a GCG ASR 56%-ra csökken, miközben a tinyBenchmarks pontosság alig romlik (51,6% vs. 52,2% az eredeti modellnél) — derül ki egy friss, előnyomtatott tanulmányból.

Kevés súly megváltoztatásával biztonságosabbá tehető a LLaMA-2 chatbot
Fotó: Olga Kravchuk / Unsplash
forrás: arXiv·AI Forradalom szerk.·
Megosztás

A LLaMA-2-7B-Chat modell biztonsági réseit vizsgálták kutatók, hogy megállapítsák, a modell mely részei a legérzékenyebbek a támadásokra. A cél az volt, hogy erőforrás-korlátozott, on-device AI rendszerekben is hatékonyan lehessen védeni a modelleket.

A kutatás két módszertant alkalmazott: az alacsony rangú biztonsági alrendszer-analízist és a paraméter-szintű fontossági szűrést. Mindkettő arra világított rá, hogy a modell biztonsági érzékenysége nem egyenletes, hanem bizonyos részekre koncentrálódik. Különösen az MLP down_proj réteg bizonyult kiemelten fontosnak a biztonság szempontjából, míg az o_proj kisebb mértékben járult hozzá.

Célzott hibaanalízis

A paraméter-szintű elemzés alapján a kutatók megállapították, hogy a down_proj réteg súlyainak mindössze 0,19%-ának módosítása elegendő a támadási felület jelentős csökkentéséhez. Ez a változtatás 53%-kal mérsékelte a Basic ASR (Adversarial Success Rate) és 56%-kal a GCG ASR (Gradient-based Class-agnostic Attack) mutatókat.

A pontosság megmarad

Fontos eredmény, hogy a biztonsági paraméterek módosítása szinte egyáltalán nem befolyásolta a modell általános teljesítményét. A tinyBenchmarks teszten mért pontosság 51,6%-ra csökkent az eredeti 52,2%-ról, ami gyakorlatilag változatlan. Ez azt jelenti, hogy a célzott hibaanalízis és a szelektív integritásvédelem hatékony megoldás lehet az on-device nyelvi modellek biztonságának növelésére.

Az eredmények előnyomtatott formában jelentek meg az arXiv-on, és arra utalnak, hogy a jövőben célzottan lehet védeni a kritikus paramétereket, anélkül, hogy ez a modell általános képességeit érdemben csökkentené.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom