Kevés súly megváltoztatásával biztonságosabbá tehető a LLaMA-2 chatbot
A LLaMA-2-7B-Chat modell súlyainak csupán 0,19%-ának megváltoztatásával a Basic ASR 53%-ra, a GCG ASR 56%-ra csökken, miközben a tinyBenchmarks pontosság alig romlik (51,6% vs. 52,2% az eredeti modellnél) — derül ki egy friss, előnyomtatott tanulmányból.

A LLaMA-2-7B-Chat modell biztonsági réseit vizsgálták kutatók, hogy megállapítsák, a modell mely részei a legérzékenyebbek a támadásokra. A cél az volt, hogy erőforrás-korlátozott, on-device AI rendszerekben is hatékonyan lehessen védeni a modelleket.
A kutatás két módszertant alkalmazott: az alacsony rangú biztonsági alrendszer-analízist és a paraméter-szintű fontossági szűrést. Mindkettő arra világított rá, hogy a modell biztonsági érzékenysége nem egyenletes, hanem bizonyos részekre koncentrálódik. Különösen az MLP down_proj réteg bizonyult kiemelten fontosnak a biztonság szempontjából, míg az o_proj kisebb mértékben járult hozzá.
Célzott hibaanalízis
A paraméter-szintű elemzés alapján a kutatók megállapították, hogy a down_proj réteg súlyainak mindössze 0,19%-ának módosítása elegendő a támadási felület jelentős csökkentéséhez. Ez a változtatás 53%-kal mérsékelte a Basic ASR (Adversarial Success Rate) és 56%-kal a GCG ASR (Gradient-based Class-agnostic Attack) mutatókat.
A pontosság megmarad
Fontos eredmény, hogy a biztonsági paraméterek módosítása szinte egyáltalán nem befolyásolta a modell általános teljesítményét. A tinyBenchmarks teszten mért pontosság 51,6%-ra csökkent az eredeti 52,2%-ról, ami gyakorlatilag változatlan. Ez azt jelenti, hogy a célzott hibaanalízis és a szelektív integritásvédelem hatékony megoldás lehet az on-device nyelvi modellek biztonságának növelésére.
Az eredmények előnyomtatott formában jelentek meg az arXiv-on, és arra utalnak, hogy a jövőben célzottan lehet védeni a kritikus paramétereket, anélkül, hogy ez a modell általános képességeit érdemben csökkentené.