ÉlőUtoljára: az iméntMa: 17
Modellek & LLMfrissítve: 21:15

Shieldstral 84,9 %-os F1‑pontszámot ér el a szöveges biztonsági teszten

84,9 %-os F1‑pontszámot ér el a Shieldstral a szöveges biztonsági teljesítményteszten, a 3 milliárd paraméteres Mistral‑modell ezzel felülmúlja a 20 milliárd paraméteres OpenAI GPT‑OSS‑Safeguard‑20B‑t.

Shieldstral 84,9 %-os F1‑pontszámot ér el a szöveges biztonsági teszten
Fotó: Shubham Dhage / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Futásidejű szabályok egy tokenben

Shieldstral egyetlen tokennel válaszol a plain‑language kérdésekre, így 0‑tól 1‑ig terjedő biztonsági pontszámot ad. Az operátorok a kérdéseket szövegesen írják meg, például „Erőszakot népszerűsít ez a tartalom?”, és a modell csak „yes” vagy „no” választ ad – a válasz valószínűsége határozza meg a pontszámot. — írja a The Decoder

Szintetikus adatokkal tanítva

A kutatók körülbelül 54,1 millió szintetikus példát használtak, amelyek biztonsági, káros tartalmi és manipulációs kísérleteket egyesítenek. A finomhangolt kategóriákhoz a szintetikus adatok 23,3 százalékpontos növekedést hoztak az F1‑eredményben, ez a fő hajtóereje a modell alkalmazkodóképességének.

teljesítményteszt‑eredmények

Az egyesített szöveges teszteken Shieldstral 84,9 %-os F1‑pontszámot ér el, ami megegyezik az OpenAI GPT‑OSS‑Safeguard‑20B‑val, és meghaladja a Qwen3Guard‑8B (84,0 %), a Nemotron‑3.5‑Safety‑4B (83,3 %) és a LlamaGuard‑4‑12B (69,1 %) eredményeit. Képek‑szöveg kombinációkban 83,8 %-os F1‑pontszámot ér el, előbbre lépve az OmniGuard‑7B (77,6 %) és a LlavaGuard‑7B (71,6 %) modelleknél.

Architektúra és nyílt licenc

A Shieldstral a Mistral Ministral‑3B alapjaira épül, a Pixtral képi enkóderrel kombinálva. A modell nyílt súlyú, Apache 2.0 licenc alatt érhető el, így bárki beépítheti saját alkalmazásaiba, és futásidőben módosíthatja a biztonsági szabályokat anélkül, hogy újra kellene betanítani a modellt.

Gyakorlati előnyök és korlátok

Az egy tokenes válasz jelentősen csökkenti a számítási költséget a nagyobb, több lépéses modellekhez képest, de a Shieldstral hátrányt szenved az ismeretlen szabályok esetén, ahol a nagyobb modellek köztes érvelést generálnak.

A 3 milliárd paraméteres Shieldstral nyílt súlyú, Apache 2.0 licenc alatt érhető el.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom