Modellek & LLM
Shieldstral 84,9%-os F1-pontszámot ér el a szöveges biztonsági teszten
84,9 %-os F1-pontszámot ér el a Shieldstral a szöveges biztonsági teljesítményteszten, a 3 milliárd paraméteres Mistral-modell ezzel felülmúlja a 20 milliárd paraméteres OpenAI GPT-OSS-Safeguard-20B-t.

Futásidejű szabályok egy tokenben
Shieldstral egyetlen tokennel válaszol a plain-language kérdésekre, így 0-tól 1-ig terjedő biztonsági pontszámot ad. Az operátorok a kérdéseket szövegesen írják meg, például „Erőszakot népszerűsít ez a tartalom?”, és a modell csak „yes” vagy „no” választ ad – a válasz valószínűsége határozza meg a pontszámot. — írja a The DecoderSzintetikus adatokkal tanítva
A kutatók körülbelül 54,1 millió szintetikus példát használtak, amelyek biztonsági, káros tartalmi és manipulációs kísérleteket egyesítenek. A finomhangolt kategóriákhoz a szintetikus adatok 23,3 százalékpontos növekedést hoztak az F1-eredményben, ez a fő hajtóereje a modell alkalmazkodóképességének.teljesítményteszt-eredmények
Az egyesített szöveges teszteken Shieldstral 84,9 %-os F1-pontszámot ér el, ami megegyezik az OpenAI GPT-OSS-Safeguard-20B-val, és meghaladja a Qwen3Guard-8B (84,0 %), a Nemotron-3.5-Safety-4B (83,3 %) és a LlamaGuard-4-12B (69,1 %) eredményeit. Képek-szöveg kombinációkban 83,8 %-os F1-pontszámot ér el, előbbre lépve az OmniGuard-7B (77,6 %) és a LlavaGuard-7B (71,6 %) modelleknél.Architektúra és nyílt licenc
A Shieldstral a Mistral Ministral-3B alapjaira épül, a Pixtral képi enkóderrel kombinálva. A modell nyílt súlyú, Apache 2.0 licenc alatt érhető el, így bárki beépítheti saját alkalmazásaiba, és futásidőben módosíthatja a biztonsági szabályokat anélkül, hogy újra kellene betanítani a modellt.Gyakorlati előnyök és korlátok
Az egy tokenes válasz jelentősen csökkenti a számítási költséget a nagyobb, több lépéses modellekhez képest, de a Shieldstral hátrányt szenved az ismeretlen szabályok esetén, ahol a nagyobb modellek köztes érvelést generálnak.A 3 milliárd paraméteres Shieldstral nyílt súlyú, Apache 2.0 licenc alatt érhető el.