ÉlőUtoljára: 3 órájaMa: 23
Kutatásfrissítve: 07:30

Az Omni LLM-ek nehezen kezelik a finom kockázatokat, új teljesítményteszt érkezett

A MCBench 1196 forgatókönyvvel méri az Omni LLM-ek biztonságát, kiemelve a finom kockázatok kezelésének nehézségeit.

Az Omni LLM-ek nehezen kezelik a finom kockázatokat, új teljesítményteszt érkezett
Fotó: Mezidi Zineb / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

Az eddigi biztonsági tesztek csak a képi bemenetekre koncentráltak, így nem tudták felmérni az Omni Large Language Modellek (LLM) képességeit, amelyek látványt, hangot és szöveget is feldolgoznak. Az új MCBench teljesítményteszt 1196 forgatókönyvet tartalmaz, amelyek négy biztonsági kategóriába sorolódnak, és több modalitás integrálását igénylik a pontos értékeléshez — közölték az arXiv kutatói. (ArXiv NLP)

A tesztelés során kiderült, hogy a legmodernebb modellek jelentős kihívásokkal néznek szembe. Az Omni LLM-ek nehezen kezelik a finom vagy nem fizikai kockázatokat, de jobban teljesítenek, ha szembetűnő vizuális vagy akusztikus jelzések vannak jelen.

Kapcsolódó: LLM teljesítményteszt

Finom kockázatok és cross-modális megértés

Az elemzések rávilágítottak, hogy bár a modellek képesek a modalitásonkénti információk kinyerésére, gyakran kudarcot vallanak ezeknek az információknak az összekapcsolásában a biztonsági ítéletek meghozatalához. Ez azt jelenti, hogy a jelenlegi Omni LLM-ekből hiányzik a robusztus cross-modális érvelés a biztonságkritikus helyzetekben.

Kapcsolódó: Multimodális modellek fejlesztése

Új architektúrákra és képzési stratégiákra van szükség

Az eredmények aláhúzzák a multimodalitás biztonsági aspektusainak javítására irányuló kutatások fontosságát. A kutatók szerint szükség van fejlettebb architektúrákra és képzési stratégiákra a multimodalitás biztonsági értékelésének megbízhatóságának növelése érdekében. A MCBench 2026. június 5-én került előnyomtatott formában az arXiv-ra, az arXiv azonosítója arXiv:2206.01234.

Kapcsolódó: Multimodális LLM felelősség

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom