Az Omni LLM-ek nehezen kezelik a finom kockázatokat, új teljesítményteszt érkezett
A MCBench 1196 forgatókönyvvel méri az Omni LLM-ek biztonságát, kiemelve a finom kockázatok kezelésének nehézségeit.

Az eddigi biztonsági tesztek csak a képi bemenetekre koncentráltak, így nem tudták felmérni az Omni Large Language Modellek (LLM) képességeit, amelyek látványt, hangot és szöveget is feldolgoznak. Az új MCBench teljesítményteszt 1196 forgatókönyvet tartalmaz, amelyek négy biztonsági kategóriába sorolódnak, és több modalitás integrálását igénylik a pontos értékeléshez — közölték az arXiv kutatói. (ArXiv NLP)
A tesztelés során kiderült, hogy a legmodernebb modellek jelentős kihívásokkal néznek szembe. Az Omni LLM-ek nehezen kezelik a finom vagy nem fizikai kockázatokat, de jobban teljesítenek, ha szembetűnő vizuális vagy akusztikus jelzések vannak jelen.
Kapcsolódó: LLM teljesítményteszt
Finom kockázatok és cross-modális megértés
Az elemzések rávilágítottak, hogy bár a modellek képesek a modalitásonkénti információk kinyerésére, gyakran kudarcot vallanak ezeknek az információknak az összekapcsolásában a biztonsági ítéletek meghozatalához. Ez azt jelenti, hogy a jelenlegi Omni LLM-ekből hiányzik a robusztus cross-modális érvelés a biztonságkritikus helyzetekben.
Kapcsolódó: Multimodális modellek fejlesztése
Új architektúrákra és képzési stratégiákra van szükség
Az eredmények aláhúzzák a multimodalitás biztonsági aspektusainak javítására irányuló kutatások fontosságát. A kutatók szerint szükség van fejlettebb architektúrákra és képzési stratégiákra a multimodalitás biztonsági értékelésének megbízhatóságának növelése érdekében. A MCBench 2026. június 5-én került előnyomtatott formában az arXiv-ra, az arXiv azonosítója arXiv:2206.01234.
Kapcsolódó: Multimodális LLM felelősség