Új, 35 altípust vizsgáló teljesítményteszt teszteli a biomedicinai AI-modellek látását
Az orvosi képek elemzésére alkalmas AI-modellek látásképességét teszteli az MMBU, a valaha volt legnagyobb biomedicinai látás-nyelv teljesítményteszt. A 35 altípust felölelő teszt 15 nyílt és 2 élvonalbeli modellt vizsgált.

Az orvosi képalkotás forradalmasítására képesek a látás-nyelv modellek (VLM-ek), ám ehhez finomhangolt vizuális érzékelésre van szükségük. A modelleknek képesnek kell lenniük a finom részletek pontos értelmezésére, különféle biomedicinai modalitásokon, skálákon és kontextusokban. Jelenlegi teljesítménytesztek azonban korlátozottak ezen a téren. (ArXiv CV)
Ezt a hiányt pótolja az új, Massive Multimodal Biomedical Understanding (MMBU) teljesítményteszt. Ez a valaha volt legnagyobb biomedicinai látás-nyelv teljesítményteszt, amely 35 altípust fed le gazdag, strukturált metaadatokkal. Az MMBU tartalmaz nyílt és zárt verziókat is besorolásos és objektumdetektálási feladatokra, lehetővé téve a modellek teljesítményének szisztematikus értékelését biológiai skálákon, klinikai környezetekben és képalkotási modalitásokon.
Kapcsolódó: orvosi LLM-ek fejlesztése
Az MMBU tesztelési folyamata
A kutatók 15 nyílt forráskódú és 2 élvonalbeli VLM-et teszteltek az MMBU teljesítményteszten. Eredményeik szerint, bár az orvosi adaptáció mérhető javulást hoz egyes modelleknél, a korábbi benchmarkokon gyakran magasnak mutatkozó pontosság elfedheti a vizuális érzékelésben és a domain-generizációban mutatkozó hiányosságokat.
Kapcsolódó: időjárás-előrejelzési modellek
A tesztelés eredményei és következményei
Az MMBU teljesítményteszt előnyomtatott formában érhető el, és célja, hogy pontosabb képet adjon a biomedicinai képfeldolgozásban rejlő VLM-ek valós képességeiről. A tesztelés során a 15 nyílt forráskódú modell közül a legjobb eredményt a Vision Transformer modell érte el, 92,5%-os pontossággal a besorolásos feladatokban.
Kapcsolódó: szöveges VLM-pontosság