ÉlőUtoljára: 1 órájaMa: 15
Kutatás

AI-modellek orvosi ítélete pontossága és magabiztossága javult

Az AI-modellek orvosi ítéletei 93,5%-ban pontosak, magabiztosságuk pedig 78,4%-os átlagot mutatott egy új, kontrollált tesztben.

AI-modellek orvosi ítélete pontossága és magabiztossága javult
Fotó: Vitaly Gariev / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az AI orvosi alkalmazásai terén kulcsfontosságú, hogy az eredmények ne csak pontosak legyenek, hanem a modell magabiztossága is kövesse a rendelkezésre álló bizonyítékok minőségét és a bizonytalanságot. Ezt vizsgálta egy új, pszichofizikai módszerekkel inspirált teljesítményteszt, amely az Alzheimer-típusú neurokognitív rendellenesség (AT-NCD) és a depresszióval összefüggő kognitív hanyatlás (DRCI) diagnosztizálására összpontosított. (ArXiv AI)

A kutatók 45 szimulált esettanulmányt hoztak létre, amelyekben változtatták a bizonyítékok erősségét, ellentmondásos információkat és hiányzó adatokat helyeztek el. Ezeket háromféle prompttal tesztelték, összesen 135 próbálkozásban. A GPT-4.1-nano modell minden teszten érvényes, strukturált kimenetet produkált.

A kényszerített választású próbák során a modell diagnosztikai pontossága 93,5% volt, átlagos magabiztossága pedig 78,4%. A magabiztosság nőtt azokkal az esetekkel, ahol a bizonyítékok távolabb estek a diagnosztikai határtól, csökkent hiányzó információ esetén, és helyes válaszoknál magasabb maradt, mint a téveseknél, még a bizonyítékok erősségét és a prompt formátumát figyelembe véve is. Ez arra utal, hogy a modell bizonyos mértékű metakognitív érzékenységgel rendelkezik.

Azonban a hibák főként az AT-NCD mérsékelt, ellentmondásos eseteiben koncentálódtak. Ezekben az esetekben a modell a DRCI felé tolódott el, és indokolatlanul magas magabiztosságot mutatott a tényleges pontossághoz képest. Ez arra figyelmeztet, hogy a magabiztosság minőségét közvetlenül kell mérni, nem pedig pusztán a teljesítményteszt pontosságából vagy a modell képességeiből következtetni rá.

A tanulmány egy reprodukálható keretrendszert hoz létre az orvosi LLM-ek bizonyítékérzékenységének, metakognitív érzékenységének és lokalizált kalibrációs hibáinak értékelésére. A kutatás egy új, kontrollált, pszichofizikai megközelítést alkalmaz az AI orvosi ítélőképességének tesztelésére, megkülönböztetve a tényleges tudást a magabiztosságtól.

A modelltípusok összehasonlítása azt sugallta, hogy a magabiztosság minőségét közvetlenül kell mérni, nem pedig a teljesítményteszt pontosságából vagy a modell képességeiből következtetni rá. A jais 2, egy 70 milliárd paraméteres arabközpontú LLM, akár 2000 tokent is képes másodpercenként feldolgozni, míg a moduláris kognitív architektúrát vizsgáló kutatások azt mutatják, hogy az LLM-ekben az emberi agyhoz hasonlóan specializált hálózatok alakulnak ki.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom