AI-modellek orvosi ítélete pontossága és magabiztossága javult
Az AI-modellek orvosi ítéletei 93,5%-ban pontosak, magabiztosságuk pedig 78,4%-os átlagot mutatott egy új, kontrollált tesztben.

Az AI orvosi alkalmazásai terén kulcsfontosságú, hogy az eredmények ne csak pontosak legyenek, hanem a modell magabiztossága is kövesse a rendelkezésre álló bizonyítékok minőségét és a bizonytalanságot. Ezt vizsgálta egy új, pszichofizikai módszerekkel inspirált teljesítményteszt, amely az Alzheimer-típusú neurokognitív rendellenesség (AT-NCD) és a depresszióval összefüggő kognitív hanyatlás (DRCI) diagnosztizálására összpontosított. (ArXiv AI)
A kutatók 45 szimulált esettanulmányt hoztak létre, amelyekben változtatták a bizonyítékok erősségét, ellentmondásos információkat és hiányzó adatokat helyeztek el. Ezeket háromféle prompttal tesztelték, összesen 135 próbálkozásban. A GPT-4.1-nano modell minden teszten érvényes, strukturált kimenetet produkált.
A kényszerített választású próbák során a modell diagnosztikai pontossága 93,5% volt, átlagos magabiztossága pedig 78,4%. A magabiztosság nőtt azokkal az esetekkel, ahol a bizonyítékok távolabb estek a diagnosztikai határtól, csökkent hiányzó információ esetén, és helyes válaszoknál magasabb maradt, mint a téveseknél, még a bizonyítékok erősségét és a prompt formátumát figyelembe véve is. Ez arra utal, hogy a modell bizonyos mértékű metakognitív érzékenységgel rendelkezik.
Azonban a hibák főként az AT-NCD mérsékelt, ellentmondásos eseteiben koncentálódtak. Ezekben az esetekben a modell a DRCI felé tolódott el, és indokolatlanul magas magabiztosságot mutatott a tényleges pontossághoz képest. Ez arra figyelmeztet, hogy a magabiztosság minőségét közvetlenül kell mérni, nem pedig pusztán a teljesítményteszt pontosságából vagy a modell képességeiből következtetni rá.
A tanulmány egy reprodukálható keretrendszert hoz létre az orvosi LLM-ek bizonyítékérzékenységének, metakognitív érzékenységének és lokalizált kalibrációs hibáinak értékelésére. A kutatás egy új, kontrollált, pszichofizikai megközelítést alkalmaz az AI orvosi ítélőképességének tesztelésére, megkülönböztetve a tényleges tudást a magabiztosságtól.
A modelltípusok összehasonlítása azt sugallta, hogy a magabiztosság minőségét közvetlenül kell mérni, nem pedig a teljesítményteszt pontosságából vagy a modell képességeiből következtetni rá. A jais 2, egy 70 milliárd paraméteres arabközpontú LLM, akár 2000 tokent is képes másodpercenként feldolgozni, míg a moduláris kognitív architektúrát vizsgáló kutatások azt mutatják, hogy az LLM-ekben az emberi agyhoz hasonlóan specializált hálózatok alakulnak ki.