ÉlőUtoljára: 1 órájaMa: 22
Kutatásfrissítve: 11:15

Valós betegadatokkal teszteli az orvosi AI-k gyengeségét a Carnegie Mellon új benchmarkja

A Carnegie Mellon Egyetem kutatói által kifejlesztett Synthetic Hospital teljesítményteszt valós, többéves betegadatokkal teszteli a vezető AI-modelleket, amelyek közül egyik sem érte el a mesteri szintet.

Valós betegadatokkal teszteli az orvosi AI-k gyengeségét a Carnegie Mellon új benchmarkja
Fotó: National Cancer Institute / Unsplash
forrás: The Neuron·AI Forradalom szerk.·
Megosztás

Az AI-modellek egyre jobban teljesítenek az orvosi kérdések megválaszolásában, ha azok jól megírt, tiszta promptokból állnak. Azonban a valós, hónapokon vagy éveken át tartó, rendetlen orvosi feljegyzésekkel már jóval bonyolultabb a helyzet. A Carnegie Mellon Egyetem kutatói létrehoztak egy új teljesítménytesztet, a Synthetic Hospitalt, amely pontosan ezt a rést hivatott vizsgálni. (The Neuron)

Ahelyett, hogy elszigetelt orvosi kérdéseket tennének fel, a teljesítményteszt longitudinális elektronikus egészségügyi nyilvántartásokat használ, amelyek több látogatást, laboreredményeket, képalkotó leleteket, diagnózisokat és klinikai jegyzeteket tartalmaznak. Ezt követően a modelleknek az igazi klinikai munkához közelebb álló feladatokat kell elvégezniük. A kutatás eredményei hasznos valóságellenőrzést jelentenek: tíz vezető AI-modell közül egyik sem közelítette meg a teljesítményteszt mesteri szintjét.

Az eredmények szerint a modellek viszonylag jól teljesítettek a releváns információk megtalálásában egy chartban, de lényegesen gyengébbek voltak abban, hogy ezt az információt egy diagnózissá vagy hasznos betegösszegzéssé alakítsák. Érdekes módon az egyik tanulmányi eredmény azt mutatta, hogy egy AI-ügynök munkafolyamatba való beágyazása gyakran rontotta a teljesítményt.

A kutatás, amelynek eredményei az arXiv előnyomtatott szerverén érhetők el, rávilágít a jelenlegi AI-modellek korlátaira a komplex orvosi adatok feldolgozásában. Bár a modellek képesek azonosítani a charton belüli információkat, a klinikai döntéshozatalhoz szükséges szintetizáló és összefoglaló képességek még fejlesztésre szorulnak.

Forrás

Feldolgozott sajtóforrás·The Neuron

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom