PRISM2 egyetlen reprezentációba gyűjti a csempéket, majd szöveges diagnózist ad
2,3 millió diák képet felhasználva a PRISM2 modell több ezer csempe beágyazását egyetlen reprezentációba gyűjti, majd diagnosztikai kérdésekre válaszol szövegesen.

Működési elv
A PRISM2 modell a teljes diák képeket egy perceiver‑alapú kódolóval dolgozza fel, amely egyszerre tanul szövetcsempékről és a patológiai jelentésekből származó klinikai dialógusról — írja az AI News.
Architektúra
Két fázisban működik: az elsőben a slide‑encoder aggregálja a tile‑szintű jellemzőket egy diák‑szintű vektorba, a másodikban a kódolót befagyasztják, és a nyelvi modellt finomhangolják a dialógusra.
Képzési adatok
A modell 2,3 millió whole‑slide képen és 685 507 patológiai jelentésen tanult, amelyeket a Memorial Sloan Kettering Cancer Center rutin ellátásból gyűjtött, GPT‑4o alakított Q&A párokká.
Beágyazási struktúra
Kétféle beágyazást használ: az alap‑beágyazás a slide‑encoderből származik biomarker‑előrejelzéshez, a diagnosztikai beágyazás a 4‑milliárd‑paraméteres nyelvi modell rejtett állapotából származik, közvetlenül a kép latensjei után.
Diagnosztikai képesség
A diagnosztikai beágyazást kifejezetten rákdetektálásra és altípus‑osztályozásra hangolták, így a modell szöveges választ generál a klinikai kérdésekre ahelyett, hogy csak pixeleket osztályozna.
A rendszer egyetlen kérdés‑válasz körre korlátozódik, a többfordulós interakciók további fejlesztést igényelnek — a PRISM2 modell a 4‑milliárd‑paraméteres nyelvi modell rejtett állapotát használja a diagnosztikai beágyazáshoz.