Belső jeleiből megtudható, hiányos-e az információ, egy új kutatás szerint
A nyelvmodellek képesek felismerni, ha a RAG-rendszer által kapott információ nem elegendő vagy ellentmondásos a válaszadáshoz — derül ki egy új, 16 különböző modellre kiterjedő kutatásból.

A mesterséges intelligencia (AI) rendszerek, különösen a Retrieval-Augmented Generation (RAG) alapúak, gyakran küzdenek azzal, hogy felismerjék, mikor nincs elegendő információjuk a megbízható válaszadáshoz. Egy új, előnyomtatott formában megjelent kutatás szerint azonban a modellek belső jelzéseiből dekódolható, hogy az adott információ elegendő-e a válaszadáshoz, vagy éppen hiányos, esetleg ellentmondásos. (ArXiv NLP)
A kutatók egy háromosztályos klasszifikációs problémaként fogalmazták meg a helyzetet: a modell belső jeleit felhasználva határozzák meg, hogy az input információ elegendő, hiányos vagy ellentmondásos. Ehhez egy kontrollált teljesítményteszt adathalmazt hoztak létre, amely egy RAG-beállítást szimulál hamisított információkkal, és minden esetet „válaszolható”, „hiányos” vagy „ellentmondásos” kategóriába sorolnak.
A módszer lényege, hogy a rejtett aktivációkat (hidden activations) és a figyelemalapú (attention-derived) jellemzőket használják bemeneti adatként. Ezekkel egy könnyűsúlyú, lineáris modellt tanítanak be a három kategória megkülönböztetésére. Az eredmények szerint ez a megközelítés konzisztensen felülmúlja a hagyományos promptalapú módszereket és a speciális RAG-modelleket is, 16 különböző nyelvmodell esetében.
A kutatás rávilágít arra, hogy a leginformatívabb jelzések a modellek középső rétegeiben találhatók. A rejtett aktivációs állapotok bizonyultak a leghatékonyabbnak az információ minősítésében, felülmúlva a figyelmi értékeket vagy az MLP-jellemzők kimeneteit a legtöbb tesztelt modellnél.
Az eredmények arra utalnak, hogy a nyelvmodellek belsőleg kódolják, hogy a lekérdezett bizonyítékok elegendőek-e a válasz alátámasztására. Ezt a jelet megbízhatóan le lehet dekódolni a RAG-rendszerek szűrésére, csökkentve ezzel a téves vagy hiányos válaszok kockázatát. A kutatás az arXiv előnyomtatott szerverén érhető el 2608.27661v1 azonosítóval.