Új adapteres módszerrel gyorsítják a több feladatos AI-tanítást
Az AuroSFT keretrendszer az adapterek betanításával 61,36%-os átlagos pontosságot ér el, ami 1,5%-os javulást jelent a korábbi, 59,85%-os eredményt felmutató módszerekhez képest.

Az adapteralapú, paraméterhatékony finomhangolás új módszerét mutatták be az arXiv-on. Az AuroSFT keretrendszer a több feladatos SFT-t (supervised finomhangolás) egy kompakt, összeolvasztható adapter-állapotként kezeli, így a korábbi, teljes modellmentést igénylő eljárásoknál költséghatékonyabb. (ArXiv ML)
A kutatók szerint a hagyományos több feladatos finomhangolás gyakran egyetlen optimalizálási problémaként kezeli a különböző feladatok keverékét, holott azok legjobb általánosítása eltérő időpontokban következhet be. Az AuroSFT a betanított alapmodellt (backbone) befagyasztja, és csak az injektált adaptereket tanítja, majd az adapter-ellenőrzőpontokat a feladatonkénti teljesítménycsúcsoknál visszavonja, csökkentve ezzel a tárolási és telepítési költségeket.
Az új megközelítés a réteg szintjén egy AuroRA-inspirálta adaptív nemlineáris réteget alkalmaz egy alacsony rangú súlyfaktoron. Az így létrejövő frissítés lineáris marad az inputra nézve, rangban korlátozott és pontosan összeolvasható a befagyasztott projekcióval. A módszer az öt tesztelt alapmodellen magasabb pontosságot ért el.
A szerzők által közölt eredmények alapján az AuroSFT 61,36%-os átlagos pontosságot produkált, ami felülmúlja a referenciaként használt msft módszer 59,85%-os eredményét. A pontos számokat és a módszer részleteit a szerzők maguk közölték, ezeket független szervezet még nem erősítette meg.
A kutatók kódja egy anonim adattárban érhető el, így a szélesebb közösség is kipróbálhatja az új adapteralapú finomhangolási technikát.