ÉlőUtoljára: 37 perceMa: 6
Kutatásfrissítve: 21:10

Egyetlen transformer-modell becsüli meg a sűrűséget és a score-t

Az Allen AI új DiScoFormer modellje egyetlen forward passzal becsüli meg az adatok sűrűségét és score-ját, magas dimenziókban is, anélkül, hogy újra kellene tanítani.

Egyetlen transformer-modell becsüli meg a sűrűséget és a score-t
Fotó: Omar:. Lopez-Rincon / Unsplash
forrás: Allen AI (AI2)·AI Forradalom szerk.·
Megosztás

Az Allen Institute for AI (AI2) kutatói bemutatták a DiScoFormer nevű új transformer-modellt, amely képes egyetlen előrehaladási (forward) futtatással megbecsülni az adatok eloszlásának sűrűségét és score-ját. Ez a képesség kulcsfontosságú számos gépi tanulási és tudományos feladatban, beleértve a generatív modellek, mint a Stable Diffusion vagy a DALL-E működését, valamint a részecskeszimulációkat.

A hagyományos módszerek, mint a kernel density estimation (KDE), nem igényelnek betanítást és bármilyen eloszláshoz alkalmazhatók, de pontosságuk élesen csökken magas dimenziókban. Ezzel szemben a neurális score-matching modellek pontosak maradnak nagy dimenziókban, de minden új eloszláshoz újra kell őket tanítani. A DiScoFormer e két megközelítés előnyeit ötvözi: egyetlen modell képes mindkét mennyiséget megbecsülni betanítás nélkül, és magas dimenziókban is megőrzi pontosságát.

Kapcsolódó: AI-módszer banki ügyfelek csökkentésére

A DiScoFormer működése

A DiScoFormer egy transformer architektúrát használ, amely cross-attention rétegeket alkalmaz egy közös backbone-nal és két kimeneti fejjel. Az egyik fej a sűrűséget, a másik a score-t becsüli. A sűrűség és a score közötti matematikai kapcsolatot kihasználva a modell egy „label-free” konzisztenciaveszteséget használ. Ez lehetővé teszi, hogy az inference során a modell helyi adaptációt végezzen out-of-distribution bemenetekre anélkül, hogy ground-truth adatokra lenne szükség. A kutatók kimutatták, hogy egyetlen attention fej közelítőleg Gauss-kernelként működik, ami a KDE szigorú általánosításának tekinthető.

Kapcsolódó: gyorsított képgenerálás A-SelecT-tel

Betanítás Gaussian Mixture Model-ekkel

A DiScoFormer betanításához Gaussian Mixture Model (GMM) eloszlásokat használtak. A GMM-ek univerzális sűrűség-approximátorok, és zárt formájú sűrűség- és score-értékeket biztosítanak, így pontos céladatokat szolgáltatnak a felügyelethez. A modell minden batch-hez új GMM-et generál, így gyakorlatilag korlátlan számú céleloszlással találkozik a betanítás során.

Kapcsolódó: OptiMer adatkeverés optimalizálás

Teljesítmény és jövőbeli kilátások

A DiScoFormer mind sűrűség-, mind score-becslésben felülmúlja a KDE-t, különösen magas dimenziókban. 100 dimenzióban a score-hibát körülbelül 6,5-szeresére, a sűrűség-hibát pedig több mint 37-szeresére csökkentette a legjobb KDE-hez képest. A modell képes megbirkózni olyan eloszlással is, amelyek több móddal rendelkeznek, mint amit a betanítás során látott, vagy nem-Gauss alakokkal, mint a Laplace vagy a Student-t eloszlás. A kutatók szerint a DiScoFormer legígéretesebb aspektusa, hogy egy előre betanított, plug-in estimator lehet, amely számos területen, mint a generatív modellezés vagy a tudományos számítások, csökkentheti a költségeket és a komplexitást. Az Allen AI a jövőben is folytatja az átlátható, nyílt forráskódú AI fejlesztését.

Kapcsolódó: Collapse-and-refine feldolgozási elv

Forrás

Feldolgozott sajtóforrás·Allen AI (AI2)

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom