Egységes multimodális generálást hoz az Apple új AI-architektúrája
Az Apple új STARFlow2 architektúrája a Pretzel dizájnnal egyesíti a nyelvmodelleket és a normalizáló folyamokat, így egységes, egypasszos multimodális generálást tesz lehetővé.

A STARFlow2 a Pretzel architektúrára épül, amely függőlegesen kapcsolja össze a lefagyasztott, előzetesen betanított VLM (Vision-Language Model) streamet egy TARFlow streammel, mindezt reziduális skip kapcsolatokon keresztül, egyetlen kauzális maszk alatt. Ez a kialakítás megőrzi az előzetesen betanított multimodális megértést, lehetővé teszi a magas hűségű, folyamatos képgenerálást, és strukturális egységet teremt egyetlen kauzális mechanizmus alatt. (Apple ML)
Az autoregresszív folyamatok előnyei
Az Apple gépi tanulási részlege által publikált tanulmány szerint az autoregresszív normalizáló folyamatok természetes paradigmát kínálnak a valóban egységes multimodális generáláshoz. A kutatók szerint a korábbi megközelítések vagy a vizuális hűséget áldozták fel a diszkrét tokenizációval, vagy strukturális aszimmetriát vezettek be, esetleg degradálták az előzetesen betanított megértést.
Teljesítmény és kutatási háttér
A mély-sekély (deep-shallow) áramlástervezés és az egységes FAE (Flow Autoencoder) latens tér kombinálásával a STARFlow2 támogatja a gyorsítótárbarát (cache-friendly) váltakozó generálást. Ebben a szöveges és vizuális kimenetek közvetlenül, újrakódolás nélkül lépnek be a KV-gyorsítótárba, ami hatékonyabbá teszi a generálási folyamatot, különösen az interaktív alkalmazásokban.
A kísérletek eredményei erős teljesítményt mutatnak a képgenerálási és multimodális megértési benchmarkokon, validálva az autoregresszív folyamatokat mint életképes alapot az egységes multimodális modellezéshez. A STARFlow2 a CVPR konferencián bemutatott STARFlow-V videógeneráló modellhez kapcsolódik, amely szintén normalizáló folyamatokat használ.
A kutatást Ying Shen, Tianrong Chen és Yuan Gao vezette az Apple-nél.