Egyetlen hálózatban egyesíti a szöveget, képet és robotvezérlést a Reka AI Rho-1 omni-modellje
A Reka AI új, 19 milliárd paraméteres Rho-1 omni-modellje egyetlen hálózatban képes feldolgozni és generálni szöveget, képeket, videót és robotvezérlési parancsokat.

A Reka AI bemutatta a Rho-1 kutatási előzetesét, egy 19 milliárd paraméteres omni-modellt, amely egyetlen neurális hálózatban dolgozza fel és generálja a szöveget, képeket, videót és robotvezérlési parancsokat. A modell minden modalitást tokenként kezel egy megosztott kontextusablakban, külső modellek vagy eszközök hívása nélkül. (The Decoder)
A Rho-1 képes valós idejű, folyamatos videógenerálásra, és újraindítás nélkül, menet közben reagál az új utasításokra. A kutatók szerint ugyanazok a súlyok, amelyek a kamera képeit jósolják meg, egyben a robotmozgásokat is vezérlik. A robotok képzéséhez szükséges adatok szűkössége miatt a Reka AI egy inverz dinamikai modellt épített, amely hétköznapi internetes videókból húz ki vezérlési jeleket.
A modellt mintegy három hónap alatt, 320 H100 GPU-n tanították be. A Reka AI már korábban is jelentős szereplő volt a multimodális AI területén: 2024 áprilisában adták ki a Reka Core modellt, amely benchmarkokon a GPT-4, Claude 3 és Gemini Ultra ellen versenyzett. A Rho-1 megjelenése illeszkedik az AI kutatásának „világmodellek” felé irányuló szélesebb törekvésébe.