Az NVIDIA FLARE új módszerei megkönnyítik a multimodális AI-képzést
Az NVIDIA FLARE új módszerei, mint a nagy objektumok külső tárolása és a tensor streaming, jelentősen csökkentik a multimodális AI-modellek federált képzésének adatforgalmát, akár 28,6 GB-ról 0,094 GB-ra körönként.

A modern multimodális modellek (VLM-ek) képesek vizuális kérdések megválaszolására, képek leírására és képekkel kapcsolatos szöveges érvelésre. Gyakorlatban azonban az ezekhez szükséges adatok gyakran intézmények között oszlanak meg, így nem centralizálhatók. A federált tanulás lehetővé teszi az adatok helyben tartását és a képzés koordinálását. A VLM-ek esetében ez nem csak az orchestrációt jelenti, hanem azt is, hogy a különböző helyszínek eltérő feladat- vagy modalitáskeverékeket használhatnak, és a modellfrissítések is nagyok lehetnek, ami megterheli a hálózatot és a szerver memóriáját. (Nvidia Developer)
Adatkommunikáció optimalizálása
A probléma megoldására az NVIDIA FLARE olyan mechanizmusokat kínál, mint a nagy objektumok külső tárolása (large-object externalization), a tensor streaming és a lemezalapú aggregáció (disk-backed aggregation). Ezek segítenek kezelni a nagyobb adatcsomagokat. A William & Mary és az NVIDIA által közösen fejlesztett FedUMM példája jól mutatja, hogyan lehet a könnyű LoRA adaptereket egy fagyasztott BLIP háttérmodell felett federálni, drasztikusan csökkentve a kommunikációt, miközben a modell teljesítménye megközelíti a központosított alapvonalakat.
Mérnöki megvalósítás és elismerés
A federált VLM-munkafolyamatok mérnöki megvalósítása megköveteli a kliensfrissítési szerződés (client update contract) egyértelmű meghatározását, a hasznos teher minimalizálási stratégiák gondos kiválasztását és a hatékony frissítés-aggregációt. Az NVIDIA FLARE Recipe API-ja, Tensor Downloader-e és disk offload moduljai bevált megoldásokat kínálnak a skálázható telepítésekhez. A FedUMM-et az NVIDIA Academic Grant Program is támogatja, és elnyerte a TheWebConf 2026 FL@FM workshopján az Outstanding Student Paper Award díjat.