Generatív ajánlórendszerek új architektúrával és NVIDIA eszközeivel redefiniálják a RecSys-t
A hagyományos ajánlórendszerek szűk keresztmetszete, hogy a naponta terabájtos vagy petabájtos felhasználói előzmények nem férnek el a GPU-k memóriájában. Az NVIDIA új eszközei, a recsys-examples és a nv-embedding-cache, ezt a skálázhatósági akadályt hivatottak leküzdeni.

A generatív ajánlórendszerek (GR) jelentős építészeti váltást képviselnek a hagyományos, beágyazásalapú rendszerekhez képest. Az NVIDIA új eszközei — a recsys-examples és a nv-embedding-cache — pedig megkönnyítik ezeknek a modelleknek a bevetését nagy léptékben. (Nvidia Developer)
Miért törnek össze a hagyományos ajánlórendszerek nagy léptékben?
A felhasználói előzmények, az ajánlórendszerek elsődleges adattípusa, a fogyasztói internetiparban az egyik legelterjedtebb gépi tanulási probléma, mégis nehezen taníthatók és szolgálhatók ki nagy léptékben. A felhasználói előzmények hatalmas mennyisége, akár naponta terabájtos vagy petabájtos nagyságrendű is lehet, nem fér el a GPU-k memóriájában, ami számos szűk keresztmetszetet eredményez a betanítás és a következtetés során.
Emellett a hosszú farok problémája, ahol a népszerű tételek kapják a legtöbb interakciót, és az új felhasználók vagy tételek hidegindítási problémája is kihívást jelent. A gyártásban az ajánlórendszereknek gyakran több ezer jelölt elemet kell lekérdezniük és rangsorolniuk néhány milliszekundumon belül, hogy megfeleljenek a szigorú késleltetési követelményeknek.
Generatív ajánlórendszerek
A hagyományos, beágyazásalapú ajánlókkal ellentétben, amelyek a felhasználó-elem preferenciát geometriai hasonlósággal modellezik, a generatív ajánlórendszerek (GR) az ajánlást szekvenciamodellezési problémaként fogalmazzák át, hasonlóan az LLM-ekhez. A cél a következő akció vagy elem valószínűségi eloszlásának modellezése egy felhasználói előzményekből álló sorozat alapján: P(next_item | user_history). Az ilyen, transzformerszerű architektúrák jobban ki tudják használni a skálázási törvényeket, és egységesíthetik a lekérdezést és a rangsorolást egyetlen modellen belül.
Az NVIDIA recsys-examples és nv-embedding-cache
Az NVIDIA recsys-examples adattára moduláris, gyártásra kész GR-implementációkat kínál, amelyeket NVIDIA GPU-kra optimalizáltak. Ez magában foglalja a DynamicEmb-et a dinamikus, pontozott hash-tábla beágyazásokhoz, egy KV gyorsítótárat, amelyet ajánlórendszeri munkaterhelésre optimalizáltak, valamint egyesített CUDA kernel-eket a hatékony betanításhoz és következtetéshez.
A nv-embedding-cache (NVE) egy hierarchikus, több rétegű gyorsítótárazási megoldást kínál, amely zökkenőmentes szegmentálást és egyidejű lekérdezést/kiürítést tesz lehetővé hatalmas beágyazási táblákhoz. Ez lehetővé teszi az alacsony késleltetésű következtetést és a nagy átviteli sebességet a gyártási léptékű ajánlórendszeri munkaterheléseken, és egyszerűen helyettesítheti a PyTorch beágyazási rétegeket.
A generatív ajánlórendszerek, mint a Hierarchical Sequential Transduction Units (HSTU) és a Semantic IDs, új megközelítéseket kínálnak a skálázhatóság, a hidegindítás és a hosszú farok problémáinak megoldására. Az NVIDIA eszközei lehetővé teszik ezeknek az új architektúráknak a hatékony bevetését.