LoRA adapterekkel gyorsul a Hugging Face modellbetanítása, 53 perc alatt végez
A Hugging Face új módszere, az AsyncGRPOTrainer LoRA adapterekkel és Storage Bucketokkal 3 óra 27 percről 53 percre csökkenti a modellbetanítás idejét 500 lépésnél.

A Hugging Face frissítette TRL (Transformer Reinforcement Learning) könyvtárát, a v1.14-es verzióban már támogatja a LoRA (Low-Rank Adaptation) adapterek aszinkron betanítását és szinkronizálását a vLLM-mel. Ez a fejlesztés lehetővé teszi, hogy a modellbetanítás és az inferencia ne ugyanazon a gépen fusson, jelentősen felgyorsítva a folyamatot.
A LoRA különösen alkalmas megerősítéses tanuláshoz (RL), mivel a kutatások szerint a teljes finomhangolással megegyező eredményeket érhet el, még rank-1 adapterekkel is. Egy rank-1 adapter mindössze néhány megabájtos, szemben a teljes modell több gigabájtos méretével. Ez lehetővé teszi az adapterek gyors átvitelét tároló vödrökön (Storage Bucket) keresztül, elkerülve a lassú NCCL (NVIDIA Collective Communications Library) szinkronizációt.
Hogyan működik a gyorsítás?
Az új megközelítésben a tréner és a vLLM replikák különálló Hugging Face Job-ként futnak. Egy kis proxy szerver kezeli a hitelesítést, az útválasztást, és gondoskodik az adapterek betöltéséről minden replikán. A tréner az adaptereket egy Storage Bucketba menti, ahonnan a vLLM-szerverek lekérhetik azokat. Ez a megosztott fájlrendszer-megközelítés kiküszöböli a gépek közötti közvetlen hálózati kommunikáció szükségességét.
Eredmények és elérhetőség
A Hugging Face saját tesztjei szerint ezzel a módszerrel öt futtatás ideje 3 óra 27 percről 53 percre csökkent 500 lépésnél. A vLLM képes több adaptert is betölteni egyszerre, így a folyamatban lévő kérések a régi, míg az új kérések a legfrissebb adaptert használhatják. Az AsyncGRPOTrainer új verziója, a TRL v1.14, már elérhető a GitHubon.