A Llama-server router módja minden GPU-n CUDA-kontextust foglal
A hiba memóriafoglalási problémákat okozhat, különösen akkor, ha a többi GPU már tele van. A probléma a Reddit LocalLLaMA közösségében merült fel.

A Llama-server router módja minden GPU-n CUDA-kontextust foglal, még akkor is, ha a modellt csak egyetlen kártyára rögzítették. Ez a viselkedés memóriafoglalási (OOM) problémákhoz vezethet, különösen akkor, ha a többi GPU már tele van.
A probléma a Reddit LocalLLaMA közösségében merült fel, ahol egy felhasználó jelezte, hogy a 3090-es és 4060 Ti-s kártyákkal szerelt rendszerében a router mód minden elérhető GPU-n lefoglalja a CUDA-kontextust. Ez akkor okoz gondot, ha a modell betöltése után a többi kártyán futó feladatok nem férnek el a memóriában.
Kapcsolódó: CUDA fordítás
A hiba hatása a rendszerre
Egyelőre nem világos, hogy ez szándékos viselkedés-e, vagy egy hiba a Llama-serverben. A felhasználók javaslatokat keresnek, például további kapcsolók (flag) használatára, amelyekkel ezt a viselkedést befolyásolni lehetne.
Kapcsolódó: CUDA Tile támogatás
Lehetséges megoldások
Az érintett felhasználó a 3090-es és 4060 Ti-s kártyákkal végzett kísérleteket, és a CUDA-kontextus foglalásának problémáját a Llama-server konfigurációjában kereste. A probléma megoldásáig a felhasználóknak ajánlott a Llama-server frissítéseit követni, és a gyártó hivatalos weboldalát figyelemmel kísérni, mint például a Meta, amely a Llama modellt fejleszti.
Kapcsolódó: GPU-flottafelügyelet