Helyi AI-modellek lassabbnak tűnhetnek a hardver- és szoftverkülönbségek miatt
A referencia-implementációk és a felhasználói rendszerek közötti eltérések miatt a helyi AI-modellek teljesítménye gyakran csalódást keltő. A pontos méréshez a terminal bench, SWEthis vagy HELLAthat szimulátorok futtatása javasolt, nem csupán néhány nullás hőmérsékletű prompt tesztelése.

A modellek a következő tokenre vonatkozó pontszámokat, az úgynevezett logits-eket generálják, amelyeket valószínűségekké alakítanak, majd a sampler beállításain (pl. temperature, top-p) keresztül jutnak el a detokenizálóhoz. (Hacker News)
Hardveres és szoftveres eltérések
A felhasználók gyakran csalódnak, amikor egy letöltött AI-modell nem teljesít a várakozásoknak megfelelően. Ez a jelenség a különböző hardver- és szoftverkörnyezetek eltéréseiből fakad, amelyek befolyásolják a modell token-generálását. A referencia-implementációk, amelyeket a modelleket publikáló laborok használnak, eltérő hardveren és szoftveren futnak, mint az átlagos felhasználók rendszerei. Ezek az eltérések, beleértve a GPU-k különböző utasításkészleteit, mind befolyásolják a számításokat és a végeredményt.
Mérés és szoftveres ökoszisztéma
A gyakorlati megközelítés a standard teljesítménytesztek futtatása, mint a terminal bench, hle, SWEthis vagy HELLAthat. Fontos, hogy ezek reprezentatívak legyenek a felhasználó tényleges munkaterhelésére. A nulla hőmérsékletű (temperature zero) utasítások és néhány teszt nem elegendő a modell képességeinek pontos felméréséhez.
A KL Divergence (KLD) a token-eloszlás eltérését méri egy alapvonaltól. Azonban az alacsony KLD-értékek félrevezetőek lehetnek, különösen kvantált modellek esetén, ha a referencia-környezet és a futtatási körülmények nem ismertek. A pontos interpretációhoz a teljes metodológiát kell ismerni.
Az inference engine-ben futó szoftverek, mint például a VLLM, számos konfigurálható komponenst tartalmaznak. Egy nightly VLLM konténer akár több száz Python csomagot is tartalmazhat, amelyek mindegyike saját hibákkal és egyedi viselkedéssel rendelkezik. Ez a komplexitás tovább növeli a különbségeket a különböző rendszerek között.
A tesztek során a különböző attention backendek (FlashAttention 2, Flash Inference, Triton Attention) hatását vizsgálták egy RTX PRO 6000 Blackwell GPU-n. A tesztek kimutatták, hogy még a hardver és szoftver stack stabilitása mellett is, az egyes backendek eltérő token-választást eredményezhetnek, ami befolyásolja a modell kimenetét.