Az érvelési folyamatot gyorsítja egy új módszer, a válaszidőt akár 24%-kal csökkenti
A betanítást nem igénylő eljárás különösen a hangalapú asszisztensek és a kódgeneráló ügynökök működését teszi hatékonyabbá, ezzel javítva a felhasználói élményt.

Az SSR (Self-Speculation for Reasoning Models) egy új, betanítást nem igénylő eljárás, amely a nagy nyelvi modellek (LLM) érvelési folyamatát gyorsítja. A módszer akár 24,1%-kal csökkentheti a válaszidőt, ami különösen a hangalapú asszisztensek és kódgeneráló ügynökök esetében javíthatja a felhasználói élményt. (ArXiv NLP)
A kutatók az arXiv-on publikált tanulmányukban rámutattak, hogy a jelenlegi gyorsítási módszerek elsősorban a token-szintű generálásra összpontosítanak, figyelmen kívül hagyva az érvelési folyamatok szerkezetét. Az SSR ezt a hiányosságot orvosolja azzal, hogy a chain-of-thought (CoT) érvelési nyomokat használja fel spekuláció forrásaként.
Hogyan működik az SSR?
Az SSR két részből áll: egy „drafter” (vázlatkészítő) és egy „verifier” (ellenőrző) komponensből. Mindkettőt ugyanaz a modell generálja, de eltérő számítási kapacitással. A drafter egy részleges CoT válaszelosztást használ, míg az ellenőrző a teljes CoT elosztást. Ez az eljárás azon a megfigyelésen alapul, hogy a későbbi részleges CoT válaszok gyakran nagyobb szemantikai és lexikai hasonlóságot mutatnak a teljes CoT válaszsal.
Gyorsabb válasz, több adat
Az SSR képes hosszú előzetes vázlatokat egyben elfogadni a szemantikai és lexikai átfedés miatt, ami jelentős sebességnövekedést eredményez strukturált és hosszú formátumú generálási feladatoknál. A módszer továbbá kiegészül suffix dekódolással is, amely a vázlat válaszát használja fel egy suffix gyorsítótár (cache) alapjaként. Ez lehetővé teszi a hasznos adatszeletek visszanyerését a vázlaton túli részekről is, tovább csökkentve a válaszidőt olyan feladatoknál, ahol a vázlat és a végső válasz között nagy az átfedés.
Eredmények és elérhetőség
A Qwen3.5 és Gemma-4 népszerű nyílt forráskódú modelleken végzett értékelések kimutatták, hogy az SSR akár 24,1%-os relatív javulást érhet el a teljes generálási válaszidőben. Az SSR egy betanítás-mentes módszer, ami azt jelenti, hogy a meglévő modellek teljesítménye javítható vele anélkül, hogy újabb betanítási ciklusokra lenne szükség.