ÉlőUtoljára: 9 perceMa: 12
Kutatásfrissítve: 11:18

Az érvelési folyamatot gyorsítja egy új módszer, a válaszidőt akár 24%-kal csökkenti

A betanítást nem igénylő eljárás különösen a hangalapú asszisztensek és a kódgeneráló ügynökök működését teszi hatékonyabbá, ezzel javítva a felhasználói élményt.

Az érvelési folyamatot gyorsítja egy új módszer, a válaszidőt akár 24%-kal csökkenti
Fotó: CDC / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

Az SSR (Self-Speculation for Reasoning Models) egy új, betanítást nem igénylő eljárás, amely a nagy nyelvi modellek (LLM) érvelési folyamatát gyorsítja. A módszer akár 24,1%-kal csökkentheti a válaszidőt, ami különösen a hangalapú asszisztensek és kódgeneráló ügynökök esetében javíthatja a felhasználói élményt. (ArXiv NLP)

A kutatók az arXiv-on publikált tanulmányukban rámutattak, hogy a jelenlegi gyorsítási módszerek elsősorban a token-szintű generálásra összpontosítanak, figyelmen kívül hagyva az érvelési folyamatok szerkezetét. Az SSR ezt a hiányosságot orvosolja azzal, hogy a chain-of-thought (CoT) érvelési nyomokat használja fel spekuláció forrásaként.

Hogyan működik az SSR?

Az SSR két részből áll: egy „drafter” (vázlatkészítő) és egy „verifier” (ellenőrző) komponensből. Mindkettőt ugyanaz a modell generálja, de eltérő számítási kapacitással. A drafter egy részleges CoT válaszelosztást használ, míg az ellenőrző a teljes CoT elosztást. Ez az eljárás azon a megfigyelésen alapul, hogy a későbbi részleges CoT válaszok gyakran nagyobb szemantikai és lexikai hasonlóságot mutatnak a teljes CoT válaszsal.

Gyorsabb válasz, több adat

Az SSR képes hosszú előzetes vázlatokat egyben elfogadni a szemantikai és lexikai átfedés miatt, ami jelentős sebességnövekedést eredményez strukturált és hosszú formátumú generálási feladatoknál. A módszer továbbá kiegészül suffix dekódolással is, amely a vázlat válaszát használja fel egy suffix gyorsítótár (cache) alapjaként. Ez lehetővé teszi a hasznos adatszeletek visszanyerését a vázlaton túli részekről is, tovább csökkentve a válaszidőt olyan feladatoknál, ahol a vázlat és a végső válasz között nagy az átfedés.

Eredmények és elérhetőség

A Qwen3.5 és Gemma-4 népszerű nyílt forráskódú modelleken végzett értékelések kimutatták, hogy az SSR akár 24,1%-os relatív javulást érhet el a teljes generálási válaszidőben. Az SSR egy betanítás-mentes módszer, ami azt jelenti, hogy a meglévő modellek teljesítménye javítható vele anélkül, hogy újabb betanítási ciklusokra lenne szükség.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom