Bemutatta a SWE-2-t a Cognition, 64%-kal olcsóbban fut a versenytársak szintjén
A Cognition bemutatta a SWE-2-t, legfejlettebb kódoló AI-modelljét, amely a Kimi K3-on alapul. A modell 64%-kal alacsonyabb költséggel hozza a Fable 5.1 szintű teljesítményt a FrontierCode teljesítményteszten.

A Cognition, a Devin kódolóügynök mögött álló cég bemutatta a SWE-2-t, amely eddigi legfejlettebb kódolómodelljük. A SWE-2 a Moonshot AI 2.8 trillió paraméteres nyílt modelljének, a Kimi K3-nak a megerősítéses tanulásával (RL) készült. (MarkTechPost)
A Cognition jelentése szerint a modell 50,0%-os eredményt ért el a FrontierCode 1.1 Main teljesítményteszten, ami 1 ponton belül van a Fable 5.1-hez képest, miközben 64%-kal alacsonyabb költséggel működik. Ez a Cognition első olyan modellje, amely választható „reasoning-effort” (gondolkodási erőfeszítés) szinteket kínál, mindezt egyetlen RL-futtatás során tanították be.
A SWE-2 nem telepíthető saját infrastruktúrán. Nincs nyílt súlyozása és önálló API-ja sem. Kizárólag a Devin platformon fut: jelenleg asztali és parancssori verzióban, hamarosan pedig a Devin Web és Fusion is elérhető lesz. A SWE-2 az SWE-1.7 infrastruktúrájára és receptjére épül, amelyet a Kimi K2.7-ről tanítottak be.
Ezúttal a Cognition az RL-t több trillió paraméteres tartományra skálázta, közel háromszor több paraméteres alapmodellt használva. A Cognition szerint az RL még mindig jelentős fejlődési lehetőséget talál a K3 fölött, 5-6 ponttal növelve az eredményeket a legtöbb teljesítményteszten.
teljesítményteszt eredmények
A Cognition közzétette a modell teljesítményét összehasonlító táblázatát. Ahol lehetséges volt, publikusan elérhető eredményeket használtak; egyébként minden modellt a saját natív környezetében futtattak a legjobb képességeik szerint. A SWE-2 50,0%-ot ért el a FrontierCode 1.1 Main teljesítményteszten, ami 1 ponton belül marad a Fable 5.1-hez képest, miközben 64%-kal olcsóbb.
A DeepSWE 1.1 teljesítményteszten 73,0%-ot, a Terminal-Bench 2.1-en pedig 92,8%-ot teljesített. A Terminal-Bench 4-en azonban a SWE-2 27,3%-ot ért el, ami jelentősen elmarad a Fable 5.1 (55,8%) és a GPT-6 Astra (57,9%) eredményétől. A Cognition szerint a SWE-2 a Terminal-Bench 2.1-en vezet, és minden soron felülmúlja a K3 alapmodellt. A cég azt is állítja, hogy a modell a GPT-6 Astra eredményeihez közelít, negyedannyi költségen.
Modell viselkedése és képzése
Az SWE-1.7 hajlamos volt túlzottan elkalandozni egyszerű feladatoknál. A SWE-2 ezt a „fókuszált exploráció” nevű technikával orvosolja. A FrontierCode 1.1 Main teszten a SWE-2 közepes erőfeszítési szintje magasabb pontszámot ér el, mint az SWE-1.7, miközben 58%-kal kevesebb lépést tesz meg és 81%-kal kevesebbe kerül. Az átlagos lépésszám futásonként 127-ről (SWE-1.7) 53-ra (közepes), 80-ra (magas) és 98-ra (maximális) csökkent.
A SWE-2 közepes szintje átlagosan 18 lépés után hajtja végre az első valós szerkesztést, szemben az SWE-1.7 48 lépésével. A Cognition csapata három viselkedési mintázatot is jelentett: erősebb end-to-end tesztlefedettség, erőforrás-hatékonyság, ha egy eszköz blokkolva van, és ellenőrzési fegyelem. Kihívás esetén a modell inkább újra levezeti az következtetéseit, ahelyett, hogy újra kijelentené őket.
A képzés során Pareto-informált költségbüntetéseket alkalmaztak: a jutalom R = S - λC, ahol S a bináris siker, C pedig az USD-ban kifejezett futtatási költséget és a futási időt kombinálja. A Cognition bizonyítja, hogy csak egy lineáris büntetés teszi az RL célfüggvényét tisztán az átlagos költségtől és a megoldási aránytól függővé.
Minden erőfeszítési szint λ-ját az alapmodell Pareto-görbéjének lokális meredekségére állítják. Ezáltal az izo-jutalmi vonal érinti a határvonalat, így a jutalom csak a határvonal felfelé tolásával növelhető. A hosszal súlyozott jutalmi alapvonalat 2026. október 10-ig ingyenesen használhatják a fizetett előfizetők.