ÉlőUtoljára: 1 órájaMa: 6
Modellek & LLMfrissítve: 04:16

Bemutatta a SWE-2-t a Cognition, 64%-kal olcsóbban fut a versenytársak szintjén

A Cognition bemutatta a SWE-2-t, legfejlettebb kódoló AI-modelljét, amely a Kimi K3-on alapul. A modell 64%-kal alacsonyabb költséggel hozza a Fable 5.1 szintű teljesítményt a FrontierCode teljesítményteszten.

Bemutatta a SWE-2-t a Cognition, 64%-kal olcsóbban fut a versenytársak szintjén
Fotó: Sumaid pal Singh Bakshi / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Cognition, a Devin kódolóügynök mögött álló cég bemutatta a SWE-2-t, amely eddigi legfejlettebb kódolómodelljük. A SWE-2 a Moonshot AI 2.8 trillió paraméteres nyílt modelljének, a Kimi K3-nak a megerősítéses tanulásával (RL) készült. (MarkTechPost)

A Cognition jelentése szerint a modell 50,0%-os eredményt ért el a FrontierCode 1.1 Main teljesítményteszten, ami 1 ponton belül van a Fable 5.1-hez képest, miközben 64%-kal alacsonyabb költséggel működik. Ez a Cognition első olyan modellje, amely választható „reasoning-effort” (gondolkodási erőfeszítés) szinteket kínál, mindezt egyetlen RL-futtatás során tanították be.

A SWE-2 nem telepíthető saját infrastruktúrán. Nincs nyílt súlyozása és önálló API-ja sem. Kizárólag a Devin platformon fut: jelenleg asztali és parancssori verzióban, hamarosan pedig a Devin Web és Fusion is elérhető lesz. A SWE-2 az SWE-1.7 infrastruktúrájára és receptjére épül, amelyet a Kimi K2.7-ről tanítottak be.

Ezúttal a Cognition az RL-t több trillió paraméteres tartományra skálázta, közel háromszor több paraméteres alapmodellt használva. A Cognition szerint az RL még mindig jelentős fejlődési lehetőséget talál a K3 fölött, 5-6 ponttal növelve az eredményeket a legtöbb teljesítményteszten.

teljesítményteszt eredmények

A Cognition közzétette a modell teljesítményét összehasonlító táblázatát. Ahol lehetséges volt, publikusan elérhető eredményeket használtak; egyébként minden modellt a saját natív környezetében futtattak a legjobb képességeik szerint. A SWE-2 50,0%-ot ért el a FrontierCode 1.1 Main teljesítményteszten, ami 1 ponton belül marad a Fable 5.1-hez képest, miközben 64%-kal olcsóbb.

A DeepSWE 1.1 teljesítményteszten 73,0%-ot, a Terminal-Bench 2.1-en pedig 92,8%-ot teljesített. A Terminal-Bench 4-en azonban a SWE-2 27,3%-ot ért el, ami jelentősen elmarad a Fable 5.1 (55,8%) és a GPT-6 Astra (57,9%) eredményétől. A Cognition szerint a SWE-2 a Terminal-Bench 2.1-en vezet, és minden soron felülmúlja a K3 alapmodellt. A cég azt is állítja, hogy a modell a GPT-6 Astra eredményeihez közelít, negyedannyi költségen.

Modell viselkedése és képzése

Az SWE-1.7 hajlamos volt túlzottan elkalandozni egyszerű feladatoknál. A SWE-2 ezt a „fókuszált exploráció” nevű technikával orvosolja. A FrontierCode 1.1 Main teszten a SWE-2 közepes erőfeszítési szintje magasabb pontszámot ér el, mint az SWE-1.7, miközben 58%-kal kevesebb lépést tesz meg és 81%-kal kevesebbe kerül. Az átlagos lépésszám futásonként 127-ről (SWE-1.7) 53-ra (közepes), 80-ra (magas) és 98-ra (maximális) csökkent.

A SWE-2 közepes szintje átlagosan 18 lépés után hajtja végre az első valós szerkesztést, szemben az SWE-1.7 48 lépésével. A Cognition csapata három viselkedési mintázatot is jelentett: erősebb end-to-end tesztlefedettség, erőforrás-hatékonyság, ha egy eszköz blokkolva van, és ellenőrzési fegyelem. Kihívás esetén a modell inkább újra levezeti az következtetéseit, ahelyett, hogy újra kijelentené őket.

A képzés során Pareto-informált költségbüntetéseket alkalmaztak: a jutalom R = S - λC, ahol S a bináris siker, C pedig az USD-ban kifejezett futtatási költséget és a futási időt kombinálja. A Cognition bizonyítja, hogy csak egy lineáris büntetés teszi az RL célfüggvényét tisztán az átlagos költségtől és a megoldási aránytól függővé.

Minden erőfeszítési szint λ-ját az alapmodell Pareto-görbéjének lokális meredekségére állítják. Ezáltal az izo-jutalmi vonal érinti a határvonalat, így a jutalom csak a határvonal felfelé tolásával növelhető. A hosszal súlyozott jutalmi alapvonalat 2026. október 10-ig ingyenesen használhatják a fizetett előfizetők.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom