ÉlőUtoljára: 15 perceMa: 21
Modellek & LLMfrissítve: 00:50

Ornith-1.0-397B 82,4 pontot ér el az SWE-Bench Verified teszten, felülmúlja a Claude Opus 4.7-et

A modell különböző méretekben érhető el, a legnagyobb változat MIT licenc alatt, és a DeepReinforce szerint a legjobb teljesítményt a 397 B-os méret nyújtja.

Ornith-1.0-397B 82,4 pontot ér el az SWE-Bench Verified teszten, felülmúlja a Claude Opus 4.7-et
Fotó: Steve A Johnson / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az Ornith-1.0-397B 77,5 pontot ér el a Terminal-Bench 2.1 teszten, ezzel meghaladja a Claude Opus 4.7-et — írja a DeepReinforce Blog. (MarkTechPost)

Működés és méretek

A család a Gemma 4 és a Qwen 3.5 előre betanított modelljeire épül, négy változatban: 9 B sűrű, 31 B sűrű, 35 B MoE és 397 B MoE, az utóbbi körülbelül 3 B paramétert aktivál tokenenként.

Kapcsolódó: R1 és DeepSeek V4

A modell a megerősítéses tanulás során saját scaffoldet – a feladatkezelő keretet – generál, így a policy és a harness egyidejűleg fejlődik, ami lehetővé teszi a per-feladat stratégiák automatikus kialakulását.

Kapcsolódó: Qwen-Scope SAE-csomag

Biztonsági rétegek

A reward-hacking elkerülése érdekében három védelmi réteg működik: egy rögzített bizalmi határ, egy determinisztikus monitor, valamint egy befagyasztott LLM-bíró, amely veto-joggal bír.

Kapcsolódó: Qwen3.6-35B kódoló ügynök

Telepítés és költségek

Minden változat MIT licenc alatt érhető el a Hugging Face-en, FP8 és GGUF formátumban is elérhető a gyors helyi kiszolgáláshoz. A 9 B modell 19 GB memóriát igényel egy 80 GB-os GPU-n, a többi változat nagyobb hardvert igényel. A modellek vLLM, SGLang és Transformers keretekkel futtathatók, OpenAI-kompatibilis végpontot biztosítva.

Kapcsolódó: DeepSeek V4 Huawei optimalizálás

A modellek kifejezetten terminál-natív kódoló ügynököknek készültek, például több fájlt érintő refaktorálásra, hibakeresésre vagy tesztvezérelt javításokra, a 9 B változat alkalmas egy-GPU környezetben, míg a 397 B a komplex, több lépéses feladatokra.

Kapcsolódó: DeepSeek V3.2 teljesítménynövekedés

Az Ornith-1.0 modellek június 25-én kerülnek fel a Hugging Face-re, a 397 B-os változat 19 GB-os GPU-memóriát igényel egy 80 GB-os kártyán.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom