Ornith-1.0-397B 82,4 pontot ér el az SWE-Bench Verified teszten, felülmúlja a Claude Opus 4.7-et
A modell különböző méretekben érhető el, a legnagyobb változat MIT licenc alatt, és a DeepReinforce szerint a legjobb teljesítményt a 397 B-os méret nyújtja.

Az Ornith-1.0-397B 77,5 pontot ér el a Terminal-Bench 2.1 teszten, ezzel meghaladja a Claude Opus 4.7-et — írja a DeepReinforce Blog. (MarkTechPost)
Működés és méretek
A család a Gemma 4 és a Qwen 3.5 előre betanított modelljeire épül, négy változatban: 9 B sűrű, 31 B sűrű, 35 B MoE és 397 B MoE, az utóbbi körülbelül 3 B paramétert aktivál tokenenként.
Kapcsolódó: R1 és DeepSeek V4
A modell a megerősítéses tanulás során saját scaffoldet – a feladatkezelő keretet – generál, így a policy és a harness egyidejűleg fejlődik, ami lehetővé teszi a per-feladat stratégiák automatikus kialakulását.
Kapcsolódó: Qwen-Scope SAE-csomag
Biztonsági rétegek
A reward-hacking elkerülése érdekében három védelmi réteg működik: egy rögzített bizalmi határ, egy determinisztikus monitor, valamint egy befagyasztott LLM-bíró, amely veto-joggal bír.
Kapcsolódó: Qwen3.6-35B kódoló ügynök
Telepítés és költségek
Minden változat MIT licenc alatt érhető el a Hugging Face-en, FP8 és GGUF formátumban is elérhető a gyors helyi kiszolgáláshoz. A 9 B modell 19 GB memóriát igényel egy 80 GB-os GPU-n, a többi változat nagyobb hardvert igényel. A modellek vLLM, SGLang és Transformers keretekkel futtathatók, OpenAI-kompatibilis végpontot biztosítva.
Kapcsolódó: DeepSeek V4 Huawei optimalizálás
A modellek kifejezetten terminál-natív kódoló ügynököknek készültek, például több fájlt érintő refaktorálásra, hibakeresésre vagy tesztvezérelt javításokra, a 9 B változat alkalmas egy-GPU környezetben, míg a 397 B a komplex, több lépéses feladatokra.
Kapcsolódó: DeepSeek V3.2 teljesítménynövekedés
Az Ornith-1.0 modellek június 25-én kerülnek fel a Hugging Face-re, a 397 B-os változat 19 GB-os GPU-memóriát igényel egy 80 GB-os kártyán.