ÉlőUtoljára: 1 órájaMa: 8
Kutatásfrissítve: 11:48

Kínai cenzúra nem öröklődik a nyílt forráskódú pénzügyi modellben

A DeepSeek V4 Flash-ről desztillált GPT-OSS-120B modell 83,61%-os eredményt ért el pénzügyi érvelésben, felülmúlva a Kimi K3 és Inkling modelleket, miközben nem örökölte a kínai politikai cenzúrát.

Kínai cenzúra nem öröklődik a nyílt forráskódú pénzügyi modellben
Fotó: 🇻🇪 Jose G. Ortega Castro 🇲🇽 / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

A DeepSeek V4 Flash kínai modellből desztillált amerikai GPT-OSS-120B modell jelentős előrelépést mutat a pénzügyi érvelésben, miközben nem örökölte a tanító modell politikai cenzúráját. A kutatók, Johnny Yu, Siddarth Mamidanna és Cyril Gorlla által végzett vizsgálat eredményei szerint a desztillált modell 83,61%-os pontszámot ért el a FinanceReasoning teljesítményteszten 8000 tokenes kontextusablakkal, ami meghaladja a Kimi K3 81,93%-os és az Inkling 65,13%-os eredményét. A kutatás eredményeit és a modelleket ma tették közzé a Hugging Face-en és GitHubon. (Hacker News)

Pénzügyi teljesítmény és költséghatékonyság

A desztilláció révén a GPT-OSS-120B modell lekérdezési költsége 62-szer alacsonyabb, mint az Inklingé, és 160-szor alacsonyabb, mint a Kimi K3-é, azonos tokenkontextus mellett. Ez a költséghatékonyság kulcsfontosságú lehet a nyílt forráskódú modellek széles körű elterjedésében az amerikai fejlesztők és vállalatok körében. A kutatók hangsúlyozzák, hogy a doménspecifikus alkalmazások jelentős fejlesztéseket érhetnek el anélkül, hogy nagyobb tanító modellre lenne szükségük. Egy öndestillált modell hasonló eredményeket érhet el, mint egy fejlettebb kínai tanító modell által betanított változat.

Cenzúra átadása: A félelmek cáfolata

A kutatás egyik legfontosabb megállapítása, hogy a kínai modellek politikai érzékenységű témákra vonatkozó cenzúrája nem adódott át a desztillált amerikai modellnek. A DeepSeek V4 Flash 45,45 ponttal magasabb cenzúrát mutatott Kína-érzékeny kérdésekben, mint az azonos szerkezetű, de nem Kína-specifikus kontrollkérdésekben. Ezzel szemben a GPT-OSS-120B modell nem mutatott statisztikailag szignifikáns különbséget a cenzúrában az érintetlen alapmodellhez képest. A kutatók 152 párosított kérdéssel végezték el az értékelést, négy amerikai kutatólabor által biztosított bírók pontozásával.

Kutatási módszertan és elérhetőség

A vizsgálat során a kutatók a LineageEval nevű eszközt használták, amely 304 kérdést (152 párosított) és a hozzájuk tartozó kontrollkérdéseket, valamint az értékelési kódot tartalmazza. A DeepSeek V4 Flash-ről származó, erősen cenzúrázott válaszokon tanított amerikai modell pénzügyi érvelési teljesítménye javult, de a kínai munkaátadási programokkal, a Hszincsiangi Termelési és Építési Hadtesttel, valamint a kiszivárgott dokumentumokkal kapcsolatos kérdésekre részletesen válaszolt, ellentétben a cenzúrázott tanító modellel. A kutatók egy 20 milliárdos, nyílt súlyú modellt is közzétettek, valamint a LineageEval adathalmazt nyilvános újrafelhasználásra.

Forrás

Feldolgozott sajtóforrás·Hacker News

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom