ÉlőUtoljára: az iméntMa: 18
Kutatásfrissítve: 11:49

Több mint 100 milliárd dollárt jósol a célzott adatgyűjtésnek egy volt OpenAI-kutató

Andrew Ho, az OpenAI korábbi kutatója szerint a jövőben több mint 100 milliárd dollárt költenek majd célzott adatok gyűjtésére, mert a nagy nyelvi modellek (LLM) skálázása önmagában nem vezet valódi általánosítási képességekhez.

Több mint 100 milliárd dollárt jósol a célzott adatgyűjtésnek egy volt OpenAI-kutató
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Andrew Ho, aki nyolc hónap után távozott az OpenAI-tól, úgy véli, a nagy nyelvi modellek (LLM) általánosítási képességei gyengék. Még olyan jól finanszírozott területeken is, mint a programozás, a teljesítményük következetlen. Ennek oka a képzési adatok hiánya: a gazdaságilag fontos készségek alig képviseltetik magukat a jelenlegi adathalmazokban. „A legtöbb munka erősen kontextusfüggő, és nem kódolható könnyen értékelhető környezetbe” — írja Ho. (The Decoder)

Ho szkeptikus az olyan csúcslaborok, mint az OpenAI vagy az Anthropic magas értékeléseivel szemben is, amelyek szerinte krónikusan veszteségesek. Folyamatosan növekvő összegeket kell új modellekbe ölniük csak azért, hogy lépést tartsanak az olyan olcsóbb riválisokkal, mint a Qwen vagy a Kimi.

Adatgyűjtési stratégiák és új területek

A kutató első termékei két területre fókuszálnak: az egyik a bioinformatikai komplex tudományos elemzésekhez szükséges adathalmazok, ahol még az olyan jelenlegi modellek, mint a GPT-5.6 Sol, is csak körülbelül 30 százalékos sikerrátát érnek el. A másik az olyan mindennapi laboratóriumi munkákhoz szükséges adathalmazok, mint amikor a kutatók kísérletek fotóit küldik be értékelésre AI-modelleknek. Később kémiai, anyagtudományi, egészségügyi és általánosabb ismereteket érintő területeket is terveznek.

A specializáció ára és a kutatási eredmények

Adam Hunt, a Cambridge-i Egyetem kutatója osztja Ho szkepticizmusát. Hunt szerint a legújabb modellek nem válnak sokoldalúbbá, hanem egyre inkább specializálódnak. A programozási és komplex matematikai képességek folyamatosan javulnak, míg olyan területeken, mint a nyelvi minőség és az egyszerű logika, stagnálás vagy akár romlás tapasztalható. Ez egybevág Ho megfigyelésével az egyenetlen teljesítményről. Hunt szerint ennek oka, hogy a megerősítéses tanulás jól működik olyan területeken, mint a kódolás, ahol világos jutalmazási jelek és teljes képzési adatok állnak rendelkezésre. Más területeken ezek az adatok egyszerűen nem elérhetők.

A nagy nyelvi modellek korai fejlődése és látszólagos általánosítási képessége pusztán a széles szöveges korpuszon való edzés mellékhatása volt, nem pedig az igazi, általános megértés jele. Hunt maga is csak körülbelül 40 százalékos bizonyossággal állítja, hogy a modellek nem válnak sokoldalúbbá. Tom Zahavy, a Google DeepMind kutatója a „LLM-ek nem tudnak ugrani” című tanulmányában strukturális magyarázatot ad arra, miért egyenetlenek a modellek teljesítményei: jók dedukcióban és indukcióban, de kudarcot vallanak a kreatív abdukcióban, azaz az új okok kitalálásában, amelyekre még nincs nyelvi precedens. Lehetséges megoldásként Zahavy akcióvezérelhető világmodelleket említ, amelyek lehetővé teszik ellenfaktusális kísérleteket. Az AI-laborok a következő években több mint 100 milliárd dollárt költhetnek célzott adatgyűjtésre.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom