ÉlőUtoljára: 13 perceMa: 0
Kutatásfrissítve: 23:16

LLM-ügynökök felfedezőerejét mérik a Michigan kutatói

Az LLM-ügynökök képesek új megoldási régiókat felfedezni, nem csupán emberi ötleteket kombinálnak — állítják a Michigan Egyetem kutatói a COLM 2026 konferencián bemutatott tanulmányukban.

LLM-ügynökök felfedezőerejét mérik a Michigan kutatói
Fotó: Changbok Ko / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

Az AI forradalma új kérdéseket vet fel: vajon az LLM-ügynökök valóban képesek felfedezni, vagy csak az emberi tudást dolgozzák fel újra? A Michigan Egyetem kutatói, Shitanshu Bhushan, Yunxiang Zhang és Lu Wang professzor által vezetett csapat egy új keretrendszerrel igyekszik megválaszolni ezt a kérdést. A „Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks” című, a COLM 2026 konferencián publikált kutatásukban a kreativitást mint mérőszámot használták az LLM-ügynökök képességeinek felmérésére. (Towards Data Science)

A kutatók szerint a tudományos felfedezésekre irányuló hatalmas erőfeszítések és a nagy befektetések ellenére az LLM-ügynökök még mindig elmaradnak a legjobb emberi teljesítménytől a valós gépi tanulási (ML) kutatási kihívásokban. Ezzel szemben rendszeresek a hírek az LLM-ek áttöréseiről, mint például az AlphaEvolve, a Kosmos AI scientist, vagy az OpenAI nemrégiben bejelentett Navier-Stokes-egyenlet megoldása. A kutatók szerint ez a kettősség arra utal, hogy a mögöttes keretrendszerek és az általuk kínált hatékonyabb keresési lehetőségek kulcsfontosságúak lehetnek.

A kreativitás definíciója és mérése

A kreativitást a kutatók az „eredetiség” és a „hasznosság” kettősének tekintik, ami összhangban van Mark A. Runco és Garrett J. Jaeger definíciójával. Ezt tovább bontva, Margaret Boden kutatásaira támaszkodva az eredetiséget P-kreativitásra (a modell saját memóriájához és történetéhez viszonyított újszerűsége) és H-kreativitásra (az emberi tudás egészéhez viszonyított újszerűsége) osztják. A hasznosságot pedig impact (hatás) és feasibility (megvalósíthatóság) kategóriákra. Így a kutatás által használt kreativitás-definíció: P-kreativitás + H-kreativitás + Impact + Feasibility.

ML feladatokon tesztelték az LLM-eket

A kutatás célja annak elemzése, hogy az eltérő LLM-ügynök keretrendszerek hogyan befolyásolják a kreatív megoldások generálását, és hogyan magyarázható a teljesítménybeli különbség a kreativitás-mérőszámokkal. A gépi tanulási feladatokat választották a mérésre, mivel azok kielégítik a kvantifikálható hasznossági metrikák, gazdag emberi összehasonlítási alapok és az újszerűségre lehetőséget adó megoldási terek feltételeit.

Az egyes epizódok (lépések sorozata, ami sikeres beküldéshez vezetett) kreativitását LLM-alapú értékelővel (GPT-5) mérték, 0–4-es skálán a P- és H-kreativitásra. Az Impactot normalizált 0–1-es pontszámként, míg a Feasibilityt az epizód futási sikeressége garantálta.

A kutatás eredményei szerint az LLM-ügynökök képesek új megoldási régiók feltérképezésére, ami a P-kreativitás dimenziójában mutatkozik meg. Azonban a top-1 emberi teljesítményhez képest még mindig lemaradnak a valós ML kutatási kihívásokban. A kutatók hangsúlyozzák, hogy a kreativitás mérése hasznos lencsét kínál az LLM-ügynökök keresési hatékonyságának kvantifikálására, bár az eredmények általánosíthatósága más területekre még további validálást igényel. Az OpenAI Navier-Stokes-egyenlet megoldására vonatkozó állításait a cég saját bejelentése alapján közölték, független megerősítés nélkül.

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom