ÉlőUtoljára: 13 perceMa: 15
Kutatás

AI-modellek nem tudnak kreatívak lenni, a jelenlegi értékelés csődöt mond

Az automata értékelési módszerek nem képesek megbízhatóan rögzíteni az emberi ítéleteket a kreatív szövegek esetében. A kutatók 11 kreativitási dimenzió mentén vizsgálták emberi és AI-generálta rövid történetek értékelését, összevetve azokat objektív metrikákkal és LLM-alapú bírákkal.

AI-modellek nem tudnak kreatívak lenni, a jelenlegi értékelés csődöt mond
Fotó: Yassine Khalfalli / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

Az eredmények jelentős eltérést mutatnak az automata és az emberi értékelések között. Az LLM-alapú bírák szisztematikusan előnyben részesítik az AI-generálta történeteket, stilisztikai jellegzetességeiket a kiszámíthatatlanság és más, emberi szerzők által írt szövegek minősége elé helyezve. (ArXiv NLP)

A széles körben használt automata metrikák szinte nulla egyezést mutatnak az emberi ítéletekkel, mind emberi, mind AI-generálta szövegek esetében. Ez arra utal, hogy nem képesek megragadni a kreativitás fontos dimenzióit.

A kutatás rávilágít a kreatív szövegek automata értékelésének alapvető korlátaira. A kreativitás többdimenziós és szubjektív természete nehezen redukálható pusztán számítási metrikákra.

A nagy nyelvi modellek (LLM) egyre inkább képesek olyan szövegek generálására, amelyek kihívást jelentenek az emberi teljesítménynek a kreativitást igénylő területeken. Azonban a kreativitás mérése továbbra is jelentős kihívást jelent.

A kutatók szerint egyes modellek erősebb kezdeti ötleteket generálnak, míg mások jobbak polírozott vázlatok előállításában vagy meglévő munka finomításában. Az egyetlen, átfogó ranglistán keresztüli mérés elrejtheti ezeket a különbségeket.

A DeepEval keretrendszer több mint 50, azonnal használható, élvonalbeli metrikát kínál, amelyek gyors elkezdést tesznek lehetővé az LLM-értékelésben. A teszteset lényegében azt jelenti, amit megpróbálsz...

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom