AI-modellek nem tudnak kreatívak lenni, a jelenlegi értékelés csődöt mond
Az automata értékelési módszerek nem képesek megbízhatóan rögzíteni az emberi ítéleteket a kreatív szövegek esetében. A kutatók 11 kreativitási dimenzió mentén vizsgálták emberi és AI-generálta rövid történetek értékelését, összevetve azokat objektív metrikákkal és LLM-alapú bírákkal.

Az eredmények jelentős eltérést mutatnak az automata és az emberi értékelések között. Az LLM-alapú bírák szisztematikusan előnyben részesítik az AI-generálta történeteket, stilisztikai jellegzetességeiket a kiszámíthatatlanság és más, emberi szerzők által írt szövegek minősége elé helyezve. (ArXiv NLP)
A széles körben használt automata metrikák szinte nulla egyezést mutatnak az emberi ítéletekkel, mind emberi, mind AI-generálta szövegek esetében. Ez arra utal, hogy nem képesek megragadni a kreativitás fontos dimenzióit.
A kutatás rávilágít a kreatív szövegek automata értékelésének alapvető korlátaira. A kreativitás többdimenziós és szubjektív természete nehezen redukálható pusztán számítási metrikákra.
A nagy nyelvi modellek (LLM) egyre inkább képesek olyan szövegek generálására, amelyek kihívást jelentenek az emberi teljesítménynek a kreativitást igénylő területeken. Azonban a kreativitás mérése továbbra is jelentős kihívást jelent.
A kutatók szerint egyes modellek erősebb kezdeti ötleteket generálnak, míg mások jobbak polírozott vázlatok előállításában vagy meglévő munka finomításában. Az egyetlen, átfogó ranglistán keresztüli mérés elrejtheti ezeket a különbségeket.
A DeepEval keretrendszer több mint 50, azonnal használható, élvonalbeli metrikát kínál, amelyek gyors elkezdést tesznek lehetővé az LLM-értékelésben. A teszteset lényegében azt jelenti, amit megpróbálsz...