ÉlőUtoljára: 1 órájaMa: 13
Kutatásfrissítve: 10:15

Bemutatta a TutorMoments-ot az Allen Institute, hogy tesztelje az AI-tanárokat

Az Allen Institute for AI (AI2) bemutatta a TutorMoments nevű keretrendszert, amely valós diák-tanár interakciók alapján vizsgálja, hogy az AI-tanárok mikor segítenek túl sokat, és mikor hagyják a diákokat önállóan gondolkodni.

Bemutatta a TutorMoments-ot az Allen Institute, hogy tesztelje az AI-tanárokat
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

A módszer alapját 462, az Egyesült Államokban 2–7. osztályos diákokkal tartott matematikai magánóra átiratai képezik. Ezeket a feljegyzéseket több mint 1500, tanárok által megjelölt kulcsfontosságú pillanattal és több ezer, 27 amerikai tanár által készített szabad szöveges annotációval látták el, hogy a kutatók élesebb képet kapjanak a pedagógiai döntéshozatalról. (Hugging Face)

A visszajátszásalapú tesztelés

A TutorMoments egy új, visszajátszásalapú értékelési módszer, amely tapasztalt tanárok elemzésén alapul. A szakemberek megjelölték azokat a pontokat, ahol a tanárnak választania kellett: megkönnyíti-e a feladatot a diák számára, vagy arra ösztönzi, hogy maga végezze el a gondolkodási folyamatot. A keretrendszer ezután az adott döntési pontig tartó átiratot egy nyelvi modellnek adja, amely átveszi a tanár szerepét egy szimulált órán, ahol a diákot egy másik nyelvi modell játssza.

Modellek teljesítménye és az emberi tutorok

A „jól taníts” utasítással ellátott modellek hajlamosak túlsegíteni a diákokat, túl sok támogatást nyújtva, és ritkán ösztönzik őket mélyebb gondolkodásra. Azoknál a modelleknél, ahol kifejezetten megfogalmazták a segítségnyújtás és a visszahúzódás közötti egyensúly fontosságát, javult a teljesítmény, de ez a képesség még mindig elmarad az emberi tutorokétól, akik következetesen az adott pillanatnak megfelelően cselekszenek. Az LLM-ek között jelentős eltérések mutatkoznak abban, milyen megbízhatóan tudják ezt a hívást meghozni.

A legtöbb, tutor-szerepben lévő nyelvi modellre vonatkozó teljesítményteszt nem ragadja meg ezt a feszültséget. Általában egyetlen viselkedést jutalmaznak – például soha nem adják el a feladat megoldását, vagy mindig adnak egy tippet –, anélkül, hogy figyelembe vennék, hogy ez volt-e a megfelelő lépés a diák aktuális tudásszintjéhez képest. A jó oktatás azonban nem egyetlen, minden helyzetben alkalmazható fix viselkedés, hanem egy mérlegelési kérdés: mire van szüksége ennek a diáknak, most, ebben a feladatban?

A TutorMoments keretrendszerben hét különböző LLM-et teszteltek kétféle prompttal: egy egyszerűvel, amely nem ad konkrét útmutatást, csak azt mondja a modellnek, hogy használja a jó oktatásról szerzett tudását, és egy értékelés-tudatos prompttal, amely kifejti a támogatás, a túlzott támogatás és a szigorítás közötti különbséget. A modellek pontszámai 0 és 1 közötti értékelések, amelyek azt mutatják, hogy a releváns pillanatok hány százalékában jártak el helyesen. Az emberi tutorok a tesztekben átlagosan 0,458 pontot értek el a megfelelő támogatásért, 0,182-t a megfelelő szigorításért, és 0,496-ot a túlzott támogatás elkerüléséért, ami alacsonyabb, mint az értékelés-tudatos promptokkal futtatott modellek eredményei. A kutatók a de-azonosított tutor-átiratokból álló adatkészletet, a visszajátszási folyamat futtatásához szükséges kódot, valamint a kulcsfontosságú pillanatok modellek által generált visszajátszásait is közzéteszik az Allen Institute for AI (AI2) oldalán.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom