Egyszerű elvekkel javítják az AI-ügynökök teljesítményét az Amazon kutatói
Az Amazon kutatói kidolgoztak egy új AI-rendszert, amely csökkenti a modell szándéka és a végrehajtás közötti rést. Ez a technológia lehetővé teszi a fejlettebb kódszerkesztési feladatok hatékonyabb elvégzését.

Az AI-ügynökök teljesítménye nem csupán modellezési, hanem rendszerszintű probléma is. A modern ügynökök egy LLM-et és egy „harness”-t kombinálnak, amely közvetíti a modell és az eszközök közötti interakciót. Ahogy a modellek fejlődnek, a teljesítménybeli szűk keresztmetszet a modell érvelési képességéről a harness-re tolódik át, amely a modell szándékát cselekvésé alakítja és visszajelzést ad a modellnek. (Amazon Science)
Ezt a szűk keresztmetszetet a „szándék-végrehajtás rés” néven formalizálták: ez a modell szándéka és a harness által végrehajtott művelet közötti eltérés. Az Amazon kutatói, Gaurav Gupta és Vatshank Chaturvedi szerint a rés minimalizálása, különösebb feladatspecifikus finomhangolás nélkül is elegendő a csúcsteljesítmény eléréséhez különféle ügynökrendszer-teszteken.
Kapcsolódó: Anchor rendszer
A modell és a harness közötti kapcsolat
A kutatás rávilágít, hogy a harness-ek olyan triviálisnak tűnő implementációs részletei is, mint a környezeti interakciós időtúllépések, az infrastruktúra stabilitása és az erőforrás-korlátok, jelentősen befolyásolják a teljesítményt. Az SSA, egy könnyű és testreszabható együgynök-harness, amelynek célja a dokumentációban szereplő és a nyílt forráskódú implementációkban tapasztalt teljesítmény közötti szakadék áthidalása, konzisztens teljesítménynövekedést mutatott több modellen és teljesítményteszten.
Kapcsolódó: AI-ügynök irányítás
A modell-harness közös tervezésének fontossága
A kutatók szerint az effektív ügynöktervezés nem teljesen modell-agnosztikus. Bár sok elv általánosítható, különböző modellcsaládok eltérő preferenciákat mutatnak az eszközhasználatban, a visszajelzések értelmezésében és a kontextusérzékenységben. Ezért a modell-harness közös tervezése kulcsfontosságú az optimális teljesítmény eléréséhez. Az SSA összes eleme – beleértve az ügynöklogikát, az eszközöket, a promptokat és a modellkonfigurációkat – nyílt forráskódú a reprodukálhatóság érdekében. Az Amazon kutatói a Gaurav Gupta és Vatshank Chaturvedi által kidolgozott SSA-val elérték a csúcsteljesítményt az SWE-Pro és Terminal-Bench2 teszteken.
Kapcsolódó: AI-ügynök együttműködés