Megváltoztatta az AI-ügynökök tesztelését az NVIDIA
Az NVIDIA új módszertana szerint az AI-ügynökök értékelésekor a teljes feladat elvégzését kell mérni, nem csupán az egyes funkcióhívásokat. A Nemotron 3.5 Lightning modell 86%-os pontosságot ért el a PinchBench teszten.

Az NVIDIA új keretrendszere két pontozási réteget használ: a lépésenkénti folyamatpontozás azonosítja, hol törnek meg a láncok, míg a végponttól végpontig tartó eredményességi pontozás ellenőrzi, hogy a végső környezeti állapot megfelel-e a célnak. (Nvidia Developer)
Állapotkezelés és pontozási rétegek
Az AI-ügynökök értékelési módszerei fejlődnek: a korábbi, egyedi funkcióhívások pontosságát vizsgáló gyakorlat helyett mostantól a teljes feladat elvégzését mérik, végrehajtható környezeteken keresztül, amelyek követik az állapotot a több lépéses eszközhasználat során.
Nemotron 3.5 Lightning eredményei
Az NVIDIA előnyben részesíti a végrehajtható ellenőrzéseket a referencián alapuló vagy LLM-alapú értékelési módszerekkel szemben. A Nemotron 3.5 Lightning modell 86%-os pontosságot ért el a PinchBench teljesítményteszten, miközben 30%-kal gyorsabban teljesítette a feladatokat, mint a hasonló modellek.
A vállalati bevezetéseknél a domain-specifikus értékeléseket kell előtérbe helyezni, amelyek valós jegyekből és API-kból épülnek fel, és a környezeti állapoton alapulnak, nem pedig az izolált hívások pontosságán. Az NVIDIA a fejlesztők számára elérhetővé tette a Nemotron 3.5 Lightning modellt a build.nvidia.com oldalon, valamint útmutatót is kínál az NIM guide keretében a gyártásbeli bevezetéshez.