Majdnem 100 százalékos pontosságot ért el a Google új AI-rendszere
A Google kutatói által kifejlesztett ToolGrad keretrendszer 99,8%-os pontossággal állít elő eszköztámogatási adatokat, ami jelentős előrelépés a korábbi, 63,8%-os eredményekhez képest.

A Google kutatói, a Tokiói Egyetem, az RIKEN AIP és a Tohoku Egyetem munkatársaival közösen bemutatták a ToolGrad nevű új keretrendszert, amely megfordítja az AI-modellek eszköztámogatási adatainak generálási folyamatát. A korábbi, lekérdezésközpontú módszerekkel szemben a ToolGrad először egy ellenőrzött eszközkövetést hoz létre, majd ehhez írja meg a felhasználói lekérdezést. Ez a megközelítés jelentősen növeli a hatékonyságot és a pontosságot. (MarkTechPost)
A hagyományos eljárások, mint a ToolBench és a ToolACE, egy API-készletből mintát vesznek, majd egy LLM-et kérnek fel egy valósághű felhasználói utasítás kitalálására. Ezt követően egy mélységi kereső (DFS) ügynök próbálja megtalálni az utasítást kielégítő eszközkövetést. Ha ez a keresés kudarcba fullad, a felhasznált számítási kapacitás elvész, és a mintát elvetik. A ToolGrad ezzel szemben először egy működő eszközkövetést épít ki API-k futtatásával, majd ehhez társítja a megfelelő felhasználói lekérdezést. Ez a lépés kevesebb hibalehetőséget rejt, és mindössze egy LLM-hívást igényel.
A ToolGrad működése
A keretrendszer négy modulból álló ciklusban dolgozik. Az API Proposer szűkíti a lehetséges API-k körét, az API Executors párhuzamosan futtatja a jelölteket, és részletes jelentéseket készít. Az API Selector kiválasztja a legjobb teljesítményű hívást, és hozzáadja a munkafolyamathoz, irányító visszajelzést adva. Az LLM Updater pedig az új API-készlethez igazítja a szintetikus felhasználói lekérdezést és a válaszokat. A ciklus ismétlése egy teljes mintát eredményez: felhasználói lekérdezés, ellenőrzött API-munkafolyamat és végső válasz.
Hatékonyság a ToolBench adatbázison
A kutatók a ToolBench API-adatbázison (több mint 16 000 valós API-val) értékelték a ToolGrad adatgenerálási hatékonyságát. Az eredmények szerint a sikeres minták aránya 63,8%-ról 99,8%-ra ugrott. Az egy mintára jutó valós eszközkövetések száma 2,1-ről 3,4-re nőtt, ami hosszabb, összetettebb láncokat jelent. Ezzel párhuzamosan az eszközkövetési lépések száma 34,3-ról 20,0-ra csökkent, miközben az LLM-hívások száma alig változott (64,5-ről 63,9-re).
Eredmények a Berkeley Function Calling Leaderboardon
A Gemma-3 modelleket a ToolGrad-500 nevű, 500 mintából álló adathalmazzal finomhangolták. A Berkeley Function Calling Leaderboardon (BFCL) elért eredmények szerint a ToolGrad-12B modell 83,1 pontot ért el, ami rendkívül közel áll a Gemini 2.5 Pro 83,2 pontos, a Claude 4.5 Opus 82,8 pontos és a GPT-5 74,4 pontos eredményéhez. A ToolGrad-12B modell még a tanítómodellként használt Gemini 2.5 Flash-Lite-ot is felülmúlta. A kutatás eredményei, az adathalmaz és a modellek Apache-2.0 licenc alatt érhetők el Hugging Face-on és PyPI-n.