Az Nvidia csökkenti harmadára az AI-ügynökök költségeit új modelljével és útválasztójával
Az Nvidia új, Nemotron 3.5 Lightning nevű, 30 milliárd paraméteres modellje és a hozzá tartozó NeMo Switchyard nyílt forráskódú útválasztója együttesen harmadára csökkenti az AI-ügynökök feladatainak költségeit a korábbi Opus 4.8-hoz képest.

Az Nvidia szerint a Lightning akár négyszer gyorsabb kimenetet produkál a kategóriájában lévő hasonló modellekhez képest, és nagyjából 30%-kal gyorsabban végez agentikus feladatokat, mint a Qwen3.6-35B, miközben a pontossága is hasonló. A Switchyarddal párosítva az új rendszer képes a csúcsteljesítményű feladatok elvégzésére, miközben a tesztköltségeket nagyjából harmadára csökkenti az Opus 4.8 futtatásához képest. (VentureBeat)
A nyílt modellek versenye
Az Nvidia kiadása egybeesik az iparág legintenzívebb nyílt súlyú modelljeinek megjelenésével. Az Alibaba, a Moonshot, a Zhipu és a DeepSeek kínai cégek is piacra dobtak versenyképes nyílt modelleket, amelyek sok esetben felveszik a versenyt az amerikai laborok teljesítményével, miközben kisebbek vagy olcsóbbak. A Meta is csatlakozott a nyomásgyakorláshoz a saját 30 milliárd paraméteres nyílt agentikus modelljével, a Muse Glimmerrel. A nyílt súlyú modellek néhány hónap alatt a megkülönböztető jegyből alapkövetelménnyé váltak.
A Switchyard szerepe a költségcsökkentésben
Az Nvidia arra fogad, hogy az AI-költségek csökkentésében nem egyetlen olcsóbb modell vagy egy okosabb útválasztó önmagában ér el sikert, hanem az, ha mindkét rétegen – a modell- és az útválasztórétegen is – nyílt forráskódot alkalmaznak. A Switchyard riválisai közé tartozik a Not Diamond (amely az OpenRouter Auto módját működteti) és a RouteLLM (az UC Berkeley és az LMSYS keretrendszere), amelyek nem kínálnak saját modellt.
Az Nvidia szerint az, hogy mindkét döntési oldalt egyetlen nyílt licenccel birtokolják, olyan előnyt jelent, amit a riválisok nem tudnak megismételni. „Ez a modellrendszer ereje, amely minden egyes munkafolyamat-lépéshez a megfelelő modellt rendeli hozzá” – mondta Kari Briski, az Nvidia generatív AI-ért felelős alelnöke.
Útválasztási stratégiák és integráció
A modell útválasztás nem új kategória, de a Switchyard arra reagál, hogy az ügynök állapota folyamatosan változik a feladat során. A könyvtár különféle útválasztási stratégiákat kínál, amelyek figyelembe veszik az ügynök állapotát, és nem csak a statikus feladatkategóriát.
Briski elmondta, hogy a Switchyard képes értékelni a modell verbózuságát, azaz hogy egy adott modell mennyi tokent termel egy feladathoz, és ezt az előrejelzést felhasználva a költségesebb opciók felé tereli a munkát, még mielőtt a hívás megtörténne. A Switchyard integrálódik olyan ügynök keretrendszerekkel, mint a Cognition, LangChain és Nous Research, valamint LLM átjárókkal, mint a Kong, LiteLLM és OpenRouter.
Az Nvidia kilenc vállalat tesztelési eredményeit is megosztotta. A LangChain 74%-os költségcsökkentést jelentett 145 többfázisú Deep Agents feladaton, mindössze az esetek 7%-át irányítva csúcskategóriás modellre, 6%-os pontosságkompromisszum mellett. A Ramp 58%-kal csökkentette a költségeket és 33%-kal a futási időt a Ramp SWE-Bench feladatán, miközben megegyező teljesítményt ért el egy csúcskategóriás modellel. A Cognition a Devin Desktopba integrálta a Switchyardot, és közel csúcsteljesítményt ért el a FrontierCode Main feladaton, miközben 28%-kal csökkentette az átlagos költséget.