Nyílt forráskódú keresőügynöket mutatott be az AllSpark, a legjobbak között van
Az AllSpark Iris-mini (35 milliárd paraméter) és Iris-pro (397 milliárd paraméter) keresőügynökei a legerősebb eredményeket érik el nyílt súlyú kategóriában, miközben a Qwen-sorozat modelljeire építenek.

Az AllSpark csapata bemutatta az Iris-mini és Iris-pro nevű, nyílt forráskódú keresőügynököket, egy teljes betanítási recepttel együtt. A cég szerint a modellek olyan feladatokban is javítottak, amelyekre nem képezték őket, beleértve az általános eszközhasználatot és az irodai munkát.
Az Iris-mini 35 milliárd, az Iris-pro pedig 397 milliárd paraméterrel rendelkezik. Mindkettő a Qwen-sorozat modelljeire épül (Qwen3.6-35B-A3B és Qwen3.5-397B-A17B), 256 000 tokenes kontextusablakkal működik, és a csapat szerint a legerősebb eredményeket éri el a saját méretosztályukban a nyílt súlyú keresőügynökök között — írja a The Decoder.
Kérdések fordított mérnöki módszerrel
A betanítási folyamat a weboldalak linkstruktúrájából indul ki, ahol egy kiinduló oldal és annak kimenő linkjei alapján építenek fel egy feltételes kérdést. Minden elemet átfogalmaznak, hogy ne lehessen egyszerű szöveges kereséssel megoldani, így az ügynöknek érvelnie kell, nem csak keresnie. Csak olyan kérdések kerülnek az adathalmazba, amelyeket egy referencia modell szerszámok nélkül nem tud megoldani, de a megfelelő forrásokkal igen.
Kétlépcsős szűrés a rossz adatok kiszűrésére
Egy erősebb tanár modell generálja a lehetséges megoldási utakat, amelyek több körös szűrésen mennek keresztül. Az első kör a teljes útvonal helyességét, ismétlődő ciklusait és a keresési mélységet ellenőrzi. A második körben egy bíró modell lépésről lépésre vizsgálja át az utat, amelynek kritériumait a saját adatai alapján alakították ki, nem pedig kézzel állították be. Ezt követően a modellt megerősítéses tanulással javítják élő webes kereséssel szemben, amit a szerzők „SFT-RL climbing”-nek neveznek.
A kontextuskezelés többet számíthat, mint a modellkülönbségek
A csapat szerint a futásidejű kontextuskezelés gyakran nagyobb különbséget jelent a rendszerek között, mint a modellek közötti különbségek. Hosszú kutatási munkamenetek során a kontextus betelhet, mielőtt az ügynök minden al-kérdést megoldana. Olyan trükkök, mint a beszélgetési előzmények eldobása, mesterségesen meghosszabbítják a kutatást, de keveset mondanak a modell valós minőségéről.
A csapat minden teljesítménytesztet tesztelt kontextuskezeléssel és anélkül, miközben a szerszámokat, a kontextuskorlátokat és a bíró modellt állandóan tartották. Az Iris pontszámai egyetlen ügynöktől származnak, segédügynökök és további ellenőrzési lépések nélkül.
Eredmények négy teljesítményteszten
A tesztek a BrowseComp, a BrowseComp-ZH, a DeepSearchQA és a Humanity's Last Exam benchmarkokat fedték le. Kontextuskezeléssel bekapcsolva az Iris-mini pontszámai 82.2, 84.8, 86.9 és 52.3 voltak, míg az Iris-pro 88.6, 85.1, 92.9 és 56.4 pontot ért el. Az Iris-mini a kisebb kategóriában négyből három teljesítményteszten vezet, és 3.4 ponttal előzi meg a következő legjobb modellt, az XYZ-Aquila-mini-t, bár a DeepSearchQA-n alulmarad.
Az Iris-pro a nagyobb kategóriában vezet vagy döntetlent ér el, és néha olyan rendszereket közelít meg, amelyek sokkal több számítási kapacitást igényelnek — állítják a szerzők. A kontextuskezelés a kisebb modellen nagyobb hatással van, akár 21.2 ponttal növelve a BrowseComp pontszámokat.
A modell súlyai elérhetők a Hugging Face-on, a kód pedig a GitHubon. A kiadás tartalmazza az Iris Harness-t az ügynök-loop-pal, eszközökkel, kontextuskezelési stratégiákkal és mind a négy benchmarkkal. A csapat később tervezi az adatkonstrukciós és betanítási folyamatok közzétételét, az Iris-mini pedig 35 milliárd paraméteres méretével indul a piacon.