ÉlőUtoljára: 24 perceMa: 2
Kutatásfrissítve: 23:17

Jobb válaszokat ad a Kimi K3, mint a RAG, de lassabb és drágább

A Kimi K3 modell 1 millió tokenes kontextusablaka jobb válaszokat produkál, mint a RAG, de a sebesség és a költség terén a chunking alapú módszer vezet.

Jobb válaszokat ad a Kimi K3, mint a RAG, de lassabb és drágább
Fotó: National Cancer Institute / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

A Moonshot AI Kimi K3 modellje tavaly júliusban jelent meg 1 millió tokenes kontextusablakkal, ami felvetette a kérdést: kiválthatja-e a RAG (Retrieval Augmented Generation) módszert. Sarah Schürch egy kísérletben hasonlította össze a két megközelítést 12 kérdésen keresztül. (Towards Data Science)

A RAG egy válasz volt a korábbi, néhány ezer tokenes korlátokra. Ha több anyag állt rendelkezésre, mint amennyit a modell egyszerre fel tudott dolgozni, akkor releváns részeket kellett kiválogatni. A Kimi K3 és más, hasonlóan nagy ablakú modellek ezt a korlátot szüntetik meg. További előnyként a RAG-nál továbbra is a költséghatékonyságot, a sebességet, az alacsonyabb késleltetést és a forrásmegjelölés lehetőségét említik. Erről a Google DeepMind egy korábbi tanulmányában is írt.

A kísérlethez a szerző 127 068 tokennyi saját írását használta fel, ami a Kimi K3 ablakának 12%-a. A RAG-nál ezt 788 darab, 900 karakteres chunkra bontotta, majd az öt legrelevánsabbat küldte a modellnek. Ez körülbelül 1200 tokent jelentett kérésenként. A „long_context” beállításnál viszont az összes 32 cikket, összesen 127 346 tokent küldte el a modellnek, ami mintegy százszorosa a RAG-nak. A költségek csökkentése érdekében a kontextus mindig a prompt elején szerepelt, kihasználva a prefix caching előnyeit.

A tizenkét kérdést három nehézségi szintbe sorolták: egyetlen tény megtalálása, cikkek közötti összefüggések feltárása, illetve komplexebb, több lépést igénylő válaszok keresése. Az értékelés vakon történt: a kétféle módszerrel generált válaszokat véletlenszerűen „X” és „Y” jelöléssel látták el, hogy elkerüljék a torzítást. A szerző szerint a „belefér” és a „jobban működik” két különböző dolog, ami motiválta a kísérletet.

A teszt három problémát is feltárt: a RAG chunkolása nem mindig hozta a legrelevánsabb részeket, a modell néha megismételte magát, és a kontextusablakban lévő cikkek duplikációja is megzavarta az eredményeket. A „long_context” beállításnál a válaszok pontosabbak és teljesebbek voltak, de a RAG lényegesen gyorsabbnak bizonyult, és alacsonyabb késleltetéssel dolgozott.

A kísérlet eredményei szerint a Kimi K3 nagyobb kontextusablaka jobb válaszokat ad, különösen összetett kérdések esetén. A RAG azonban továbbra is előnyös lehet, ha a sebesség, az alacsonyabb költség és a forrásmegjelölés a prioritás. A szerző 127 068 tokennyi saját munkájából 12 kérdésre adott válaszokat vizsgálták.

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom