ÉlőUtoljára: 12 perceMa: 16
Modellek & LLMfrissítve: 09:16

Bemutatta új multimodális embeddelő modelljeit a Perplexity

A 9 milliárdos változat 92,4%-os pontossággal teljesített az MADQA teszten, míg a kisebb, 0,6 milliárdos modell a hatékony, perem-eszközökre szánt lekérdezéseket célozza meg.

Bemutatta új multimodális embeddelő modelljeit a Perplexity
Fotó: CHUTTERSNAP / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A pplx-embed-v2-late két különböző méretű multimodális embeddelő modellből áll, amelyek közül a 0.6 milliárdos (0.6B) változat a perem-eszközökre szánt, gyors lekérdezéseket célozza meg. A 9 milliárdos (9B) modell a legmagasabb minőséget szolgálja, és mindkét modell képes szövegek, képek és renderelt PDF-oldalak lekérdezésére egyetlen közös embedding-teret használva. (MarkTechPost)

Hardverigények és futtathatóság

A 0.6B-s modellt a Perplexity kifejezetten könnyű súlyú lekérdezési kódolóként tervezte, amely akár edge-eszközökön is futtatható. A modellek futtatásához CUDA GPU szükséges, valamint a `sentence-transformers >= 6.0.0` és a `transformers >= 5.4.0` könyvtárak. A súlyok becsült memóriahasználata 2 byte/paraméter, bár a letöltött checkpointok F32 formátumban érhetők el, ami megduplázza a méretüket.

MaxSim architektúra és teljesítmény

A hagyományos sűrű modellekkel ellentétben, amelyek egy dokumentumot egyetlen vektorba tömörítenek, a pplx-embed-v2-late minden tokenhez egy 128 dimenziós vektort rendel. A MaxSim nevű módszerrel minden lekérdezési token a legmegfelelőbb dokumentum tokent keresi meg, majd ezek maximális értékeit összegezi. Az oldalak képekként kerülnek kódolásra, így nincs szükség OCR-re.

A 9B-s modell érte el a legerősebb eredményt, 92.4%-ot az MADQA (agentic PDF QA) teljesítményteszten, ezzel megelőzve a Mixedbread retrievert (88.9%). A 0.6B-s modell 90.1%-ot teljesített ezen a teszten. A domain-specifikus szövegfeladatokon a 9B-s modell 81.3%-kal, a 0.6B-s pedig 78.0%-kal végzett, mindkettő felülmúlta a korábbi legjobb eredményeket.

A ViDoRe v3 képfelismerési teszten a 9B-s modell 65.2%-ot, a 0.6B-s pedig 62.3%-ot ért el. Bár a 0.6B-s modell nem érte el a Tencent EVIE modelljét, a 9B-s modell eredménye is elmarad a Gemini Embedding 2-től bizonyos képfelismerési feladatokon. Érdekesség, hogy a 0.6B-s modell 9B-s indexen futtatva 63.5%-ot ért el a ViDoRe v3 képfeladatán, ami jobb, mint a két 0.6B-s modell együttes teljesítménye.

A modellek MIT licenc alatt érhetők el, kereskedelmi használatra is engedélyezettek, és letölthetők a Hugging Face-ről. Bár jelenleg nincs publikusan elérhető hostolt API, a Perplexity tervezi annak bevezetését. A legfőbb korlátok közé tartozik a tokenenkénti vektor tárolása, ami növeli az index méretét a dokumentum hosszával, valamint az, hogy az eredmények önbevalláson alapulnak, és a technikai jelentés még nem publikus. A letölthető súlyok a Hugging Face platformon érhetők el.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom