Desert Ant Labs 18 új, helyi AI-modellt dob piacra
Az eszközök 100 ezer havi aktív felhasználóig ingyenesen használhatók, miközben a tokenköltségek és a válaszidő-késleltetés teljesen elhagyottá válik.

A Desert Ant Labs, egy európai AI-labor, új, helyi futtatású (on-device) intelligenciamodelleket jelentett be. A cég célja, hogy minden termékinterakcióba beépíthetővé tegye az AI-t, tokenköltség és sebességkorlátok nélkül. A modellek kis méretűek, speciálisan audio, vizuális és szöveges feladatokra optimalizáltak, és válaszaik ezredmásodpercek alatt érkeznek. (AI for Newsroom)
Modellportfólió és integráció
A vállalat 18 modellje érhető el, ebből 12 stabil és 6 béta verzió. Ezeket egyetlen SDK-n keresztül lehet integrálni Swift, Kotlin és JavaScript nyelveken. A modellek célja, hogy az adott feladat elvégzésének leggyorsabb módját kínálják helyi futtatással. Példaként említik a Voz modellt, amely 10 percnyi hanganyagot képes két másodperc alatt átírni egy iPhone-on – ez 4,7-szer gyorsabb a Whispernél, és minden szóhoz megadja a kezdő és záró időpontot.
Teljesítmény és adatvédelem
A Clear modell mindössze 9 MB méretű, és egy ötnapos laptopfelvételt képes egy másodperc alatt stúdióminőségű hangzássá alakítani. A Redact modell valós időben képes nevek, címek és bankkártyaszámok maszkolására 27 nyelven, így azok nem jutnak el a szerverekre. A Tongue modell 2 MB-os méretével képes 84 nyelvet azonosítani mindössze három szó alapján, 0,933-as pontossággal, szemben egy 293 MB-os detektor 0,887-es pontosságával.
A Desert Ant Labs modelljei ingyenesen használhatók akár 100 000 havi aktív eszközig. A cég hangsúlyozza, hogy az adatok soha nem hagyják el az ügyfél eszközét, és a funkciók nem függenek mások felhőszolgáltatásaitól. A Redact modell a személyes adatok 88,8%-át képes kiszűrni, ami megközelíti a 2,3 GB-os GLiNER-PII és a 3 GB-os OpenAI szűrő teljesítményét, miközben a Redact mindössze 12 MB.
A vállalat szerint a Clips modell, amely 284 MB méretű, 10-szer gyorsabban és 470-szer kevesebb energiát használva képes videoklipeket készíteni, mint a Claude Sonnet, miközben minősége hasonló. A Clear modell 302-szeres valós idejű sebességet ér el telefonon, míg a Voz modell 319-szeres sebességet az Apple SpeechAnalyzerhez képest, és 78-szor gyorsabb a Whisper large-v3-turbo verziójánál.
A cég a modelleket Európában fejleszti, ahol az „on-device” megközelítés a szuverenitás alapja. Az ötéves telefonokon is futó modellek a felhőszolgáltatások alternatívájaként jelennek meg, csökkentve a költségeket és növelve az adatvédelmet. A Desert Ant Labs a Voz modell 78-szoros sebőszerelő előnyével zárja a jelenlegi generációs összehasonlítást a Whisper large-v3-turbo verzióval szemben.