ÉlőUtoljára: 2 perceMa: 18
Kutatásfrissítve: 18:16

Megmérte a legjobb AI-modellek látását a Moonshot AI, alig 60% a pontosság

A Moonshot AI PerceptionBench tesztje szerint a legfejlettebb AI-modellek sem érik el a 60%-os pontosságot a vizuális percepciós feladatokban, a GPT-5.6 Sol vezeti a mezőnyt 59,7%-kal.

Megmérte a legjobb AI-modellek látását a Moonshot AI, alig 60% a pontosság
Fotó: Mezidi Zineb / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A Moonshot AI bemutatta a PerceptionBench nevű új teljesítménytesztet, amely a multimodális AI-modellek vizuális percepciós képességeit méri, függetlenül a logikai érveléstől és a külső tudástól. Az új teszt valós hibákon alapul, és kimutatja, hogy a jelenlegi csúcskategóriás modellek, köztük a GPT-5.6 Sol, a Kimi K3 és a Claude Fable 5 is jelentős gyengeségeket mutatnak ezen a területen. (The Decoder)

A kutatók szerint sok, korábban logikai hibának vélt problémát valójában a vizuális percepció gyengesége okozza. A PerceptionBench tíz különálló vizuális alapképességre bontja a feladatokat, szemben a hagyományos módszerekkel, amelyek gyakran egyetlen feladatban keverik a percepciót, a tudást és az érvelést. Az új tesztet a valós modellhibákból építették fel, nem elméleti definíciókból.

A tesztelésben 16 különböző, élvonalbeli modellt vizsgáltak. A legmagasabb, 59,7%-os pontszámot a GPT-5.6 Sol érte el, de a 60%-os határt egyetlen modell sem lépte át. A Kimi K3 58,5%-kal, a Claude Fable 5 57,2%-kal, a Gemini 3.1 Pro pedig 56,2%-kal követi. Az olyan nyílt forráskódú modellek, mint a Qwen3.5-397B-A17B (47,5%) és a GLM-4.6V (32,5%), jóval lemaradva követik a listát.

A kategóriaszintű eredmények még árulkodóbbak: az átlagos „hallucináció” a leggyengébb készség az összes modellnél. A GPT-5.6 Sol ezen a teszten mindössze 26,9%-ot ért el, annak ellenére, hogy az összesített rangsorban első helyezett. Ez a teszt arra szolgál, hogy megvizsgálja, a modellek kitalálnak-e létező tárgyakat, amikor a helyes válasz egyszerűen nulla lenne.

A kutatók szerint a multimodális modellek sok hibája, amelyet eddig „logikai hibaként” könyveltek el, valójában a percepciós szinten történik. Amikor egy modell elront egy több lépésből álló feladatot, gyakran már az első lépés, a kép helyes olvasása hibásan megy végbe. A PerceptionBench ezeket a kérdéseket tiszta percepciós al-kérdésekre bontja, lehetővé téve a konkrét vizuális képesség meghibásodásának pontos azonosítását.

A teszteléshez 3000 feladatot publikáltak, amelyek 60%-a modellek által elkövetett hibákból származott, 40%-át pedig kibővített képekkel dolgozták át. A feladatok felszínesen triviálisnak tűnnek, mint például egy szimbólum helyének meghatározása egy óralapon, virágok számlálása egy piros dobozban, vagy annak eldöntése, melyik ceruzatartó tartalmaz szürke-rózsaszín kombinációt. A kutatócsapat korábban már kiadta a WorldVQA teljesítménytesztet is, amely az objektumfelismerést választja el az érveléstől, és ott is hasonló, alacsony eredményeket tapasztaltak.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom