Megmérte a legjobb AI-modellek látását a Moonshot AI, alig 60% a pontosság
A Moonshot AI PerceptionBench tesztje szerint a legfejlettebb AI-modellek sem érik el a 60%-os pontosságot a vizuális percepciós feladatokban, a GPT-5.6 Sol vezeti a mezőnyt 59,7%-kal.

A Moonshot AI bemutatta a PerceptionBench nevű új teljesítménytesztet, amely a multimodális AI-modellek vizuális percepciós képességeit méri, függetlenül a logikai érveléstől és a külső tudástól. Az új teszt valós hibákon alapul, és kimutatja, hogy a jelenlegi csúcskategóriás modellek, köztük a GPT-5.6 Sol, a Kimi K3 és a Claude Fable 5 is jelentős gyengeségeket mutatnak ezen a területen. (The Decoder)
A kutatók szerint sok, korábban logikai hibának vélt problémát valójában a vizuális percepció gyengesége okozza. A PerceptionBench tíz különálló vizuális alapképességre bontja a feladatokat, szemben a hagyományos módszerekkel, amelyek gyakran egyetlen feladatban keverik a percepciót, a tudást és az érvelést. Az új tesztet a valós modellhibákból építették fel, nem elméleti definíciókból.
A tesztelésben 16 különböző, élvonalbeli modellt vizsgáltak. A legmagasabb, 59,7%-os pontszámot a GPT-5.6 Sol érte el, de a 60%-os határt egyetlen modell sem lépte át. A Kimi K3 58,5%-kal, a Claude Fable 5 57,2%-kal, a Gemini 3.1 Pro pedig 56,2%-kal követi. Az olyan nyílt forráskódú modellek, mint a Qwen3.5-397B-A17B (47,5%) és a GLM-4.6V (32,5%), jóval lemaradva követik a listát.
A kategóriaszintű eredmények még árulkodóbbak: az átlagos „hallucináció” a leggyengébb készség az összes modellnél. A GPT-5.6 Sol ezen a teszten mindössze 26,9%-ot ért el, annak ellenére, hogy az összesített rangsorban első helyezett. Ez a teszt arra szolgál, hogy megvizsgálja, a modellek kitalálnak-e létező tárgyakat, amikor a helyes válasz egyszerűen nulla lenne.
A kutatók szerint a multimodális modellek sok hibája, amelyet eddig „logikai hibaként” könyveltek el, valójában a percepciós szinten történik. Amikor egy modell elront egy több lépésből álló feladatot, gyakran már az első lépés, a kép helyes olvasása hibásan megy végbe. A PerceptionBench ezeket a kérdéseket tiszta percepciós al-kérdésekre bontja, lehetővé téve a konkrét vizuális képesség meghibásodásának pontos azonosítását.
A teszteléshez 3000 feladatot publikáltak, amelyek 60%-a modellek által elkövetett hibákból származott, 40%-át pedig kibővített képekkel dolgozták át. A feladatok felszínesen triviálisnak tűnnek, mint például egy szimbólum helyének meghatározása egy óralapon, virágok számlálása egy piros dobozban, vagy annak eldöntése, melyik ceruzatartó tartalmaz szürke-rózsaszín kombinációt. A kutatócsapat korábban már kiadta a WorldVQA teljesítménytesztet is, amely az objektumfelismerést választja el az érveléstől, és ott is hasonló, alacsony eredményeket tapasztaltak.