Az AI-modellek elbuknak a logikai teszteken, az emberi elme még mindig vezet
Az AI-modellek 2024 végén a New York Times Connections rejtvényeinek csupán 18%-át tudták megoldani, míg 2025 elejére ez az arány közel tökéletessé vált.

A modellek fejlődése ellenére a mai rendszerek még mindig elbuknak bizonyos feladatokon. A klasszikus fejtörők apró változtatásai is megzavarhatják őket, különösen a vizuális rejtvények jelentenek gyenge pontot. (MIT Technology Review AI)
Térbeli gondolkodás
Az emberi elme jelentős előnyt élvez a térbeli érvelésben. Az IQ-tesztekben gyakori mentális forgatási feladatok, ahol különböző szögekből kell felismerni ugyanazokat a tárgyakat, még a vizuális bemenetet elemezni képes mai nyelvi modelleknek is komoly kihívást jelentenek. Bár a világmodellek segíthetik az AI-t a fizikai környezet megértésében, a 3D-s objektumok manipulálása még mindig nehézséget okoz számukra.
Memória és alkalmazkodás
A nagy mennyiségű képzési adatnak köszönhetően az LLM-ek rendkívüli memóriával rendelkeznek, ami előnyt jelenthet trivia-játékokban. Ugyanakkor ez hátrány is lehet: ha egy feladvány túlságosan hasonlít a képzési adatokra, a modell a memorizált válaszokat adhatja, figyelmen kívül hagyva a kulcsfontosságú különbségeket.
Ezt támasztotta alá egy 2024-es, a Google és az Illinois Urbana-Champaign Egyetem kutatói által végzett tanulmány is, amely a „Lovagok és bolondok” (Knights and Knaves) típusú rejtvények variációit vizsgálta. A SimpleBench teszt is hasonló jelenséget mutat: az ember könnyen felismeri a trükköt, míg a legjobb modellek is elakadnak.
Absztrakt és vizuális érvelés
Az AI nemcsak 3D-s, hanem 2D-s vizuális problémákkal is hadilábon áll. Ez jelentős tényező az olyan benchmarkokon, mint az ARC-AGI, ahol példák alapján absztrakt, általános szabályokat kell felismerni. Bár a modellek fejlődtek az ARC-AGI tesztekben, bizonyos feladványok még mindig kifog rajtuk. Kutatások szerint a modellek gyakran nem általánosítható, bonyolult szabályokkal oldják meg a feladatokat, míg az emberek egyszerű vizuális koncepciókra támaszkodnak.
Intuíció
Az emberi intuíció is okozhat hibákat, de ezek eltérnek az AI-modell hibáitól. A pszichológusok olyan feladatsorokat fejlesztettek ki, ahol az emberek gyakran gyors, ösztönös válaszokat adnak, míg a modellek megfontoltabbak. Ezek a feladatok gyakran az intuitív matematikai hibákat vagy a figyelmetlen olvasásból fakadó téves következtetéseket aknázzák ki. A 60 nap alatt teljesen megtelő barlang példája is ilyen: a válasz 59 nap, nem 30, ahogy sokan ösztönösen gondolnák.