ÉlőUtoljára: az iméntMa: 22
Kutatásfrissítve: 15:17

Az AI-modellek elbuknak a logikai teszteken, az emberi elme még mindig vezet

Az AI-modellek 2024 végén a New York Times Connections rejtvényeinek csupán 18%-át tudták megoldani, míg 2025 elejére ez az arány közel tökéletessé vált.

Az AI-modellek elbuknak a logikai teszteken, az emberi elme még mindig vezet
Fotó: National Cancer Institute / Unsplash
forrás: MIT Technology Review AI·AI Forradalom szerk.·
Megosztás

A modellek fejlődése ellenére a mai rendszerek még mindig elbuknak bizonyos feladatokon. A klasszikus fejtörők apró változtatásai is megzavarhatják őket, különösen a vizuális rejtvények jelentenek gyenge pontot. (MIT Technology Review AI)

Térbeli gondolkodás

Az emberi elme jelentős előnyt élvez a térbeli érvelésben. Az IQ-tesztekben gyakori mentális forgatási feladatok, ahol különböző szögekből kell felismerni ugyanazokat a tárgyakat, még a vizuális bemenetet elemezni képes mai nyelvi modelleknek is komoly kihívást jelentenek. Bár a világmodellek segíthetik az AI-t a fizikai környezet megértésében, a 3D-s objektumok manipulálása még mindig nehézséget okoz számukra.

Memória és alkalmazkodás

A nagy mennyiségű képzési adatnak köszönhetően az LLM-ek rendkívüli memóriával rendelkeznek, ami előnyt jelenthet trivia-játékokban. Ugyanakkor ez hátrány is lehet: ha egy feladvány túlságosan hasonlít a képzési adatokra, a modell a memorizált válaszokat adhatja, figyelmen kívül hagyva a kulcsfontosságú különbségeket.

Ezt támasztotta alá egy 2024-es, a Google és az Illinois Urbana-Champaign Egyetem kutatói által végzett tanulmány is, amely a „Lovagok és bolondok” (Knights and Knaves) típusú rejtvények variációit vizsgálta. A SimpleBench teszt is hasonló jelenséget mutat: az ember könnyen felismeri a trükköt, míg a legjobb modellek is elakadnak.

Absztrakt és vizuális érvelés

Az AI nemcsak 3D-s, hanem 2D-s vizuális problémákkal is hadilábon áll. Ez jelentős tényező az olyan benchmarkokon, mint az ARC-AGI, ahol példák alapján absztrakt, általános szabályokat kell felismerni. Bár a modellek fejlődtek az ARC-AGI tesztekben, bizonyos feladványok még mindig kifog rajtuk. Kutatások szerint a modellek gyakran nem általánosítható, bonyolult szabályokkal oldják meg a feladatokat, míg az emberek egyszerű vizuális koncepciókra támaszkodnak.

Intuíció

Az emberi intuíció is okozhat hibákat, de ezek eltérnek az AI-modell hibáitól. A pszichológusok olyan feladatsorokat fejlesztettek ki, ahol az emberek gyakran gyors, ösztönös válaszokat adnak, míg a modellek megfontoltabbak. Ezek a feladatok gyakran az intuitív matematikai hibákat vagy a figyelmetlen olvasásból fakadó téves következtetéseket aknázzák ki. A 60 nap alatt teljesen megtelő barlang példája is ilyen: a válasz 59 nap, nem 30, ahogy sokan ösztönösen gondolnák.

Forrás

Feldolgozott sajtóforrás·MIT Technology Review AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom