ÉlőUtoljára: 10 perceMa: 5
Kutatásfrissítve: 20:15

AI-modellek egy hétig tartó programozási feladatokat oldanak meg, emberi erőfeszítés töredékéért

Az Epoch és METR által kiadott MirrorCode teljesítményteszt szerint az AI-modellek, mint az Opus 4.7, már 14 óra alatt képesek komplex szoftvereket újraalkotni, ami embernek 2-17 hetet venne igénybe.

AI-modellek egy hétig tartó programozási feladatokat oldanak meg, emberi erőfeszítés töredékéért
Fotó: Patrick Martin / Unsplash
forrás: Import AI·AI Forradalom szerk.·
Megosztás

Az Epoch és METR új teljesítménytesztet, a MirrorCode-ot adott ki, amely azt méri, mennyire képesek az AI-rendszerek hosszú távú programozási feladatokat elvégezni. Az első eredmények lenyűgözőek: az Opus 4.7 mindössze 14 óra alatt, 251 dolláros költséggel oldott meg egy olyan feladatot, amely egy embernek 2-17 hetet venne igénybe. A tavalyi év vezető modelljei ezen a teszten nagyjából 30%-os eredményt értek volna el, és csak egyszerűbb programokat tudtak volna kezelni. (Import AI)

A MirrorCode-ban az AI-rendszereknek egy szoftverprogramot kell teljes egészében újraalkotniuk, kizárólag parancssori (CLI) hozzáféréssel. Ez azt jelenti, hogy az eredeti forráskód vagy az internet ismerete nélkül kell megtervezniük a teljes program struktúráját. A tesztelt programok között szerepel az Apple által fejlesztett, 61 ezer soros pkl konfigurációs nyelv, a 16 ezer soros gotree genomikai adatokkal dolgozó program, valamint a 87 ezer soros qsv_select CSV-adatok kezelésére szolgáló eszköz.

Kapcsolódó: a reward hacking jelensége

Az eredmények alapján a MirrorCode egy nehéz, de kezelhető teljesítményteszt. A 25 célprogram közül 17 esetében legalább egy tökéletes pontszámú futást regisztráltak, további négy pedig 99% feletti pontszámot ért el. Az olyan nagy programokat is sikeresen újraalkották, mint a gotree és a pkl. Azonban a feladat nem volt teljes mértékben triviális: 8 program esetében egyáltalán nem sikerült elérni a 100%-os, 4 program esetében pedig a 99%-os küszöböt. Az AI-k különösen a ruff Python linterrel, a giac_subset matematikai csomaggal és a mailauth e-mail hitelesítési könyvtárral gyűlt meg a bajuk.

Kapcsolódó: az LLM-ek nukleáris kockázata

Az AI-k képesek önállóan tájékozódni

A teljesítményteszt eredményei arra utalnak, hogy az AI-rendszerek képesek önállóan tájékozódni a környezetükben. A szoftverekhez való fekete dobozos (input-output) hozzáféréssel képesek a programokat a nulláról újraalkotni. Ez azt sugallja, hogy az intelligens AI-ügynökök képesek lehetnek olyan módon tanulni a világból, hogy az interfészeiket otthonos képességekké alakítsák, és pusztán a fekete dobozos hozzáférés révén saját ipari civilizációjukat építhetik fel.

Kapcsolódó: az AI politikai szuperintelligencia

Robotics: Az Anthropic modellje 20-szor gyorsabban végez robotfeladatokat

Az Anthropic demonstrálta, hogyan javíthatják a nagyméretű, általános célú modellek a robotok képességeit. Az Opus modellvonal skálázásával drasztikusan növelték a robotok teljesítményét. Míg 2025 augusztusában az Opus 4.1 modell még nem tudta hatékonyan segíteni a robotfeladatokat, addig 2026 májusában az Opus 4.7 autonóm módon, 9 perc 35 másodperc alatt teljesített szinte minden feladatot, ami korábban emberi erővel 181 percet vett igénybe. A cég szerint további fejlesztésekkel a jelenlegi Claude-generációk is képesek lehetnek erre.

Kapcsolódó: az AI és a lustaság

A kutatás azt mutatja, hogy a robotok elterjedését korlátozó törékenység és általánosítási hiány leküzdhető a nagyméretű modellek képességeinek fejlesztésével. Ezek az előrelépések nem specifikus robotikai fejlesztések eredményei, hanem az általános LLM-fejlesztések mellékhatásai. A robotikai startup, a Sunday is hasonló megközelítést alkalmaz: nagyobb alapmodellel és kis mennyiségű, jó minőségű adatokkal finomhangolva érik el a 99,1%-os sikerrátát ruhahajtogatási feladatokban.

Kapcsolódó: a modellek dinamikus viselkedése

Forrás

Feldolgozott sajtóforrás·Import AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom