ÉlőUtoljára: 2 perceMa: 26
Modellek & LLMfrissítve: 20:16

Az Alibaba modellje romlott a független teszten

Az Alibaba Qwen 3.8-Max és a Claude Opus 5 modelljei rávilágítanak, hogy a nyers teljesítményteszt pontszámok nem tükrözik a valós költségeket, mivel a futási idő dominál.

Az Alibaba modellje romlott a független teszten
Fotó: Growtika / Unsplash
forrás: VentureBeat·AI Forradalom szerk.·
Megosztás

Az Alibaba Qwen 3.8-Max modelljét a héten mutatták be, és a cég a bevezetéskor azt állította, hogy az a Claude Fable 5-öt követi a rangsorban. Egy független teszt azonban szinte az ellenkezőjét mutatta: a Qwen 3.8-Max közepes vagy utolsó helyen végzett a tesztben — írja a VentureBeat.

A két eredmény valós és védhető. A különbség a token- és időkeretekben rejlik, ami azért számít, mert ezek az adatok nincsenek általában a címlapokon. Az Alibaba megadott kódolási eredményeihez ötórás, papír alapú teszteknél pedig akár 12 órás időkorlát tartozott. A független VulcanBench tesztelő 45-60 percet engedélyezett futásonként. Az Alibaba ötszörös, akár 12-szeres időkerete magyarázza az eredmények közötti óriási különbséget.

A költség per sikeres feladat a kulcs

Az első lépés a modellek kiválasztásakor a sikeres feladatonkénti költség meghatározása: a teljes költés, beleértve a sikertelen próbálkozásokat is, elosztva a sikeresen teljesített feladatokkal. Másodszor, az idő- vagy tokent budgetet egyértelmű elfogadási kritériumként kell kezelni, nem rejtett részletként.

A tokenenkénti ár már nem jóslója a számlának. A Qwen 3.8-Max nem olcsó modell: egymillió bemeneti tokenre 2 dollárt, kimenetre pedig 6 dollárt kér. Összehasonlításképp, a DeepSeek-V4-Flash-0731 0,14, illetve 0,28 dollár, a Kimi K3 pedig 3, illetve 15 dollár. Ezek az árak kevésbé relevánsak, mint korábban, különösen a Qwenhez hasonló érvelő modellek esetében, mert az eredmény eléréséhez gondolkodási tokenekre van szükség. Egy modell, amely tokenkeretének nagy részét az érvelésre fordítja, üres eredménnyel zárhat, ami teljes kudarcnak számít, de a teljes futás költségét jelenti.

A hibázási ráta konfigurációs beállítás

A hibás választ adó futás és a budget kimerülése két különböző esemény, eltérő javításokkal. Szinte egyetlen tesztelő sem különbözteti meg őket, és kevés leaderboard közli a megoszlást. A Long-Horizon-Terminal-Bench 2026. júliusi jelentése szerint a 17 modell 46 feladatából 79%-ban időtúllépés történt. Bár az időtúllépés nem jelenti azt, hogy több idővel sikerült volna a feladat, a teljesítménytesztek implicit módon az időhatékonyságot mérik.

A VulcanBench jelentése szerint a Claude Opus 5 legalacsonyabb erőfeszítési beállítása volt a legjobb, 23 feladatból 20-at oldott meg, szemben a magasabb erőfeszítésű 18-cal. A magasabb erőfeszítés kevesebb hibás választ eredményezett, de időtúllépés miatt nullát ért. Ez azt jelenti, hogy a standard design, amely olcsóbb próbálkozás sikertelensége esetén drágább, jobb modellel próbálkozik, téves lehet.

Több csoport is önállóan jutott el a sikeres feladatonkénti költség méréséhez. A VulcanBench és a Long-Horizon-Terminal-Bench is közzéteszi a feladatonkénti költséget. A TestEvo-Bench költségplafon alatt futtatja az ügynököket, és a Claude Code tesztgenerálási pontszáma 71%-ról 44%-ra esik szigorúbb plafon mellett. A HubSpot áprilisban 50 centre csökkentette a konverziónkénti költséget, a Zendesk pedig feloldásonként számláz.

A hibák okát minden futásnál kötelező mezőként kell rögzíteni, megkülönböztetve a budget kimerülését, a validátor hibáját és a tesztelői hibát. A sikeres feladatonkénti számítási költséget az erőfeszítési szint szerint kell mérni, nem csak modellenként. A Qwen 3.8-Max alapértelmezetten a legmagasabb érvelési beállításon fut, ami a legrosszabbul teljesített az eddigi tesztekben.

Forrás

Feldolgozott sajtóforrás·VentureBeat

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom