A Claude Sonnet 5.5 felülmúlja a GPT-6 Astra-t a Terminal-Bench 4.0 teszten
Az Anthropic új Claude Sonnet 5.5 modellje 70,6%-ot ért el a Terminal-Bench 4.0 teszten, ami 12,7 pontos előny a GPT-6 Astra 57,9%-os eredményével szemben. A modell emellett 30%-kal gyorsabb és akár 30%-kal olcsóbb is lehet feladatonként elődjénél.

Az Anthropic szeptember 28-án dobta piacra a Claude Sonnet 5.5 modellt, amely elődjéhez, a Sonnet 5-höz hasonlóan 2 dollár per millió bemeneti token és 10 dollár per millió kimeneti token áron érhető el. A cég közlése szerint az új modell 30%-kal gyorsabb és akár 30%-kal olcsóbb is lehet feladatonként, mint a Sonnet 5. (The Neuron)
A Terminal-Bench 4.0 teljesítményteszten a Sonnet 5.5 meglepetésre 70,6%-ot ért el, míg az OpenAI GPT-6 Astra modellje 57,9%-ot teljesített. Ez azt jelenti, hogy az Anthropic által alapvetően olcsóbb kategóriába sorolt modell majdnem 13 ponttal múlta felül az OpenAI zászlóshajó modelljét.
Képességek fragmentálódása
A rendszerkártya mélyebb tanulmányozása azonban árnyalja a képet. A Sonnet 5.5 nem minden területen múlja felül az Astrát, amely bizonyos feladatokban továbbra is jelentős előnyökkel rendelkezik. Az eredmények arra utalnak, hogy a modellek képességei kezdenek szegmentálódni a feladat típusa szerint.
Új mérce a teljesítményértékelésben
Ez a fragmentáció hasznosabb lehet a „melyik AI a legokosabb?” típusú rangsoroknál. A Sonnet 5.5 különösen az ügynöki kódolási és professzionális munkát igénylő feladatokban jeleskedik, miközben tokenenként az Astra árának csak az ötödét kéri. Az Anthropic új modellje így új mérceként szolgálhat a költséghatékony, mégis nagy teljesítményű AI-megoldások értékelésében.