ÉlőUtoljára: 1 órájaMa: 17
Modellek & LLMfrissítve: 19:16

Bizonyította a GPT-6 Astra, hogy majdnem hibátlanul oldja meg a legnehezebb matekfeladatokat

Az OpenAI GPT-6 Astra modellje 98%-os pontosságot ért el a FrontierMath Tier 4 teszten, míg az Anthropic Claude Fable 5.1 körülbelül 25%-os költségcsökkentést ígér a gyorsítótár olvasásának optimalizálásával.

Bizonyította a GPT-6 Astra, hogy majdnem hibátlanul oldja meg a legnehezebb matekfeladatokat
Fotó: Growtika / Unsplash
forrás: TheSequence·AI Forradalom szerk.·
Megosztás

Az AI-iparágban új mércét állítottak fel a nagy laborok: az OpenAI, az Anthropic, a Meta és a Google is új modelleket jelentett be a héten. Az OpenAI frissíti a Codex rendszert is a számítógéphasználat felgyorsítása érdekében, ami aláhúzza, hogy a teljesítmény nagymértékben függ a modell és a környező infrastruktúra kombinációjától. (TheSequence)

Matematikai precizitás és szoftverfejlesztés

Az OpenAI GPT-6 Astra képességei kiterjednek a számítógéphasználatra, szoftverfejlesztésre és tudományos munkára. A modell célja, hogy kevesebb felügyelettel navigáljon szoftverekben, bonyolult munkafolyamatokat végezzen el, és használható munkát produkáljon.

Költséghatékony ügynökök és gyors iterációk

Az Anthropic Claude Fable 5.1 és Mythos 5.1 modellek a kódolásban, tudásmunkában és tudományos kutatásban hoznak előrelépést. Érdekesség, hogy mindkettő ugyanazt az alapmodellt használja, de eltérő biztonsági és hozzáférési beállításokkal rendelkeznek. A Fable általánosan elérhető, míg a Mythos korlátozott hozzáférésű programokban vesz részt. Az Anthropic becslései szerint az olcsóbb gyorsítótár-olvasások körülbelül 25%-kal csökkentik a tipikus munkaterhelések költségeit, ami különösen az ismétlődő, ügynökszerű munkavégzésnél lehet jelentős.

A Meta Muse Spark 1.3 modellje az ügynökök hasznosságát biztosító, kevésbé látványos mechanizmusokra összpontosít: a hosszú feladatok követelményeinek fenntartása, ellentmondásos információk kezelése, tervek felülvizsgálata és segítséghívás. A Meta szerint több ügynöki keretrendszeren végeztek képzést a környezetek közötti általánosítás javítása érdekében. Kiemelik a beszélgetésen belüli különböző feladatok nyomon követését, még akkor is, ha a felhasználók megszakítják vagy átirányítják a folyamatban lévő munkát.

A Google Gemini 3.8 Flash modellje a hét legjobb példája a tempóra: ez a harmadik Flash kiadás hat hét alatt. A Google erősebb kódolási és érvelési képességeket jelent, miközben megtartja a 3.7 Flash sebességét és bevezető árát. Ezzel párhuzamosan a Flash Cyber a sebezhetőségek felderítésére és javítására összpontosít, korlátozott hozzáféréssel. A Google a megosztott alap fejlődését részben a kibervédelem területén végzett képzésnek tulajdonítja, amely a komplex szoftverekkel kapcsolatos érvelés szempontjából igényes környezet.

Az építők számára az iram lehetőséget és bevezetési költséget is teremt: minden frissítés új értékeléseket, költség-összehasonlításokat és regressziós ellenőrzéseket igényel. A sikert a befejezett munkafolyamatok és a kevesebb emberi beavatkozás méri. A Google Gemini 3.8 Flash modellje a hét legjobb példája a tempóra: ez a harmadik Flash kiadás hat hét alatt.

Forrás

Feldolgozott sajtóforrás·TheSequence

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom