ÉlőUtoljára: az iméntMa: 4
Modellek & LLMfrissítve: 02:15

Bemutatta a Gemini 4 Argont a Google, de nem vezet egyértelműen

A Google bemutatta a Gemini 4 Argon új csúcsmodelljét, amely zárkózik az OpenAI és az Anthropic riválisaihoz, és több teljesítményteszten is legyőzi őket, de nem szerez egyértelmű előnyt.

Bemutatta a Gemini 4 Argont a Google, de nem vezet egyértelműen
Fotó: Mitchell Luo / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az Argon a Google első csúcsmodellje több mint hét hónap után, a Gemini 3.1 Pro után. Ezzel a Google visszakerült a három legjobb AI-labor közé, bár az Anthropic valószínűleg továbbra is tartja a vezető pozíciót. A nehézkes fejlesztési időszak után, amely során a már bejelentett Gemini 3.5 csúcsmodellt teljesen kihagyták, a Google ismét versenyben van. (The Decoder)

Fokozatos bevezetés és árazás

A legtöbb felhasználónak várnia kell: az Argon kezdetben a „megbízható kibervédők” egy csoportjához kerül a Fairwind program keretében. Ők és a Google belső csapatai a modell kiberbiztonsági védelmek nélkül kapják meg. A Google a fokozatos bevezetést azzal indokolja, hogy az ilyen szintű AI-képességek „fokozatos megközelítést” igényelnek.

A cég részt vesz az Egyesült Államok kormányának önkéntes programjában is, amely hozzáférést biztosít az új modellekhez a nyilvános megjelenés előtt. A korai tesztelők visszajelzései beépülnek a modell biztonsági mechanizmusaiba. Csak ezt követően tervezi a Google az Argont elérhetővé tenni fejlesztők, üzleti ügyfelek és fogyasztók számára, először a fizetős API-ügyfelek és a Google AI Ultra előfizetők számára. A cég nem adott meg dátumot, csak annyit közölt, hogy „amint lehetséges”.

Az árazás már rögzített, legalábbis bevezető szinten: 2 dollár egymillió bemeneti tokenenként és 10 dollár egymillió kimeneti tokenenként. A gyorsítótárazott bemeneti tokenek 95 százalékkal olcsóbbak, ami körülbelül 10 centet jelent egymilliónként. A Gemini 3.8 Flash 90 százalékos gyorsítótár-kedvezményt kapott. Ez a Google-t a nyers tokenár tekintetében jóval más csúcsmodellek alá helyezi, bár a tokenfogyasztásban nem (lásd alább). A rendszeres ár később 4 dollárra (bemeneti) és 20 dollárra (kimeneti) emelkedik.

1 milliós tokenlimit és új funkciók

A Google egy egymilliós kimeneti tokentámogatást is bevezetett, ami iparági elsőként van jelen. Az ötlet az, hogy ha a modell több százezer tokent képes generálni egyetlen futtatás során, akkor alaposabban átgondolhatja a nehéz problémákat, és egyetlen menetben megoldhatja azokat. Ennek támogatására a Google egy új „Long Decode Continuation” funkciót ad a Gemini API-hoz. Ez szünetelteti a hosszú válaszokat, és utólagos kérésekkel folytatja azokat, hogy az érvelés ne érje el az időkorlátot. A bemeneti kontextusablak egymillió tokenen marad.

Az Argon szöveget, képeket, videót és hangot fogad bemenetként, de csak szöveget ad ki. A Google belső benchmarkjai szerint az Argon a legtöbb tesztben vezet, néha jelentős előnnyel. Az Argon vezeti a Vals Indexet is. A Vals AI szerint 68,9 százalékkal első helyezést ér el, így ez az első Gemini modell, amely vezeti az indexet. Az Argon a 22 tesztelt teljesítményteszt közül 20-ban végez az első ötben, különösen erős a pénzügy, jog, kódolás és biztonság területén.

Teljesítményteszt eredmények és korlátok

A független tesztek szerint az Argon azonos szinten teljesít a GPT-6 Astra-val, de több tokent használ fel. Az Artificial Analysis korai értékelése szerint a Gemini 4 Argon „High” szinten 53 pontot ér el a mesterséges intelligencia indexen. Ez megegyezik az OpenAI GPT-6 Astra (max) és a Claude Fable 5.1 pontszámával, és egy ponttal előzi meg a GPT-6.1 Sol (max) modellt.

Az Anthropic modelljei továbbra is vezetnek: a Claude Opus 5.5 58 ponttal, a Claude Sonnet 5.5 pedig 56 ponttal áll. A Google korábbi csúcsmodelljéhez, a Gemini 3.1 Pro Preview-hoz képest az Argon 23 pontot ugrott. Az „High” szint általában a Gemini modellek legmagasabb érvelési szintje, bár néha külön „Deep Think” mód is támogatott.

Az árelőny az alacsonyabb tokenárakból származik, nem a hatékonyságból. Az Argon átlagosan 62 000 kimeneti tokent használ fel feladatonként, míg a GPT-6 Astra-nak csak 27 000-re van szüksége. Az eredmények azt mutatják, hogy az Argon „High” szinten felzárkózik a legfelső kategóriához.

Az ügynöki feladatokon is jelentős előrelépést tett, ami eddig a Gemini modellek gyenge pontja volt. Az AutomationBench-AA teszten 77,5 százalékkal az első helyen végzett, hat ponttal megelőzve a Claude Sonnet 5.5 (max) modellt. A Terminal Bench 4-en 57 százalékot ért el, ami 53 pontos ugrás a Gemini 3.1 Pro Preview-hoz képest.

Ez még mindig elmarad a Claude Sonnet 5.5 (64 százalék), a Claude Opus 5.5 (60 százalék) és a GPT-6 Astra (59 százalék) mögött. Az Artificial Analysis kiemeli az Argon alacsony hallucinációs rátáját is: 15 százalék, míg a GPT-6 Astra (max) 51 százalékot ér el. Az Argon pontossága azonban csak 50 százalék, ami öt ponttal marad el a Gemini 3.1 Pro Preview-tól és 13 ponttal a GPT-6 Astra (max, 63 százalék) mögött. Az összetett pontszámban az Argon 42 ponttal, nagyjából megegyezik a GPT-6 Astra (43) és a GPT-6.1 Sol (42) eredményével.

Az Arena.ai platformon, ahol emberi értékelők hasonlítják össze a modellek kimeneteit, az Argon jól teljesít. A Text Arena-ban a Gemini 4 Argon (High) 1525 ponttal az első helyen áll, 20 ponttal megelőzve a második helyezett Claude Opus 4.6 (High) modellt. Ez erős versenytárssá teszi az írási feladatokhoz, különösen egy hosszú versenyképes írói modellek nélküli időszak után.

A Google korábbi modellje, a Gemini 3.8 Flash (High) a tizenegyedik helyen állt. Az Arena szerint az Argon vezet kódolásban, nehéz promptoknál, utasításkövetésben, hosszabb lekérdezésekben és kreatív írásban. Az összes értékelt professzionális területen is első helyezést ér el. A Text Arena-ban a Gemini 4 Argon (High) 1525 pontot ért el.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom