Következtető AI-modelleket mutatott be az IBM
Az IBM bemutatta a Granite 4.2 LLM-családot, amely 3B, 8B és 30B paraméteres változatokban érhető el. A modellek 15 billió tokenen tanultak, 512K tokenes kontextusablakkal és natív eszközhasználattal rendelkeznek.

Az IBM bemutatta a Granite 4.2-es modellcsaládot, amely sűrű, dekóderalapú LLM-ekből áll, és kifejezetten a következtetési képességekre fókuszál. A család három méretben érhető el: 3 milliárd (3B), 8 milliárd (8B) és 30 milliárd (30B) paraméterrel. A modellek alapvető előképzése mintegy 15 billió tokenen zajlott, egy ötfázisú stratégiát követve, amely kiterjesztette a kontextusablakot 512 ezer tokenre. Ezt követően láncolatkövetéses, következtetéses és agent-pályaadatokon finomhangolták, majd egy többlépcsős megerősítéses tanulási (RL) folyamaton estek át. (Hugging Face)
A többlépcsős RL-folyamat magában foglalja az agent-specifikus RL-t is, ahol a 8B és 30B modellek valós, homokozott környezetekben megtanulnak eszközöket használni. Minden modell rendelkezik egy „gondolkodó/nem gondolkodó” kapcsolóval, amely egy alacsony erőforrás-igényű üzemmódot kínál az egyszerű kérdések megválaszolására, valamint natív eszköz-hívási képességgel. Az IBM közlése szerint az összes Granite 4.2 modell az Apache 2.0 licenc alatt érhető el.
Modellarchitektúra
A Granite 4.2 modellek dekóderalapú, sűrű transzformer architektúrán alapulnak. Az architektúra kulcsfontosságú komponensei közé tartozik a Grouped Query Attention (GQA) 40 figyelmi fejjel és 8 KV fejjel, a Rotary Position Embedding (RoPE) θ = 10 000 000 értékkel, az MLP SwiGLU aktivációval, a RMSNorm normalizálás (ε = 1e-5) és a különálló bemeneti/kimeneti beágyazások bfloat16 precízióval.
A 3B modell 2560-as beágyazási mérettel, 40 réteggel és 64-es figyelmi fejmérettel rendelkezik, míg a 8B és 30B modellek 4096-os beágyazási mérettel, 32 figyelmi fejjel és 128-as figyelmi fejmérettel, illetve 64 (8B) és 64 (30B) réteggel, valamint 12800 (8B) és 32768 (30B) MLP rejtett mérettel bírnak. Mindhárom modell 131072 tokenes szekvenciahosszt támogat.
Előképzés és finomhangolás
Az IBM közlése szerint a Granite 4.2 modelleket mintegy 15 billió tokenen tanították, egy ötfázisú stratégiával. Az első két fázis az alapvető előképzésre, a harmadik és negyedik fázis progresszíven magasabb minőségű adatokra koncentrált, míg az ötödik fázis a hosszú kontextusú képzést vezette be, kiterjesztve a kontextusablakot 512 ezer tokenre. Az előképzés során az adatkeverék fokozatosan tolódott a széles webes adatoktól a kurált, magas minőségű források felé.
A felügyelt finomhangolás (SFT) során az alapmodellt megbízható utasításkövető, következtető és eszközhasználó asszisztenssé alakítják. Az SFT adatkeverék 31,6%-ban agent-specifikus és 68,4%-ban nem agent-specifikus adatokat tartalmaz, összesen mintegy 7,2 millió mintát, ami körülbelül 100 milliárd tokent jelent. Az agent-specifikus adatok széles körű területeket fednek le, beleértve a szoftvermérnökséget (69%), az eszközhívást (12,1%) és a terminálhasználatot (8,0%). Az IBM több szakaszos minőségellenőrzést alkalmaz, beleértve LLM-alapú értékelőket és deduplikációt.
Többlépcsős RL és agent képességek
A Granite 4.2 modellek többlépcsős megerősítéses tanulási (RL) folyamaton mennek keresztül. Az IBM közlése szerint a 8B és 30B modellek egy agent-specifikus RL blokkon is átesnek, amely megtanítja őket ügynökként működni: eszközöket hívni, kódot szerkeszteni és futtatni, terminált vezérelni és webes keresést végezni valós környezetekben. Minden modell támogatja a natív eszközhívást, és az OpenAI funkcióhívási formátumában bocsát ki eszközhívásokat egy OpenAI-kompatibilis végponton keresztül, ami megkönnyíti az integrációt ügynöki keretrendszerekbe.
A modellek rendelkeznek egy „gondolkodó/nem gondolkodó” kapcsolóval. Az alacsony erőforrás-igényű „nem gondolkodó” mód rövid gondolkodási költségvetést fordít az egyszerű kérdésekre, míg a „gondolkodó” mód mélyebb elemzést tesz lehetővé. Az IBM szerint az Apache 2.0 licenc alatt kiadott modellek SGLang támogatással is rendelkeznek, amelyhez recept található a SGLang cookbookban.