Az OpenAI GPT-5/6 tokenizálóját használja mostantól a ttok
A ttok 1.0 alapértelmezett tokenizálója a GPT-4 helyett a GPT-5/6 családra váltott. Az OpenAI nem erősítette meg, hogy a GPT-6 ugyanazt a tokenizálót használja, mint a GPT-5.

Simon Willison október 9-én adta ki a ttok 1.0 verzióját, amely a szövegek tokenek szerinti számlálását és csonkolását végzi. A korábbi, 0.4-es verzió hibásan a GPT-4 tokenizálóját használta alapértelmezetten, holott a fejlesztő szerint egyértelműen a GPT-5/GPT-6 tokenizálójának kellett volna. (Simon Willison)
Az OpenAI álláspontja és a kísérleti eredmények
Bár az OpenAI hivatalosan nem erősítette meg, hogy a GPT-6 ugyanazt a tokenizálót használja, mint a GPT-5 család, egy William Liu által végzett kísérlet erre utal. Liu kísérlete szerint mind a hét GPT modell (5.5, 5.6 Sol/Terra/Luna, 6 Astra/Sol/Luna) 44 794 tokent jelent, és mindegyik megegyezik a 31 tesztesetben.
Hatás a fejlesztői környezetekre
A GPT-6 nem okoz változást az elemzett corpus bemeneti számlálásában. A ttok 1.0 kiadása a fejlesztők számára is fontos, mivel a tokenizáló váltás befolyásolhatja az LLM-alkalmazások működését és a szövegek kezelését. A frissítés után a ttok 1.0 alapértelmezett beállítása a GPT-5/6 tokenizáló.