Tízszer gyorsabb lett a Hugging Face tokenizálója, újragondolták a kód alapjait
A Hugging Face bemutatta a tokenizers v1-et, amely tízszer gyorsabb elődjénél, és megszünteti a GPU-k várakozását az AI-folyamatokban.

A fejlesztők az IBM, az NVIDIA és az ExecuTorch csapatainak közreműködésével bővítették a kódbázist, hogy az újragondolt könyvtár több hardveres platformon is jobb teljesítményt nyújtson. A v1 megtartja a v0.23 összes tokenazonosítóját, API-ját és szókincsét, miközben sebességben és skálázhatóságban is előrelépést tesz.
Bitcannon és word cache technológiák
Az új verzió több ponton is gyorsabbá teszi a tokenizálást. A „bitcannon” nevű újítás a reguláris kifejezések helyett bitfolyamokon végez műveleteket, kihasználva a modern CPU-k SIMD utasításait. Emellett a „word cache” funkció a már feldolgozott szavak eredményeit tárolja, így az ismétlődő szavaknál elkerülhető a teljes tokenizálási folyamat. A párhuzamos feldolgozást is javították, ahol a szálak nem várnak egymásra egy közös záron.
Benchmarkok és reprodukálhatóság
A Hugging Face a tokbench adattárban publikálta a benchmarkokat, amelyek egy- és többmagos teljesítményt, skálázhatóságot, modell- és nyelvspecifikus sebességet, valamint dekódolási sebességet vizsgálnak. A tokenizers v1-et a tokbench adattárban található parancsokkal bárki reprodukálhatja saját hardverén, a könyvtár több tokenizáló családot is támogat, beleértve a BPE, WordPiece és Unigram algoritmusokat.