Tizenkét nyelven szólal meg alacsony késleltetéssel az NVIDIA új Magpie TTS-je
Az NVIDIA Magpie TTS új, 364 milliós paraméterű modellje 12 nyelven, köztük modern arabbal, koreaiul és brazil portugállal szólal meg, miközben a szerveroldali késleltetés (TTFA) 32 ms-ra csökkenthető.

A Magpie TTS az NVIDIA NIM platformon keresztül érhető el, ami lehetővé teszi a vállalati környezetben történő testreszabást. A fejlesztők így optimalizálhatják a hangkarakterisztikát, a kiejtést és a késleltetést, miközben betartják az adatvédelmi követelményeket. A modell támogatja a kódváltást (code-switching) hindi és japán nyelven, IPA-alapú grapheme-to-phoneme feldolgozással és egyéni kiejtési szótárakkal.
A késleltetés optimalizálása
A Magpie TTS a Time to First Audio (TTFA) mutatóra fókuszál, amely a hanggenerálás megkezdése és az első hang elérése közötti késleltetést méri. Saját infrastruktúrán futtatva a modell B200 GPU-n 32 ms-os TTFA-t ér el, ami elegendő időt hagy az ASR és LLM feldolgozására a természetes, 200 ms alatti végpontok közötti kommunikációhoz. Konkurens terhelés alatt, 64 streamen a B200 239 ms-os TTFA-val működik, miközben 320-szoros valós idejű átvitelt biztosít.
Architektúra és minőségjavítás
A modell két újítást vezet be a sebesség növelése és a minőség megőrzése érdekében: a frame stacking, amely kétszer annyi audio frame-et prediktál minden dekódolási lépésben, és a local transformer, amely finomítja a generált hangot. A frissített tréning adatok és modellfejlesztések révén a francia és spanyol nyelvekben jelentős javulás tapasztalható a karakterhibaszám (CER) és a hangszóróhasonlóság (SSIM) terén. Az új nyelvek, mint az arab (1,62% CER), a koreai (2,69%) és a brazil portugál (2,91%) is stabil alapot képeznek a további fejlesztésekhez.
A Magpie TTS nyílt súlyú modellje a Hugging Face-en érhető el kutatási célokra, míg az NVIDIA NIM szolgáltatása a termelési környezetekhez kínál optimalizált futtatási környezetet.