Öt új hangmodellt adott ki az Alibaba, 95%-kal olcsóbbá vált a szöveg-hang átalakítás
Az Alibaba Qwen Audio 3.1 csomagja öt új modellt kínál beszédfelismerésre (ASR), szöveg-hang generálásra (TTS) és valós idejű interakcióra, miközben az árak akár 95%-ot is csökkennek.

A Qwen Audio 3.1 ASR-Next verziója képes több beszélő azonosítására időbélyeggel, emellett érzékeli az érzelmeket, a környezeti zajokat és a gépi zajokat. A TTS-Next egy nyelvi modellt és egy diffúziós megközelítést kombinál, hogy egyetlen lépésben generáljon hangot, hangeffektusokat és háttérzajt. (The Decoder)
Beszédfelismerés és hanggenerálás
A fejlesztett ASR modell jobb többnyelvű és dialektus-felismerést ígér, automatikusan eltávolítva a töltelékszavakat és ismétléseket. A TTS modell többnyelvű szintézist és természetes hangátvitelt tesz lehetővé, a felhasználók egyszerű szöveges utasításokkal szabályozhatják az érzelmet, a sebességet és a stílust – például „olvasd fel ezt éles, parancsoló hangon, követelve a tiszteletet”.
Valós idejű interakció és árazás
A valós idejű modell lehetővé teszi a szimultán beszédet és hallgatást azonnali megszakítással. A Qwen szerint, ha alacsony hangulatot észlel, a modell lassabban és empatikusabban reagál. Az Alibaba jelentősen csökkenti az árakat: a TTS szolgáltatások ára mintegy 70%-kal esik, a valós idejű modellé nagyjából 85%-kal, a beszédfelismerés (ASR) költségei pedig akár 95%-kal csökkenek. A pontos árak a Qwen Cloud kínálatában lesznek elérhetők.