ÉlőUtoljára: 35 perceMa: 24
Modellek & LLMfrissítve: 23:45

Első teljes duplex hangmodellt mutatott be az OpenAI a ChatGPT Voice-ban

Az OpenAI GPT-Live hangmodellje full-duplex architektúrával egyszerre képes hallgatni és beszélni, természetesebb párbeszédeket tesz lehetővé a ChatGPT-ben.

Első teljes duplex hangmodellt mutatott be az OpenAI a ChatGPT Voice-ban
Fotó: BoliviaInteligente / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

Az OpenAI bemutatta a GPT-Live-ot, új generációs hangmodelljét, amely a ChatGPT Voice-ban debütál. A cél a természetes ember-AI interakció megvalósítása, ahol a beszélgetés fluid és reszponzív, mint egy emberi párbeszéd. (Hacker News)

Előző megközelítések

A korábbi hangrendszerek két fő típusa korlátozott volt. A kaszkádolt rendszerek több modellt láncoltak egymás után, ami információvesztést és lassú, darabos válaszokat eredményezett. A turn-alapú modellek egyetlen modellen belül dolgoztak, de még mindig várták, hogy a felhasználó befejezze a mondatot, mielőtt válaszolnának, ami merev párbeszédet eredményezett.

Kapcsolódó: GPT-5.5-ös modell

A GPT-Live újítása

A GPT-Live egy full-duplex architektúrára épül, ami lehetővé teszi, hogy a modell egyszerre hallgasson és beszéljen. Ez azt jelenti, hogy a modell képes figyelemjelzéseket mutatni, mint például „mhmm” vagy „igen”, gyors visszajelzést adni, vagy csendben maradni, ha a felhasználónak gondolkodási időre van szüksége. Az OpenAI szerint ezáltal a hangélmény „refreshingly easy to talk to”, azaz frissítően könnyű vele beszélgetni.

Kapcsolódó: GPT-5.5 promptjai

Folyamatos interakció

A GPT-Live folyamatos interakcióra lett tervezve, ahol a modell másodpercenként többször is dönthet arról, hogy beszéljen, hallgasson, szüneteljen, félbeszakítson vagy eszközt hívjon. Ez a képesség természetesebb párbeszédeket tesz lehetővé, jobb időérzéket biztosít, és akár élő fordítást is lehetővé tehet. Az OpenAI szerint ez a legokosabb hangmodelljük eddig.

Kapcsolódó: GPT-5.5 indítása

A ChatGPT Voice-ban debütál

A GPT-Live már most is a ChatGPT Voice-t táplálja, és a korábbi rendszerek korlátait küszöböli ki. Az új architektúra csökkenti a késleltetést és gördülékenyebb, természetesebb interakciót tesz lehetővé, ami a felhasználói élmény jelentős javulását ígéri.

Kapcsolódó: gpt-oss teljesítménye

A GPT-Live bevezetése a ChatGPT Voice-ban az OpenAI legfrissebb fejlesztése, amely új szintre emeli a beszédfelismerés és -generálás minőségét.

Kapcsolódó: GPT-Rosalind bevezetése

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom