Ötszázmillió dolláros bevételhez jutott az ElevenLabs, a nagy hírportálok hangozzák fel
Az AI-hangosítás terjedése a nagy hírportálokon új dimenziót nyit a fogyasztásban, de vajon megváltoztatja a viszonyunkat az írott tartalomhoz? Az ElevenLabs vezérigazgatója szerint a technológia már emberi hangokat imitál.

Egyre több nagy hírportál, köztük a The New York Times, a Washington Post és a The Wall Street Journal, valamint olyan magazinok, mint a The New Yorker, a The Atlantic és a Vanity Fair, kezdték el használni az automatizált szövegfelolvasó eszközöket. Az ElevenLabs, egy AI-hangokkal foglalkozó cég, amely 2023-ban a The New Yorkerrel működött együtt, idén közölte, hogy éves ismétlődő bevétele meghaladta az ötszázmillió dollárt. A cég több mint tízezer mesterséges hangot kínál.
David Remnick, a The New Yorker főszerkesztője szerint az ElevenLabs egyik hangja „nagyon jól” szólt, és „szinte azonnal” képes volt előállítani a felolvasást. Monica Racic, a lap helyettes szerkesztője elmondta, hogy ez „minden olvasónak nagyobb rugalmasságot ad abban, hogyan fogyasztják a híreinket — akár olvasás, akár hallgatás közben, ingázás, kutyasétáltatás vagy mosogatás közben”. Az ElevenLabs befektetőkkel tárgyal egy húszmilliárd dolláros értékelésű másodlagos kibocsátásról.
Azonban a mesterséges hangok terjedése — az ElevenLabs, a Microsoft és más szakcégek, mint a News over Audio (NOA) eszközei révén — elgondolkodtatott: vajon a szintetikus hangon hallott újságírás megváltoztatja az olvasó viszonyát a történethez? Az elmúlt hetekben több mesterséges narrátort hallgatva lenyűgözött a technológia emberi utánzóképessége és időtakarékos potenciálja. Egy FIFA-elnökről szóló profilt hallgattam meg mosogatás közben, egy, az egyenlőtlenségről szóló cikket pedig egy séta során. De mindeközben sosem felejtettem el, hogy egy robotot hallok.
Az AI-narrátorok beszédmintázatai gyakran tartalmaznak mesterkéltségre utaló jeleket. A hangok lehetnek lihegősek, nem érzékelik, mikor kellene lelassítaniuk, vagy egy-egy mondatot, szót kiemelni. Furcsa hangsúlyokat tesznek, vagy szimulált lélegzetvételt adnak hozzá, ami nyugtalanító érzést kelt. Mati Staniszewski, az ElevenLabs vezérigazgatója szerint a cég „az első olyan modellt hozta létre, amely emberinek hangzik”, és képes „a leírt szöveg kontextuális megértése alapján” beszélni.
Ahogy egyre több AI-hangot hallgattam, rájöttem, mi zavar: az emberi megkülönböztetés hiánya. Egy 1997-es, Donald Trumpról szóló, Mark Singer által írt The New Yorker-címlapot hallgattam meg először a szerző, majd egy szintetikus hang által felolvasva. A valós narrátort preferáltam. Nem azért, mert az AI verzió élvezhetetlen volt, hanem mert nem tudta megragadni Singer egyedi stílusát és a szöveg mögötti emberi megértést.