Bemutatta a Gemini 3.8-as hangmodellt a Google, 30 másodperc elég a klónozáshoz
A Google két új, Gemini 3.8-as text-to-speech (TTS) modellt dobott piacra, amelyek több mint 2000 előre definiált hangot kínálnak, és mindössze 30 másodpercnyi hangmintából képesek egyedi hangokat klónozni.

A Gemini 3.8 TTS Playground interaktív felület a Gemini 3.8 Flash TTS modellre épül, és lehetővé teszi a több szereplős beszélgetések előnézetét és a beállítások megosztását URL-en keresztül. (Simon Willison)
A fejlesztői eszközök és a demó
Simon Willison újságíró és fejlesztő hozta létre a Google Gemini API-jához az interaktív felületet, amelyen a felhasználók egyedi hang narrációkat vagy akár több szereplős beszélgetéseket is összeállíthatnak. A beállítások elmentése megosztható URL-ekre történik, így a konfiguráció könnyen továbbítható. A Google API egyik kiemelkedő képessége, hogy megkönnyíti a több karaktert felvonultató beszélgetések definiálását, ahol minden szereplőnek eltérő hangja és stílusa lehet.
Teljesítmény és költség
Willison egy rövid demóklipet is megosztott, amelyben két pelikán vitatkozik a Pacifica Pierre való költözésről. A forgatókönyvet a Claude 4.5 Opus írta, és a hanganyagot a Gemini 3.8 Flash TTS modellel generálták. A fejlesztő tesztje alapján körülbelül 20 másodpercbe telt 1 perc 18 másodpercnyi hanganyagot generálni, ami 2,74 cent költséget jelentett a Gemini 3.8 Flash TTS használatával.