Szöveges utasítással tervezhetünk egyedi hangokat a Gemini 3.8-cal
A Google DeepMind bemutatta a Gemini 3.8 modellt, amellyel szöveges leírásból vagy 30 másodperces hangmintából hozhatunk létre egyedi beszédhangokat.
Kipróbálom: Gemini Audioblog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech
A Google DeepMind bejelentette a Gemini 3.8 text-to-speech modellt, amellyel teljesen új beszédhangokat tervezhetünk egyszerű szöveges utasítások segítségével. A felhasználók sorról sorra irányíthatják a hangszínészi játékot, a tempót, a dialektusokat és a spontán beszédreakciókat is.
Az eszköz képes felnőtt beszédhangok pontos másolására is egy mindössze 30 másodperces hangminta alapján. A visszaélések elkerülése érdekében a rendszer beépített beleegyezés-ellenőrzést, SynthID vízjelezést és C2PA hitelesítést használ a hangtulajdonosok védelmére.
Az új hanggeneráló funkciók már elérhetők a fejlesztők számára a Google Gemini Audio felületén keresztül. A technológia ideális játékfejlesztéshez, hangoskönyvekhez vagy akár több szereplős podcastok készítéséhez is.