Gemini 3.8 TTS генерирует голоса на основе описания и клонирует речь пользователя.
Google выпустила две модели для синтеза речи. Flash TTS работает со 130 языками, а Flash-Lite TTS — со 101. Обе версии поддерживают русский язык и уже доступны через API.
При озвучивании видео или аудиокниг можно настраивать эмоции, скорость и паузы для каждой фразы. Нейросеть способна воспроизводить смех, вздохи и вести диалог от лица двух персонажей.
Процесс копирования голоса включает запись аудиообразца, предоставление отдельного устного согласия и сохранение профиля для синтеза.
Протестировать функцию можно в Google AI Studio: необходимо выбрать модель, создать голос и ввести текст. Предусмотрены бесплатные лимиты. В итоговый аудиофайл внедряется скрытый водяной знак SynthID для идентификации сгенерированного контента.
@AiXenix
Post #3941
252