Google тоже выпустила SOTA модели — правда, пока что для перевода текста в речь 🔈
Компания представила сразу две модели. Главное:
— Gemini 3.8 Flash TTS, старшая модель, которая умеет создавать голоса с нуля по текстовому описанию и отдельно управлять каждой репликой, включая темп, интонацию и манеру речи. Сами Google пишут, что она идеальна для озвучки персонажей в играх и аудиокниг.
— Gemini 3.8 Flash-Lite TTS, более быстрая и дешёвая версия для массовой озвучки, аудиоконтента и голосовых агентов;
— Поддерживается 100+ языков и диалектов, а готовых голосов уже больше 2000. При этом для копирования конкретного голоса достаточно всего 30 секунд записи.
— Модели они доступны через Gemini API и Google AI Studio.
Что угодо делают, лишь бы Gemini 4 не выпускать 🤬
Первый Нейросетевой
Post #6775
107