🤖🎙 VoxCPM2 позволяет создавать и клонировать голоса локально и генерировать речь в реальном времени
Представлена открытая модель синтеза речи VoxCPM2, предназначенная для многоязычной генерации, создания новых голосов и клонирования существующих. Модель содержит около 2 млрд параметров, обучена более чем на 2 млн часов речи, работает с 30 языками и создает звук с частотой дискретизации 48 кГц.
🔻 Работает это в нескольких принципиально разных режимах.
Обычная генерация речи. Пользователь передаёт только текст, а VoxCPM2 самостоятельно подбирает голос, интонацию и характер произнесения с учётом содержания фразы. Если образец голоса не задан, при разных запусках тембр может изменяться.
Конструирование голоса. Исходной записи вообще не требуется. Голос описывается словами: пол, возраст, высота, тембр, хрипотца, мягкость, эмоциональность, скорость речи и предполагаемая роль. Разработчики прямо предлагают комбинировать три группы признаков: кто говорит, каким голосом и в какой манере. Например, можно задать пожилую женщину с низким хрипловатым голосом, медленной тихой речью и характером исторического рассказчика.
То есть модель не выбирает готовый голос из каталога – она синтезирует его характеристики непосредственно из текстового описания. При повторной генерации возможны небольшие различия, поэтому фактически речь идёт о создании вариаций виртуального диктора.
Управляемое клонирование. Здесь достаточно предоставить примерно 5–30 секунд чистой записи. VoxCPM2 извлекает из неё особенности тембра, причём точная расшифровка записи не требуется. После этого можно дать отдельное указание изменить темп, эмоциональность или характер подачи, сохранив узнаваемые особенности исходного голоса.
По сути, здесь разделяются два параметра: образец определяет, чей голос воспроизводится, а текстовая команда – как этот голос должен говорить.
Есть и режим максимально точного клонирования. Для него одновременно используются аудиозапись и её точная расшифровка. Модель воспринимает их как начало уже идущей речи и формирует её продолжение, стремясь сохранить не только тембр, но и ритм, высоту голоса, эмоциональное состояние и общую манеру произнесения. В этом режиме управление стилем отключается в пользу максимального сходства с исходной записью.
🔻 Есть и менее очевидная возможность – невербальные элементы речи.
В текст можно добавлять команды для смеха, вздохов, задумчивых пауз, междометий и отдельных эмоциональных реакций. В результате система формирует не просто последовательность произнесённых слов, а более сложное речевое поведение.
🌍 VoxCPM2 поддерживает арабский, бирманский, китайский, датский, нидерландский, английский, финский, французский, немецкий, греческий, иврит, хинди, индонезийский, итальянский, японский, кхмерский, корейский, лаосский, малайский, норвежский, польский, португальский, русский, испанский, суахили, шведский, тагальский, тайский, турецкий и вьетнамский языки, а также девять китайских диалектов.
⚡️ Особый интерес представляет потоковая генерация.
VoxCPM2 умеет отдавать готовый звук частями по мере его формирования, а не только после расчёта всей реплики. Причём внутри VoxCPM2 речь также обрабатывается необычно. Большинство подобных систем сначала превращают звук в набор условных «аудиослов» – дискретных токенов. VoxCPM2 работает преимущественно с непрерывным представлением звука, сохраняя больше мелких особенностей тембра и интонации. Исходное аудио анализируется на 16 кГц, а конечная речь восстанавливается непосредственно в 48 кГц.
🔻 VoxCPM2 может работать не только самостоятельно, но и как часть полностью локальной системы перевода и дубляжа видео. В такой связке отдельная модель распознаёт исходную речь, языковая модель переводит и подгоняет текст под продолжительность реплик, VoxCPM2 воспроизводит перевод требуемым голосом, а отдельные средства отделяют речь от фоновой музыки и шумов. Весь процесс может выполняться на компьютере пользователя без обращения к облачным сервисам.
При этом веса модели и код опубликованы под Apache 2.0, а для локальной работы VoxCPM2 требуется около 8 ГБ видеопамяти.
Post #1665
62
