TGViewer
SOF_news SOF_news @sof_news24 · 301 subscribers
Post #1665 62
🤖🎙 VoxCPM2 позволяет создавать и клонировать голоса локально и генерировать речь в реальном времени
Представлена открытая модель синтеза речи VoxCPM2, предназначенная для многоязычной генерации, создания новых голосов и клонирования существующих. Модель содержит около 2 млрд параметров, обучена более чем на 2 млн часов речи, работает с 30 языками и создает звук с частотой дискретизации 48 кГц.
🔻 Работает это в нескольких принципиально разных режимах.
Обычная генерация речи. Пользователь передаёт только текст, а VoxCPM2 самостоятельно подбирает голос, интонацию и характер произнесения с учётом содержания фразы. Если образец голоса не задан, при разных запусках тембр может изменяться.
Конструирование голоса. Исходной записи вообще не требуется. Голос описывается словами: пол, возраст, высота, тембр, хрипотца, мягкость, эмоциональность, скорость речи и предполагаемая роль. Разработчики прямо предлагают комбинировать три группы признаков: кто говорит, каким голосом и в какой манере. Например, можно задать пожилую женщину с низким хрипловатым голосом, медленной тихой речью и характером исторического рассказчика.
То есть модель не выбирает готовый голос из каталога – она синтезирует его характеристики непосредственно из текстового описания. При повторной генерации возможны небольшие различия, поэтому фактически речь идёт о создании вариаций виртуального диктора.
Управляемое клонирование. Здесь достаточно предоставить примерно 5–30 секунд чистой записи. VoxCPM2 извлекает из неё особенности тембра, причём точная расшифровка записи не требуется. После этого можно дать отдельное указание изменить темп, эмоциональность или характер подачи, сохранив узнаваемые особенности исходного голоса.
По сути, здесь разделяются два параметра: образец определяет, чей голос воспроизводится, а текстовая команда – как этот голос должен говорить.
Есть и режим максимально точного клонирования. Для него одновременно используются аудиозапись и её точная расшифровка. Модель воспринимает их как начало уже идущей речи и формирует её продолжение, стремясь сохранить не только тембр, но и ритм, высоту голоса, эмоциональное состояние и общую манеру произнесения. В этом режиме управление стилем отключается в пользу максимального сходства с исходной записью.
🔻 Есть и менее очевидная возможность – невербальные элементы речи.
В текст можно добавлять команды для смеха, вздохов, задумчивых пауз, междометий и отдельных эмоциональных реакций. В результате система формирует не просто последовательность произнесённых слов, а более сложное речевое поведение.
🌍 VoxCPM2 поддерживает арабский, бирманский, китайский, датский, нидерландский, английский, финский, французский, немецкий, греческий, иврит, хинди, индонезийский, итальянский, японский, кхмерский, корейский, лаосский, малайский, норвежский, польский, португальский, русский, испанский, суахили, шведский, тагальский, тайский, турецкий и вьетнамский языки, а также девять китайских диалектов.
⚡️ Особый интерес представляет потоковая генерация.
VoxCPM2 умеет отдавать готовый звук частями по мере его формирования, а не только после расчёта всей реплики. Причём внутри VoxCPM2 речь также обрабатывается необычно. Большинство подобных систем сначала превращают звук в набор условных «аудиослов» – дискретных токенов. VoxCPM2 работает преимущественно с непрерывным представлением звука, сохраняя больше мелких особенностей тембра и интонации. Исходное аудио анализируется на 16 кГц, а конечная речь восстанавливается непосредственно в 48 кГц.
🔻 VoxCPM2 может работать не только самостоятельно, но и как часть полностью локальной системы перевода и дубляжа видео. В такой связке отдельная модель распознаёт исходную речь, языковая модель переводит и подгоняет текст под продолжительность реплик, VoxCPM2 воспроизводит перевод требуемым голосом, а отдельные средства отделяют речь от фоновой музыки и шумов. Весь процесс может выполняться на компьютере пользователя без обращения к облачным сервисам.
При этом веса модели и код опубликованы под Apache 2.0, а для локальной работы VoxCPM2 требуется около 8 ГБ видеопамяти.
More from @sof_news24
  1. Oct 1, 2026🧭 Военный календарь на 2 октября 2026 года Ежедневно – основные заранее объявленные мероп…
  2. Oct 1, 2026🧭 Аналитический обзор основных военно-политических событий в Восточной Европе (по состоян…
  3. Oct 1, 2026🇺🇸⚔️ США: формируется новая система развития автономных боевых систем Министр войны США…
  4. Oct 1, 2026🇨🇳⚔️ Китай: перестроена система мобилизации С 1 октября в КНР вступила в силу новая реда…
  5. Oct 1, 2026🧭 Аналитический обзор основных военно-политических событий в Индо-Тихоокеанском регионе (…
  6. Oct 1, 2026🇺🇸⚔️ США: ВМС переходят к серийному развёртыванию безэкипажного флота ВМС США заказали 3…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →