TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #11009 18.5K
🌟 Nvidia открыла веса модели для разметки спикеров в аудио

Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга.

Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим.


Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании.

Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это.

Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров.


🟡Архитектура

Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс.

На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке.

Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров.

🟡Тесты

Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше.


В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей.

Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%.

На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%.

Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы.


📌Лицензирование: OpenMDW-1.1


🟡Блогпост
🟡Модель
🟡Демо


@ai_machinelearning_big_data

#AI #ML #Diarization #Speech #Nemotron #Nvidia
  • ❤ 42
  • 👏 15
  • 💘 6
  • 🔥 5
  • 👍 3
More from @ai_machinelearning_big_data
  1. Sep 25, 2026✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avata…
  2. Sep 25, 2026Появилось открытое сообщество для решения NetHack Исследователи из AIRI зовут объединяться…
  3. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  4. Sep 25, 2026⚡️ OpenAI готовит подписку ChatGPT Pro Max Согласно утечкам из кодовой базы сервиса, в бли…
  5. Sep 25, 2026AIJ Contest 2026: реши реальные задачи и получи возможность забрать свой кусок 10-миллионн…
  6. Sep 25, 2026✔️ Cursor сократил расход токенов Anysphere переработала обвязку своего агента и снизила т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →