Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга.
Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим.
Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании.
Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что
speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это.Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров.
🟡Архитектура
Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс.
На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке.
Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров.
🟡Тесты
Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше.
В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей.
Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%.
На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%.
Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы.
📌Лицензирование: OpenMDW-1.1
🟡Блогпост
🟡Модель
🟡Демо
@ai_machinelearning_big_data
#AI #ML #Diarization #Speech #Nemotron #Nvidia


