TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 12.8K subscribers
Post #8634 2.02K

Forwarded from Machinelearning

🌟 Nvidia открыла веса модели для разметки спикеров в аудио

Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга.

Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим.


Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании.

Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это.

Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров.


🟡Архитектура

Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс.

На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке.

Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров.

🟡Тесты

Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше.


В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей.

Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%.

На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%.

Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы.


📌Лицензирование: OpenMDW-1.1


🟡Блогпост
🟡Модель
🟡Демо


@ai_machinelearning_big_data

#AI #ML #Diarization #Speech #Nemotron #Nvidia
  • 🔥 12
  • ⚡ 1
  • ❤ 1
  • 🎉 1
More from @tsingular
  1. Sep 26, 2026🧠 «Последний ИИ, созданный людьми»: новая roadmap-работа про Recursive Self-Improvement В…
  2. Sep 26, 2026Вот вам котик еще. Проект залил на GitHub: https://github.com/siliconbag/lego-build SKILL.…
  3. Sep 26, 2026📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science р…
  4. Sep 26, 2026Учу испанский теперь только с этим другом. Нафиг сову. - бро, чёт ИИ кристалл твой не помо…
  5. Sep 26, 2026Интересный пример использования Jev для категоризации URL для threat intel по Адмиральской…
  6. Sep 26, 2026Пишут, что починили: https://status.openai.com/incidents/01M3DCNWMW57HYK8FJ5FBFPA39 У вас…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →