🛠 Nemotron ускорила разметку голосов в локальном ассистенте
23 сентября NVIDIA выложила Nemotron 3 Diarization: модель на 100 млн параметров, которая определяет, кто говорит, а не распознаёт слова. Вместо группировки фрагментов по сходству голоса она каждые 10 миллисекунд проверяет активность каждого из восьми собеседников — поэтому может отметить двух говорящих одновременно.
В тестах автора на английском наборе AMI ошибок оказалось почти вдвое меньше, чем у прежнего решения, а обработка шла в сто раз быстрее. На его 57 русскоязычных записях модель разделила несколько голосов, которые раньше слипались, но эталонной разметки людьми не было: качество оценивала та же облачная модель-ревизор. Подробности и ограничения автор описал на Habr.
Nemotron подключили к релизу Charoite 0.93 для готовых записей и живой ленты; на Mac с чипом M она работает через MLX, без видеокарты NVIDIA и отправки аудио в сеть. Часовой звонок старый движок размечал 18 минут, Nemotron — 8 секунд; зато в потоке метки приходят на пару секунд позже, а потолок модели — восемь голосов.
Для локального ассистента это важнее очередного роста размера основной LLM: узкий этап обработки речи перестал тормозить весь разбор встречи. Но «почти не путает» пока остаётся эксплуатационным наблюдением, а не доказанным качеством на русском — без человеческой разметки эти цифры нельзя честно сравнить.
#Nemotron #NVIDIA #диаризация #локальныйИИ #MLX
Post #322
3