Microsoft Research открыла VibeVoice-ASR-Streaming, потоковое распознавание речи, которое сразу пишет, кто что сказал, без отдельного этапа диаризации. Модель принимает звук кусками фиксированной длины с небольшим заглядыванием вперёд и выдаёт реплики с метками спикеров по ходу разговора. Можно передать список имён и терминов, чтобы она их не коверкала. Десять языков, русский в списке.
По доле ошибок распознавания (WER для слов, CER для китайских иероглифов) 7B-версия в среднем лучше Gemini 3.5 Transcribe Live, ElevenLabs Scribe v2 Realtime и потоковых моделей OpenAI на пяти наборах записей встреч, хотя на двух Gemini впереди, график на картинке. По атрибуции спикеров лучший или равный лучшему результат в 12 из 13 настроек.
Веса версий с бэкбонами 1,5B и 7B под MIT, код на GitHub, отчёт на arXiv, есть демо.
@neuro_channel
Post #2832
2.08K

- 👍 5
- ❤ 1