TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2832 2.08K
Microsoft Research открыла VibeVoice-ASR-Streaming, потоковое распознавание речи, которое сразу пишет, кто что сказал, без отдельного этапа диаризации. Модель принимает звук кусками фиксированной длины с небольшим заглядыванием вперёд и выдаёт реплики с метками спикеров по ходу разговора. Можно передать список имён и терминов, чтобы она их не коверкала. Десять языков, русский в списке.

По доле ошибок распознавания (WER для слов, CER для китайских иероглифов) 7B-версия в среднем лучше Gemini 3.5 Transcribe Live, ElevenLabs Scribe v2 Realtime и потоковых моделей OpenAI на пяти наборах записей встреч, хотя на двух Gemini впереди, график на картинке. По атрибуции спикеров лучший или равный лучшему результат в 12 из 13 настроек.

Веса версий с бэкбонами 1,5B и 7B под MIT, код на GitHub, отчёт на arXiv, есть демо.

@neuro_channel
  • 👍 5
  • ❤ 1
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →