⚡️ Microsoft выпустила VibeVoice-ASR на Hugging Face
Microsoft выложила VibeVoice-ASR - единый speech-to-text модель, которая умеет расшифровывать длинные аудио (до 60 минут) за один проход, без нарезки на короткие куски.
Что интересного:
- Single-pass транскрипция до 1 часа - меньше потерь контекста и стабильнее речь по всему аудио
- Встроенная diarization (кто говорит) + таймкоды (когда)
- Custom hotwords / user context - можно подать список имён, терминов или контекст, чтобы точнее распознавал доменные слова
По сути: модель сразу выдаёт структурированный результат Who / When / What, кто сказал, когда и что.
https://huggingface.co/microsoft/VibeVoice-ASR
Post #2506
6.03K

- 🔥 22
- 👍 9
- 🥰 3