🥳 Выкладываем T-One: открытая потоковая ASR модель для телефонии
Распознать хорошее аудио в оффлайне сегодня – не проблема. Берём какой-нибудь whisper и полетели.
А вот на плохих телефонных каналах всё довольно сложно. 8 килогерц, пшш-пшш, эхо и прочие беды. Для нас это задача типичная, и у нас получается её хорошо решать. Мы решили поделиться наработками.
Модель называется T-One, и это потоковая модель для телефонии. Она супер компактная, быстрая, и адаптирована для телефонных каналов.
→ Потоковая модель
→ 70M параметров, это в 50 раз меньше whisper-large-v3
→ В 2-3 раза (!) лучше WER чем у whisper-large-v3 на телефонных каналах (бенчи)
→ 300 ms чанк данных, можно строить realtime системы
→ Apache 2.0
Читайте крутой развернутый тех репорт на хабре
Качать как обычно на нашем Hugging Face
Post #296
7.58K
- 🔥 106
- ❤ 23
- 🤔 3
- 🤡 3
- 🥱 2