🗣 Релиз Fun-ASR1.5 - обновление end-to-end модели распознавания речи.
Главное изменение в том, что модель стала ближе к продакшену.
Поддержка 30 языков в одном пайплайне. Без разбиения на отдельные модели и маршрутизации.
Нормально работает с code-switching. Если в речи смешаны языки, модель сама это определяет и корректно транскрибирует, без ручной разметки.
Выходной текст стал заметно чище. Появилась адекватная пунктуация и форматирование чисел, дат, валют. Меньше постобработки, меньше костылей сверху.
Фактически это уже не просто ASR, а готовый слой для сервисов, где речь сразу превращается в пригодный текст.
API:
https://dashscope-intl.aliyuncs.com/api/v1
Демо:
https://modelscope.cn/studios/iic/FunAudio-ASR
Post #5010
4.57K