Microsoft показала ИИ-модели для быстрой расшифровки речи и синтеза голоса
Microsoft представила MAI-Transcribe-2-Streaming — модель для почти мгновенной расшифровки речи, которая начинает показывать текст примерно через 100 мс после получения звука и поддерживает 60 языков. Вместе с ней компания анонсировала MAI-Voice-2.1 и MAI-Voice-2.1-Flash для генерации речи: они умеют работать с 23 языками, сохранять узнаваемый голос при переключении между ними и подходят для голосовых агентов, субтитров и диктовки.
@forgeeks | @forgeeksflash
Post #19953
8
