AI для голоса и аудио
- Microsoft VibeVoice - генератор подкастов на 90 минут.
Microsoft представила открытую TTS-модель VibeVoice для генерации длительных аудиозаписей. Она способна создавать до 1,5 часов речи с четырьмя разными голосами и позиционируется как инструмент для подкастов. Модель на 1,5 млрд параметров (7-миллиардная версия ожидается) и поддерживает английский и китайский языки. VibeVoice генерирует диалог нескольких спикеров. В каждой сгенерированной записи предусмотрены сигналы об использовании ИИ (аудиодисклеймер и скрытые водяные знаки) для предотвращения дезинформации. [pymnts.com]
- OpenAI Realtime API и модель gpt-realtime.
OpenAI вывела из беты Realtime API - универсальный голосовой интерфейс, объединяющий распознавание речи, генерацию текста и синтез голоса в одном API. Новая модель gpt-realtime обучена для голосовых ассистентов, контакт-центров и систем перевода: она распознаёт устную речь, генерирует ответ и сразу озвучивает его, минуя традиционную цепочку из отдельных сервисов. Благодаря цельному подходу к обработке аудио, задержки сокращены, а голосовые ответы звучат естественнее. Одновременно OpenAI снизила тарифы на аудиотокены примерно на 20% - теперь реальный голосовой API стоит ~$32 за 1 млн входных аудиотокенов и $64 за 1 млн выходных. [openai.com]
- Собственные модели Microsoft: MAI-Voice-1 и MAI-1-preview.
Подразделение Microsoft по ИИ выпустило первые модели собственной разработки. MAI-Voice-1 - ультрабыстрый генератор речи, способный сгенерировать минутный аудиофрагмент меньше чем за секунду на одном GPU. Эту модель уже используют, например, в Copilot Daily для автоматического озвучивания новостей. Вторая новинка - MAI-1-preview, языковая модель (тренировалась на ~15 000 GPU H100), которая дает представление о будущих возможностях Copilot. Microsoft планирует задействовать MAI-1-preview в текстовых задачах помощника Copilot (который пока опирается на модели OpenAI) и уже тестирует её. [theverge.com]
Post #238
705
- 👍 4
- ❤ 3
- 🔥 1