На конференции Google I/O 2025 анонсирована мультимодальная модель Gemini 2.5. Она умеет:
- Генерировать аудио и диалоги в реальном времени.
- Распознавать эмоции и адаптировать интонацию, акцент.
- Поддерживать более 24 языков, игнорируя фоновые шумы.
Gemini 2.5 также предлагает продвинутый синтез речи, позволяя управлять стилем и темпом. Все сгенерированные аудио можно идентифицировать с помощью технологии SynthID. Это открывает новые возможности для интерактивных приложений и виртуальных ассистентов.
Подробнее: Google.
@Unlim_AI
Post #1492
9.37K

- 👍 13
- 👨💻 2
- 🗿 2
- 🦄 1