Вышла новая open-source TTS-модель — TADA
Сегодня представили TADA — speech-language модель, которая генерирует текст и аудио одновременно в одном синхронизированном потоке. Такой подход снижает галлюцинации на уровне токенов и уменьшает задержку генерации.
Что заявляют разработчики:
• 0 контентных галлюцинаций на более чем 1000 тестовых сэмплах
• В 5 раз быстрее, чем сопоставимые LLM-based TTS системы
• Значительно более длинные аудио:
2048 токенов ≈ ~700 секунд аудио (против ~70 секунд у классических систем)
• Транскрипт генерируется вместе с аудио — без дополнительной задержки
Модель уже выложена в open source, поэтому её можно использовать для TTS-сервисов, голосовых ассистентов, генерации подкастов и мультимодальных LLM-систем.
👉 @PythonPortal
Post #5583
8.19K
- 👍 8
- ❤ 5