🎙️ Hume випустили TADA — open-source TTS модель, яка генерує текст і аудіо в одному потоці
Головна фішка: dual alignment тексту й аудіо на рівні токенів. Результат:
→ Нуль галюцинацій на 1000+ тестових зразках
→ У 5 разів швидше за аналогічні LLM-based TTS
→ 2048 токенів покривають ~700 секунд аудіо (vs ~70 секунд у звичайних системах)
→ Безкоштовний транскрипт разом з аудіо без додаткової латентності
TADA — це не просто TTS, а speech-language model. Модель синхронізує генерацію тексту й мовлення, тому не «забуває» і не вигадує слова посеред речення. Для open source — це серйозна заявка.
https://www.hume.ai/blog/opensource-tada
📎 Читайте також:
→ ElevenLabs Scribe v2 — найточніша транскрипція
→ ElevenLabs Skills для Claude Code та Cursor
→ Швидка відкрита транскрипція аудіо й відео
Post #2539
392