Моделька уже взорвала престижный чарт Artificial Analysis и ворвалась в топ-1️⃣, обойдя OpenAI, Gemini и ElevenLabs.
• Принципиальная разница — Realtime TTS-2 училась на живых диалогах, а не на аудиокнигах.
• Есть слуховой контекст — модель получает на вход не сухой текст, а аудио предыдущей реплики. Если вы только что пошутили или нагрубили ей, она ответит соответствующе.
• Никаких унылых пресетов «Радость/Грусть». Прямо в тексте пишете:
[говори уставшим, но теплым голосом, будто только вернулась домой] — и модель меняет подачу. • Один и тот же голос говорит на 100+ языках (включая русский) с сохранением тембра. Можно менять язык прямо посреди предложения.
• Описали персонажа промптами — получили уникальный голос или тембр. Рефы необязательны.
• Скорость — менее 200 мс до первого звука. При этом модели достаточно 15 секунд записи голоса для клонирования.
Тестим лучший генератор голоса на данный момент тут.
👍 Бэкдор