NVIDIA выпустила голосовую модель VoiceChat на 11B параметров
NemotronLabs VoiceChat — end-to-end-модель для двусторонних голосовых диалогов в реальном времени. Вместо отдельно связанных ASR, LLM и TTS она обрабатывает и генерирует речь в единой архитектуре.
NVIDIA опубликовала чекпойнт и код в экспериментальной ветке NeMo. Модель поддерживает вызов инструментов и может проговаривать заданную фразу, пока выполняется запрос.
Для запуска нужна NVIDIA GPU минимум с 80 ГБ памяти. У релизного чекпойнта один фиксированный голос без клонирования. Модель обучалась на аудиоконтексте длительностью не более двух минут; разработчики предупреждают об ошибках, речевых артефактах и возможном зацикливании.
Источник: репозиторий NVIDIA
CLODEx
Post #247
516
