🚀 NeuTTS Air - on-device TTS с мгновенным клонированием голоса
Это первая реалистичная модель синтеза речи, запускаемая на устройстве, без api.
Формат - GGML, что позволяет работать на телефонах, ноутбуках и даже на Raspberry Pi.
Клонирование голоса за 3 секунды: достаточно короткого аудиофрагмента, чтобы сконструировать голос для последующих синтезов.
Базируется на лёгком языковом ядре (0,5 B) + нейрокодек NeuCodec, что обеспечивает баланс между качеством и скоростью.
Генерируемые аудио отмечаются водяным знаком с помощью Perceptual Threshold Watermarker — для борьбы с злоупотреблениями.
GitHub: https://github.com/neuphonic/neutts-air
Post #386
1.24K
