✍🏻SoundStream новый нейронный аудиокодек от Google AI
SoundStream эффективно сжимает речь, музыку и звук с битрейтами, которые обычно используются кодеками обработки для речи. SoundStream опирается на модельную архитектуру, состоящую из сверточной сети кодировщика/декодера и квантователя остаточного вектора, которые обучаются совместно. Благодаря обучению со структурированным отключением на слоях квантователя, одна модель может работать с переменными битрейтами от 3 до 18 кбит/с. Это сравнимо с качеством моделей, обученными с фиксированными битрейтами. Также модель поддерживает реализацию с низкой задержкой и потоковом выводом в режиме реального времени на процессоре смартфона.
Нейросеть состоит из кодировщика, декодера и квантователя. Кодер преобразует входной аудиопоток в кодированный сигнал, который сжимается с помощью квантователя, а затем преобразуется обратно в аудио с помощью декодера. После обучения кодер и декодер можно запускать на разных клиентах для эффективной передачи высококачественного звука по сети. Оценить результаты работы SoundStream и подробнее узнать, как решается проблема квантования кодовых векторов можно здесь: https://ai.googleblog.com/2021/08/soundstream-end-to-end-neural-audio.html
Post #81
187