Сбер представил GigaChat Audio — модель с расширенными возможностями работы со звуком, а также выложил в открытый доступ семейство моделей автоматического распознавания речи.
Главное про релиз:
🔘Эмпатия: модель распознает интонации и эмоции спикера и адаптирует стиль ответа под его состояние.
🔘Работа с длинным аудио: поддержка записей до 2 часов с разделением по спикерам, поиском по таймкодам и умным саммари.
🔘Голосовая память: ассистент запоминает важные факты из диалогов для будущих сессий.
🔘Качество: в тесте Arena Hard Audio модель показала 75% побед, а точность распознавания эмоций достигла 80%, обойдя ряд мировых аналогов.
Для разработчиков (Open Source):
🔘Облегчённая версия GigaChat Audiо: поддерживает русский и английский, легко дообучается под языки стран СНГ. Вместе с моделью команда представила датасет TimeGround-1M — для обучения LLM привязке событий ко времени.
🔘Семейство GigaAM: первые российские открытые модели для мультиязычного распознавания речи. Модели допускают в 1,5–2 раза меньше ошибок и оптимизированы для запуска даже на обычных процессорах.
Забирайте модели в свои проекты, а если хотите углубиться в техническую составляющую, читайте пост команды 💻
