После разбора архитектуры голосового ассистента решили показать, как на практике меняются требования к голосовым системам в зависимости от задач бизнеса и почему такие сценарии довольно быстро выходят за рамки обычного speech-to-text.
1️⃣Например, в MedTech и health-сервисах одна из главных проблем — большое количество ручной работы при фиксации и обработке данных. Симптомы, показатели, рекомендации и другую информацию часто приходится вручную переносить между приложениями, документацией и внутренними системами.
В таких сценариях критично качество распознавания речи, поэтому здесь часто используют Whisper и encoder-decoder модели (архитектуры, которые хорошо работают с длинной речью, шумным аудио и сложными формулировками).
С похожими задачами столкнулись и мы во время проработки одного из MedTech-проектов. Голосовой ассистент должен был записывать диалог врача и пациента, автоматически переводить разговор в структурированные данные и заполнять медицинскую документацию без ручной фиксации информации после приёма.
2️⃣ В E-commerce задачи уже другие — сократить количество действий между пользователем и покупкой. Поиск товаров, фильтры, формы и длинные пользовательские сценарии напрямую влияют на конверсию и количество завершённых заказов. Поэтому здесь особенно важны скорость ответа и работа в реальном времени. Для таких сценариев часто используют streaming-ASR модели (системы потокового распознавания речи), которые обрабатывают голос практически без задержки.
3️⃣ В промышленности и enterprise-инфраструктуре требования к голосовым системам уже другие. Производственные процессы, обслуживание оборудования, логистика и работа с внутренними сервисами предприятий создают большое количество ручных операций и постоянного взаимодействия с внутренними системами. Здесь уже критичны стабильность работы, локальное развёртывание и возможность запускать голосовые системы внутри инфраструктуры компании без зависимости от внешних сервисов.
Поэтому в подобных сценариях часто используют lightweight-модели (облегчённые модели распознавания речи), которые можно запускать локально внутри инфраструктуры предприятия или на edge-устройствах без сложной облачной инфраструктуры.
В ASAP мы работаем с такими проектами и помогаем компаниям проектировать голосовые решения под конкретные бизнес-задачи и архитектуру систем. Для нас голосовой ассистент — это не отдельная AI-функция, а инструмент автоматизации, который должен стабильно работать внутри реальных процессов компании и учитывать ограничения её инфраструктуры.
