Conversational Agent (Голосовой агент)На митапе Yandex Cloud неожиданно (для меня лично) интересным оказался доклад про голосовой ИИ.
Я добавила в #заметки по презентации немного
пояснений от дипсика и получился мини-ликбез
Всем разработчика и покупателям ИИ-рекрутеров посвящается. Теперь будем знать что спрашивать у разработчиков голосовых роботов ;)
Итак,
Современный контекстный агент (Conversational Agent) должен отвечать 4-м ключевым требованиям:1. Сквозная задержка (E2E latency): Необходима ультранизкая сквозная задержка. Диалог должен происходить в реальном времени, без заметных для пользователя пауз.
2. Мультиагентность: Агент должен уметь координировать несколько специализированных агентов.
3. Tooling layer (Слой инструментов): Агент должен не только разговаривать, но и выполнять действия в системах.
4. Постоянная память: Агент должен сохранять контекст диалога и историю взаимодействия.
1. Ультранизкая сквозная задержка (Ultra-low E2E latency)• Целевой показатель времени ответа - менее 1 секунды. Если задержка превышает одну секунду, разговор начинает ощущаться как общение с машиной.
• Поддержка Barge-in и Full-duplex
Barge-in - это способность системы позволить пользователю прервать голосовое сообщение или воспроизведение звука и начать говорить самому, не дожидаясь окончания фразы системы.
Full-duplex — это режим передачи данных, при котором устройства могут одновременно передавать и принимать данные (в отличие от half-duplex: «толкающаяся» модель, когда говорит либо пользователь, либо машина)
• Потоковая обработка всех этапов (ASR → reasoning → TTS)
ASR — это «уши» (услышал и распознал слова)
Reasoning — это «мозг» (понял смысл, подумал, сформировал мысль)
TTS — это «рот» (произнес ответ вслух)
2. МультиагентностьОдин агент не может эффективно решать все задачи. Необходима система, состоящая из нескольких специализированных агентов.
Ключевые функции:
· Разделение ролей между специализированными агентами:
продажи (sales), поддержка (support), операции (operations), аналитика (analytics)
· Планирование выполнения сложных задач:
Декомпозиция задач (task decomposition)
· Обеспечение маршрутизации задач между агентами (routing) и делегирования (delegation)
· Координация и обмен контекстом между агентами
3. Слой инструментов / действий (tooling (action) layer)Conversational agent ценен не столько своими ответами, сколько способностью совершать действия
Ключевые возможности:
· Интеграция с внешними системами: CRM, ERP, API сервисов
· Выполнение действий внутри бизнес-процессов: создание заявки, изменение статуса, запись на встречу
· Структурированный вызов инструментов (structured tool calling)
Structured Tool Calling (структурированный вызов инструментов, также известный как Function Calling) — это механизм, позволяющий большим языковым моделям (LLM) не просто генерировать текст, а выдавать структурированные данные для вызова внешних функций, API или выполнения конкретных действий.
Это ключевая технология, превращающая LLM из «болталки» в агента, способного взаимодействовать с внешним миром: делать расчеты, получать актуальные данные, управлять системами.
Без Tool Calling разработчикам приходилось писать сложные парсеры, чтобы из текстового ответа модели вытащить название функции и параметры.
С Tool Calling модель обучается выдавать строго структурированный JSON (или аналогичный формат), который можно напрямую передать в API.
· Оркестрация действий внутри диалога
4. Постоянный контекст и память (persistent context & memory), или state management (управление состоянием). Агент должен знать статус выполнения задачи, а не просто вести диалог
Ключевые элементы управления:
· Управление состоянием разговора (conversation state), хранение состояния диалога
· Управление состоянием выполнения задачи (task state), отслеживание прогресса задачи
· Управление многошаговыми сценариями
· Восстановление контекста между сессиями