TGViewer
Всеволод Викулин Всеволод Викулин @vikulin_ai · 5.28K subscribers
Post #125 5.96K
Когда молчание агента — золото. Кейс компании DoorDash.

DoorDash — крупнейшая компания по доставке еды в США, где с заказами часто что-то идет не так: ресторан не выдает еду, суп пролился по дороге, клиент не отвечает. Все эти кейсы летят в поддержку, и отвечать на них нужно быстро. Для этого в DoorDash построили агентскую систему, которая сама отвечает на вопросы курьеров.

И здесь ошибка агента — это уже не ха-ха, смешная галлюцинация. Это реальные операционные и финансовые потери от неправильного действия курьера.

В таких системах важно не только качество ответа, но и умение агента вовремя заткнуться, чтобы не наговорить того, в чем не разбирается. Как развить у агентов такие навыки осознанности, поговорим в этом посте.

Архитектура системы

Архитектура строится на базе LLM-workflow:

1. LLM суммаризирует кейс.
Она берет обращение курьера, метаданные заказа и историю диалога, выделяет суть проблемы и готовит компактное представление кейса.

2. Ищем релевантные инструкции.
Поиск идет по базе прошлых обращений и связанных с ними верифицированных статей. Сами прошлые ответы не являются источником истины — они нужны только для поиска. Ответ строится на основе проверенных инструкций.

3. Проверяем качества поиска.
Новый LLM-вызов оценивает, действительно ли найденные документы подходят под запрос. Если нет — кейс сразу уходит человеку, а затем эксперты дополняют базу новой информацией. Этот LLM-вызов обычно называется LLM-guardrail. Далее мы подробнее это разберем.

4. Только теперь LLM генерирует ответ.
LLM получает найденные инструкции в контекст и формирует ответ на их основе (вот теперь мы уже можем находить галлюцинации).

5. Проверяем сам ответ.
Вторая LLM-guardrail оценивает:
- нет ли галлюцинаций;
- действительно ли он отвечает на вопрос;
- корректен ли язык.

6. Решаем, отвечаем или нет.
Если все ок, ответ уходит курьеру. Дальше уже поверх этого считаются метрики качества через LLM-as-a-judge. Если что-то guardrail не понравилось — отправляем на человека. Не рискуем.

Почему это хорошая архитектура

Во многих бизнес-задачах не нужно автоматизировать 100% обращений. Нужно надежно автоматизировать самые частые и понятные кейсы — и уже этого достаточно, чтобы получить заметный эффект. Закон Парето: 80/20.

Самые частые 80% кейсов хорошо документированы, а вот оставшиеся 20% редкие, плохо формализованные. Именно на этих 20% попытка додавить становится очень дорогой и опасной.

Поэтому зрелая система не героически отвечает в любой ситуации, а умеет вовремя отказаться. Нужно не всегда действовать, а понимать границы, где действие уже перестает быть адекватным по соотношению риск/профит. Себе тоже возьму на заметочку.

Подробнее про guardrails

Guardrail — это как раз механизм, который помогает разделить эти 80% и 20%. Эта LLM по ответу пытается предсказать, все ли хорошо в ответе с качеством. Если есть намек, что качество плохое, — сразу на человека.

Это может быть ровно та же LLM-as-a-judge, которую мы используем для метрик качества. Только считаем мы ее в рантайме, а не постфактум для observability.

Да, тогда теряется возможность стримить ответ сразу: сначала нужно дождаться всех проверок. Но действительно хорошие вещи стоит и подождать.

Резюме

На своих занятиях по внедрению AI я часто сравниваю два мира.

В B2C все любят показывать “вау-агентов”: модные мультиагентные системы (см пост про DeepResearh), которые соревнуются друг с другом по объему сжирания токенов.

В B2B агентские системы часто выглядят гораздо менее эффектно: сделай это, проверь поиск, проверь ответ, если есть сомнение — сразу на человека.

Но это не потому, что B2B отстает. Просто риск ошибки несет уже не пользователь, а компания. Если в B2C AI обманул, ответственность на пользователе: надо было проверить. Если в B2B агент наврал при общении с клиентом, последствия — уже деньги компании и клиентский опыт. Поэтому ценится не максимальная автономия, а контролируемая автономия.

И очень часто тут самый ценный навык агента — не сказать что-то умное, а вовремя заткнуться.
  • ❤ 35
  • 🔥 17
  • 👍 12
  • 🐳 2
  • ❤‍🔥 1
  • 🤩 1
  • 🙏 1
More from @vikulin_ai
  1. Sep 21, 2026Кому можно вайбкодить и как это делать Управление AI-агентами очень похоже на управление л…
  2. Sep 16, 2026Кто управляет разработкой AI-проекта Несколько лет назад во время очередного релиза я поня…
  3. Sep 8, 2026Всеобъемлющая статья про инференс LLM Многие у меня спрашивают, как посчитать GPU и как по…
  4. Aug 30, 2026Как стать AI-native компанией AI всегда был гонкой инфраструктуры. Если вы хотите крутые A…
  5. Aug 25, 2026Первый обзор научной статьи в этом канале Я не фанат читать свежие статьи. Сам когда-то за…
  6. Aug 18, 2026Вам LLM побыстрее или подешевле? Выберите только одно Почему-то во всех командах, где я ра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →