Модель управляемого риска: подбираем AI-агента под свои нервы
В разработке агентов, как и в инвестициях, есть связка риск/профит. За потенциальную выгоду мы платим риском, который берем на себя.
У AI-агентов обе величины сильно зависят от автономности. Система, где LLM в один промпт суммаризует диалог с клиентом — низкая автономность. Это и не очень рискованно, но профит ограничен. Автономный агент с доступом к CRM и возможностью отправить клиентам email — это уже совсем другая история. Потенциальный эффект выше, но и риск резко возрастает. Это удобно визуализировать на графике риск/профит (см. картинку).
Разберем, как разные архитектуры агентов ложатся в эту кривую — и как по этому графику выбрать архитектуру под вашу задачу. Начнем с архитектур.
Контролируемый рост риска (LLM-workflow)
Самый предсказуемый вариант — фиксированная цепочка промптов, то есть оркестрация LLM-workflow (см. пост про орестрации).
Все шаги прописаны заранее, у системы почти нет свободы “уйти не туда”. Каждую ветку можно отдельно отладить и измерить. Такая система прозрачна и контролируема. На этом участке кривой можно довольно предсказуемо наращивать ценность: добавлять новые узлы в граф, расширять логику, улучшать покрытие кейсов. Риск тоже растет, но управляемо.
Взрыв риска (автономный агент)
Но бесконечно растить workflow не получится: в какой-то момент сложность начинает съедать команду разработки. Тогда возникает соблазн перейти к автономному агенту (например, ReAct или Plan-and-Execute) — и дать ему набор ограниченных инструментов.
В этот момент потенциальная ценность и риск одновременно подскакивают.И вместе с этим подскакивает нагрузка на команду, потому что теперь нужно управлять новым классом рисков: контроль доступов к тулам, защита от prompt injection, observability и тд). Иначе разработка быстро превращается в гадание на таро (долбанет, или пронесет?).
Граница текущей технологии (переизбыток тулов)
Дальше наступает момент, когда дополнительная автономность перестает окупаться. Инструментов становится все больше, они сложнее, контекст длиннее, а модель начинает чаще тупить и галлюцинировать. Вы подходите к границе, которую текущие LLM еще могут выдержать. Вселенная как будто говорит: “Остановись”.
Автономность вредит (агент из телеграм-каналов)
Модель настолько тупит, что с ростом автнономности качество уже деградирует. Надо было послушать вселенную в прошлом пункте.
Концепция интересная, делать то что?
Самое важное: архитектуру AI-системы нужно подбирать под риск, который вы способны контролировать, а не под максимальный профит, который она теоретически может дать. Второе: каждая новая капля автономности требует дополнительных усилий на контроль риска.
Отсюда универсальное правило: начинайте с минимальной автономности, которая может решить задачу. Например: один вызов к LLM → затем цепочка промптов → затем агент → затем новые инструменты.
И на каждом шаге задавайте два вопроса:
1) Сильно ли растет качество?
Если нет — значит, вы уже уперлись в предел, и дальше усложнять систему нет смыла. Хорошая новость, что во многих задачах низкорисковой архитектуры вполне достаточно. Не везде нужен мега-агент.
2) Хватает ли у вас ресурсов контролировать этот риск? Оценивать качество, дебажить сбои, безопасно поддерживать продукт в работе. У разных компаний разная терпимость к риску. Если вы дикий стартап, у которого завтра кончатся деньги, вы более толерантны к риску. Тогда вам нужно меньше инфры для контроля.
Я легко могу собрать демку агента с полным доступом к компьютеру, чтобы он мне создавал регулярные напоминалки полить цветы. Но я потом буду плохо спать по ночам.
И тут возникает логичный вопрос: а оно того стоило?
Post #124
4.72K

- ❤ 21
- 🔥 16
- 👍 11
- ❤🔥 3
- 🙏 2
- 👏 1
- 🤩 1
- 🐳 1