Про наблюдаемость AI-агентов и infra.conf 2026
Итак, у вас в компании появились AI-агенты. В один прекрасный летний вечер вам звонит руководитель и говорит, что в продакшене взбесился один важный агент и делает не пойми что. Ваши действия?
Не, серьезно, как вы будете дебажить работу этого AI-агента?
- Ок, наверно посмотрите на его логи. А в логах треш и угар: все промпты, ответы модели, вызовы и ответы тулов в километровых json-ах. Причем часть логов от тулов вообще лежит в другой системе мониторинга (их же делала другая команда). Удачи разобраться.
- Хотя почему сразу логи? Кто-то сначала пойдет смотреть метрики. И даже увидит там немало интересных данных - расход токенов, кол-во ошибок, тайминги. Вот только метрики оказались очень шумные, показатели сильно прыгают. Оно и понятно, ведь для одних задач агенту нужно сделать 5 шагов, а для других 25 - а метрики замеряются одни и те же. Да и конкретный кейс дебажить по агрегированным метрикам не получится.
- Ладно, у вас же есть трейсы (есть же?). И вот по трейсам что-то начинает проясняться. Вы видите, что было в контексте у агента, что ему ответили тулы, и вам даже не надо парсить глазами полотно json'ов. По трейсам вы видите, что один из тулов ответил ошибкой, а системный промпт вашего агента не подразумевал, что данных от этого тула может не быть, они слишком нужные. Вот все и поехало. Дело раскрыто.
На самом деле тема наблюдаемости и мониторинга AI-агентов намного шире и сложнее этого кейса. И ее роль растет с ростом внедрения AI в компаниях. И в последний год я неплохо закопался в нее, а 4 июня и вовсе буду рассказывать доклад на тему "Особенности observability LLM-приложений и агентов" на infra.conf'26. На большой инфраструктурной конференции от Яндекса. Участие бесплатное, но надо зарегистрироваться.
Приходите или подключайтесь послушать (не только меня, конечно)!
P.S. Для канала сделаю пару постов с саммари и полезной выжимкой.
Post #100
578

- 🔥 10
- ❤ 3
- 👍 3