TGViewer
PRO продукты и системы | Иннокентий Бодров PRO продукты и системы | Иннокентий Бодров @spherical_analyst · 2.62K subscribers
Post #1237 461
Наблюдаемость не доказывает, что агент прав

200 OK означает, что запрос завершился. Для AI-агента это почти ничего не говорит о результате.

В разборе Gallopher про наблюдаемость агентных систем разведены три уровня: инфраструктура сработала, агент принял решение, пользовательский процесс пришёл к нужному исходу. Обычный мониторинг лучше всего видит первый. Пользовательский исход часто остаётся за кадром.

Но я бы добавил одну ловушку. Можно подробно записать каждый шаг агента и всё равно проверять не то.

Если критерии оценки появились после реализации или их породил тот же агентный контур, неверная посылка может пройти через решение, результат и проверку. Трасса будет полной. Тесты будут зелёными. Пользователь получит не то, что ему было нужно.

Поэтому я забираю из статьи в TDPD не новый гейт, а отдельный контракт доказательства запуска. Для каждого значимого прогона должны быть видны:

- версии модели, инструкций, инструментов и доступа;
- источники контекста и путь принятого решения;
- вызовы инструментов, разрешения и побочные эффекты;
- проверки результата и связь с UAT.

Если обязательной части трассы нет, это не PASS, а INCOMPLETE. Для рискованного действия — остановка. При этом сама трасса не становится судьёй: мы фиксируем критерии приёмки до реализации, а UAT оставляем отдельной человеческой проверкой исходного замысла.

Исходный материал: Designing Observable AI Systems.
Linkedin Designing Observable AI Systems We had an agent complete its workflow successfully and still make the wrong decision. From the application’s perspective, the request completed.
More from @spherical_analyst
  1. Oct 1, 2026Вчера сходил на SBC Summit в Лиссабоне и несколько раз ловил себя на мысли: а я точно в По…
  2. Sep 29, 2026Пять проверок: перед вами AI-инструмент или уже рабочий контур? Последнее время вижу много…
  3. Sep 28, 2026Post #1268
  4. Sep 25, 2026Post #1265
  5. Sep 24, 2026Угадайте, что взломали агенты OpenAI на этот раз? Ни за что не догадаетесь. Австралию 🙃 П…
  6. Sep 24, 2026Не, я только сегодня написал, что агенты ещё не готовы покорять мир, как они решили со мно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →