TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #339 2
🛠 Отлаживать AI-агента нужно по шагам, а не по ответу

Четырёхэтапный процесс расследования инцидента может выдать убедительный, но неверный итог — и не показать, где именно возникла ошибка. В статье на Habr предлагают проверять такой пайплайн накопительно: запускать первый этап, затем первый и второй, и так далее, останавливаясь перед следующим.

Предыдущие этапы при этом работают вживую, а не подставляют заранее подготовленные результаты: иначе тест не поймает вариативность, с которой столкнётся следующий этап. Для каждого уровня заранее задают контрольные проверки — например, агент должен выбрать временной интервал или вызвать нужный инструмент с конкретными аргументами. К следующему этапу переходят после нескольких успешных прогонов; нужное число повторов зависит от возможных последствий ошибки.

Самый показательный сбой нашли не в агенте, а в оценщике. Он искал запрещённый шаблон в полном журнале и принимал его упоминание в инструкции за реально выполненное действие; проверки перевели на типизированные вызовы инструментов и их аргументы. Такой источник точнее отвечает на вопрос «что агент сделал», чем общий поток событий, где смешаны промпты, ответы модели и служебные записи.

Я бы считал контрольные проверки частью контракта этапа, а не просто тестами: если контракт сформулирован расплывчато, зелёный статус мало что доказывает. И даже проверка вызовов инструментов подтверждает только наблюдаемое поведение — правильность самого решения всё равно требует отдельной оценки.

#ИИагенты #Отладка #AgentOps #Наблюдаемость
More from @nairolenta
  1. Oct 9, 2026🚀 FRIDA Decisions переносит русскую классификацию с LLM на энкодер FRIDA Decisions от Сбе…
  2. Oct 9, 2026💰 Nous Research привлекла $90 млн на агентов для бизнеса Nous Research закрыла раунд Seri…
  3. Oct 9, 2026🛠 ИИ-агенты упираются в антибот-защиту сайтов, а не в модели Meta Muse больше не может пр…
  4. Oct 8, 2026🚀 Claude Haiku 5.5 сравнялась с Luna только по тарифу Anthropic выпустила Haiku 5.5 7 окт…
  5. Oct 8, 2026🛠 OpenAI добавила API для решений по тексту и изображениям 6 октября OpenAI выпустила Dec…
  6. Oct 8, 2026🚀 Musubi предлагает менять правила модерации без переобучения 6 октября Musubi представил…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →