TGViewer
ИИ пашет, Саша одобряет ИИ пашет, Саша одобряет @defendend_ai_dev · 659 subscribers
Post #26 636
ИИ пашет, Саша одобряет Корзинки качества или симуляция общения с агентом? Сейчас многие пытаются построить системы оценки качества AI-агентов: наборы кейсов, скоринги, ручную разметку, автопроверки, “корзинки качества”. Но насколько такие системы действительно отражают качество…
А может, стоит остановиться и переосмыслить систему качества агентов, подойдя к ней под другим углом?

Сегодня прочитал очень интересную и полезную статью про качество агентов и способы их оценки.

Статья: https://www.howtoeval.com/

Идея простая, но очень сильная: прежде чем строить сложную систему качества, вернитесь в самое начало и начните каждый день читать реальные диалоги вашего агента с пользователями.

Что делать?

Запускаем → наблюдаем → анализируем → улучшаем → повторяем.

Если у вас уже 1000+ диалогов в день, стоит вычитывать хотя бы часть из них, например 50-100 диалогов. Именно так можно увидеть узкие места, повторяющиеся ошибки и моменты, где агент начинает сыпаться.

Еще одна классная идея — научить агента говорить «я не знаю» в тех случаях, где он действительно не уверен. Один плохой или неточный ответ может убить доверие, а доверие критически важно при внедрении агентов в общение с людьми.

Потеряв доверие один раз, вернуть его к вашему агенту будет очень сложно.

Что еще полезно отслеживать кроме самих диалогов?

По сути, нужно строить возможность видеть всю цепочку работы агента: сообщение пользователя, ответ агента, вызовы инструментов, контекст, промежуточные шаги. Это помогает лучше понимать поведение агента и находить краевые случаи, где он ошибается.

Еще интересная мысль — попробовать «поговорить» с той же моделью, передав ей историю чата и контекст агента, и спросить, почему она дала именно такой ответ. Это не абсолютная правда, но часто очень сильная подсказка, которая помогает понять, на что модель опиралась и где могла неверно интерпретировать задачу.

И тут появляется важная идея: а что если качество агентов на первом этапе строить вокруг возможности взять конкретный диалог, завернуть его в контекст, обсудить с моделью проблемные моменты или даже переиграть поведение с определенного шага?

Будто это дает совершенно новый способ тестировать агентов не в вакууме, а через реальные ситуации.

А если агенты уже работают на тысячах пользователей?

Тем более. Анализ их поведения и общения — один из лучших инструментов для улучшения. Без этого агенты будут ошибаться, не до конца выполнять исходную задачу и постепенно терять доверие пользователей.

Да, это может быть нудно. Но кажется, что такая работа полностью окупается: вы начинаете по-настоящему понимать поведение своего агента и получаете много конкретных идей, как его улучшить.

В общем, советую полностью прочитать статью и не гнаться за быстрым решением. Иногда полезнее остановиться и сначала понять, какое решение действительно нужно.

Будто в мире с ИИ мы стали слишком много бежать. Но, возможно, сейчас самое время остановиться и переосмыслить многое.
  • 👍 6
  • 🔥 3
More from @defendend_ai_dev
  1. Sep 23, 2026photo post
  2. Sep 23, 2026еще и на опус, не помню чтобы хоть раз антропики давали такой, кнопочный
  3. Sep 22, 2026а вот и ресет подарили
  4. Sep 22, 2026👆👆👆 Не много про будни от Лехи, а так в общем попробовал уже opus 5.5, самое замечатель…
  5. Sep 22, 2026Еще немного будней разработчиков агентов Представьте у вас полно агентов в разных странах.…
  6. Sep 22, 2026Новый бенч подвезли
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →