TGViewer
ИИ пашет, Саша одобряет ИИ пашет, Саша одобряет @defendend_ai_dev · 659 subscribers
Post #11 702
Как понять, что ваш агент — не нейрослоп?

Недавно столкнулся с ситуацией: агент, которого добавили в один из флоу с тикетами, не помогал, а скорее мешал работе.

Я пришел с претензией в духе: “текущий подход никуда не годится”. В ответ получил справедливый вопрос: “окей, а как сделать лучше? Чего агенту не хватает до нормального решения?”

В итоге собрались с ребятами пообсуждать, а какие у меня есть идеи по их агенту.

Одна из идей была простая: собрать отдельную очередь размеченных тикетов. По сути — золотой набор, где заранее понятно, какие флаги, оценки или действия мы ожидаем от агента.

Ребята быстро собрали и разметили такую очередь.

Дальше возник следующий вопрос: окей, размеченные тикеты есть. А что с ними делать?

Мы собрались еще раз и за пару часов накидали рабочее MVP:

— прогнать агента по всей размеченной очереди;
— получить оценку от LLM-судьи;
— получить предложения валидатора по улучшению промпта;
— почистить или обновить тикеты;
— снова прогнать агента;
— сохранить историю прогонов в отдельный тикет.

В итоге получился набор из четырех скриптов, которые может запускать любой участник команды. Не надо спорить на ощущениях — можно быстро проверять гипотезы на одной и той же выборке.

Важное требование:

агент, судья и валидатор должны быть из разных семейств моделей. Например: Claude, GPT и GLM/Kimi/DeepSeek. Это не убирает все проблемы оценки, но снижает риск того, что модель будет сама себе подыгрывать или переоценивать похожий стиль генерации.

Еще одно важное правило: золотые корзинки не должны протекать в промпт агента. Иначе мы не улучшаем агента, а просто учим его проходить конкретный тест.

Что получили в итоге?

За неделю прогонов и проверки гипотез команда пришла к версии агента, который уже нормально решает свою задачу и не мешает пользователям ошибками. Но главный результат даже не в этом.

Главный результат — появился воспроизводимый процесс оценки. Теперь качество агента можно обсуждать не в формате “мне кажется, он тупит”, а через конкретные прогоны, ошибки, регрессии и сравнение версий.

Вот это, кажется, и есть первый шаг от “нейрослопа” к нормальному инженерному инструменту.
  • ❤ 11
  • 👍 6
  • 🔥 1
More from @defendend_ai_dev
  1. Sep 23, 2026photo post
  2. Sep 23, 2026еще и на опус, не помню чтобы хоть раз антропики давали такой, кнопочный
  3. Sep 22, 2026а вот и ресет подарили
  4. Sep 22, 2026👆👆👆 Не много про будни от Лехи, а так в общем попробовал уже opus 5.5, самое замечатель…
  5. Sep 22, 2026Еще немного будней разработчиков агентов Представьте у вас полно агентов в разных странах.…
  6. Sep 22, 2026Новый бенч подвезли
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →