Как понять, что ваш агент — не нейрослоп?
Недавно столкнулся с ситуацией: агент, которого добавили в один из флоу с тикетами, не помогал, а скорее мешал работе.
Я пришел с претензией в духе: “текущий подход никуда не годится”. В ответ получил справедливый вопрос: “окей, а как сделать лучше? Чего агенту не хватает до нормального решения?”
В итоге собрались с ребятами пообсуждать, а какие у меня есть идеи по их агенту.
Одна из идей была простая: собрать отдельную очередь размеченных тикетов. По сути — золотой набор, где заранее понятно, какие флаги, оценки или действия мы ожидаем от агента.
Ребята быстро собрали и разметили такую очередь.
Дальше возник следующий вопрос: окей, размеченные тикеты есть. А что с ними делать?
Мы собрались еще раз и за пару часов накидали рабочее MVP:
— прогнать агента по всей размеченной очереди;
— получить оценку от LLM-судьи;
— получить предложения валидатора по улучшению промпта;
— почистить или обновить тикеты;
— снова прогнать агента;
— сохранить историю прогонов в отдельный тикет.
В итоге получился набор из четырех скриптов, которые может запускать любой участник команды. Не надо спорить на ощущениях — можно быстро проверять гипотезы на одной и той же выборке.
Важное требование:
агент, судья и валидатор должны быть из разных семейств моделей. Например: Claude, GPT и GLM/Kimi/DeepSeek. Это не убирает все проблемы оценки, но снижает риск того, что модель будет сама себе подыгрывать или переоценивать похожий стиль генерации.
Еще одно важное правило: золотые корзинки не должны протекать в промпт агента. Иначе мы не улучшаем агента, а просто учим его проходить конкретный тест.
Что получили в итоге?
За неделю прогонов и проверки гипотез команда пришла к версии агента, который уже нормально решает свою задачу и не мешает пользователям ошибками. Но главный результат даже не в этом.
Главный результат — появился воспроизводимый процесс оценки. Теперь качество агента можно обсуждать не в формате “мне кажется, он тупит”, а через конкретные прогоны, ошибки, регрессии и сравнение версий.
Вот это, кажется, и есть первый шаг от “нейрослопа” к нормальному инженерному инструменту.
Post #11
702

- ❤ 11
- 👍 6
- 🔥 1