🧪 Вышел пост Хамела Хусейна (Hamel Husain) про автоэвалы
Хамел не человек с улицы: 25 лет в ML, работал в Airbnb и GitHub. Сейчас консультирует компании по эвалам и ведёт курс по оценке ИИ-систем стоимостью какие-то жалкие 4200 долларов 😁
Автоэвалы — это системы, которые получают производственные трейсы агента и должны сами понять, что в его работе ломается: найти повторяющиеся проблемы и превратить их в автоматические проверки.
Хамел Хусейн использует в статье пример со 100 реальными диалогами пользователей с ИИ-агентом по аренде квартир. Доменный эксперт вручную нашёл в этих диалогах 39 ошибок, после чего разметку спрятали, а те же трейсы дали специализированным решениям LangSmith, Arize и Braintrust. Для сравнения их прогнали и через обычные кодинговые агенты — Codex, Droid и Claude Code.
Результат получился не особо впечатляющим. Arize AX Alyx и Braintrust Loop действительно нашли большую часть ошибок, но Codex, Droid и Claude Code показали вполне сопоставимые результаты. То есть специальная платформа для автоэвалов сама по себе какой-то особой магии не даёт.
А вот с LangSmith Engine вышло совсем неловко. Я уже писал, что LangChain представляет его как систему, которая сама изучает трейсы, находит проблемы, предлагает исправления и делает PR в код агента. В этом эксперименте Engine нашёл настолько мало ошибок, что его даже не включили в итоговую таблицу. Вместо него пришлось использовать обычного чат-агента LangSmith, который справился заметно лучше.
Вывод у Хамела ожидаемый: автоэвалы не заменяют экспертную оценку. Агент может найти ошибки, пропущенные человеком, но даёт и ложные срабатывания, поэтому его выводы нужно проверять.
Есть и более фундаментальная проблема. Некоторые критерии невозможно полностью сформулировать заранее. Например, диалог может быть формально корректным, но не решать бизнес-задачу: клиент сказал, что дорого, а агент просто попрощался вместо работы с возражением.
В статье человеку предлагается размечать небольшие выборки, а агенту — распространить найденные критерии на остальные трейсы. Но и здесь остаётся дыра: в неразмеченных данных могут быть новые классы ошибок, которых в исходной выборке вообще не было. Агент их может так и не распознать.
Короче, автоэвалы пока не заменяют эксперта. Они расширяют охваты: человек находит и уточняет критерии, агент прогоняет их по большому массиву трейсов, после чего человек валидирует результаты.
Максимум покрытия даёт именно совместный просмотр человеком и агентом. А обещанный полностью автоматический цикл улучшения пока, похоже, остаётся больше маркетингом.
Post #233
555