TGViewer
Trashchenkov Trashchenkov @gigatrash · 769 subscribers
Post #233 555
🧪 Вышел пост Хамела Хусейна (Hamel Husain) про автоэвалы

Хамел не человек с улицы: 25 лет в ML, работал в Airbnb и GitHub. Сейчас консультирует компании по эвалам и ведёт курс по оценке ИИ-систем стоимостью какие-то жалкие 4200 долларов 😁

Автоэвалы — это системы, которые получают производственные трейсы агента и должны сами понять, что в его работе ломается: найти повторяющиеся проблемы и превратить их в автоматические проверки.

Хамел Хусейн использует в статье пример со 100 реальными диалогами пользователей с ИИ-агентом по аренде квартир. Доменный эксперт вручную нашёл в этих диалогах 39 ошибок, после чего разметку спрятали, а те же трейсы дали специализированным решениям LangSmith, Arize и Braintrust. Для сравнения их прогнали и через обычные кодинговые агенты — Codex, Droid и Claude Code.

Результат получился не особо впечатляющим. Arize AX Alyx и Braintrust Loop действительно нашли большую часть ошибок, но Codex, Droid и Claude Code показали вполне сопоставимые результаты. То есть специальная платформа для автоэвалов сама по себе какой-то особой магии не даёт.

А вот с LangSmith Engine вышло совсем неловко. Я уже писал, что LangChain представляет его как систему, которая сама изучает трейсы, находит проблемы, предлагает исправления и делает PR в код агента. В этом эксперименте Engine нашёл настолько мало ошибок, что его даже не включили в итоговую таблицу. Вместо него пришлось использовать обычного чат-агента LangSmith, который справился заметно лучше.

Вывод у Хамела ожидаемый: автоэвалы не заменяют экспертную оценку. Агент может найти ошибки, пропущенные человеком, но даёт и ложные срабатывания, поэтому его выводы нужно проверять.

Есть и более фундаментальная проблема. Некоторые критерии невозможно полностью сформулировать заранее. Например, диалог может быть формально корректным, но не решать бизнес-задачу: клиент сказал, что дорого, а агент просто попрощался вместо работы с возражением.

В статье человеку предлагается размечать небольшие выборки, а агенту — распространить найденные критерии на остальные трейсы. Но и здесь остаётся дыра: в неразмеченных данных могут быть новые классы ошибок, которых в исходной выборке вообще не было. Агент их может так и не распознать.

Короче, автоэвалы пока не заменяют эксперта. Они расширяют охваты: человек находит и уточняет критерии, агент прогоняет их по большому массиву трейсов, после чего человек валидирует результаты.

Максимум покрытия даёт именно совместный просмотр человеком и агентом. А обещанный полностью автоматический цикл улучшения пока, похоже, остаётся больше маркетингом.
Parlance Labs Do Automated Evals Work? – Parlance Labs We compared human-annotated traces against automated eval systems. Here’s what we found.
  • 👍 6
  • ❤ 3
  • 🔥 3
More from @gigatrash
  1. Oct 5, 2026🎬 Эксперимент: шортсы про ИИ, которые делает агент Последние пару месяцев я веду эксперим…
  2. Sep 23, 2026⚡ Jev — модель для быстрых решений В последние дни разработчики активно обсуждают Jev от T…
  3. Sep 22, 2026сам сделяль😂 Агенты - это новый пролетариат😆
  4. Sep 10, 2026🧠 GigaChat 3.5 Reasoning У GigaChat появилась первая модель с полноценным рассуждением —…
  5. Sep 7, 2026🔗 LangChain перешёл на новый MCP Еще в конце июля вышла спецификация MCP 2026-07-28, в ко…
  6. Sep 1, 2026🪄 Оркестр магических тварей: приручаем ИИ-агента Модель мы уже выбрали. Но сама по себе я…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →