TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4763 2.47K
Research Insights Made Simple #26: как строить работающие evals для AI-агентов (Рубрика #Agents)

Как понять, что AI-агент действительно готов к production? Красивый ответ и даже высокий "pass rate" показывают только финал одного запуска. Агент мог подсмотреть решение, выбрать опасный путь, нарушить права или рассыпаться при повторном прогоне.

В пятницу, 31 июля, в 16:00 МСК пройдет прямой эфир "Research Insights Made Simple" вместе с Евгением Сергеевым - Engineering Director в Flow Health с двадцатилетним опытом разработки и управления инженерными командами. Будем разбирать, как превратить evals из разовой проверки ответа в воспроизводимую инженерную систему.

Минимальная единица такой системы - воспроизводимый эпизод (replayable episode): замороженное исходное состояние, входные данные, контракт агента, скрытая проверка, трасса действий и критерий выпуска. Для кода это может быть commit до PR и hidden tests; для архитектуры - требования, ограничения и проверка исполнимости решения; для data platform - snapshot данных, lineage и инварианты.

Обсудим:

- Почему оценивать нужно всю агентную систему, а не только модель;
- Как заморозить исходное состояние и не дать агенту подсмотреть будущее решение;
- Что фиксировать в контракте: инструменты, права, сеть, время и бюджет;
- Зачем проверять не только результат, но и траекторию действий;
- Почему одного успешного запуска недостаточно и нужны повторные прогоны;
- Как собрать production scorecard из результата, траектории, стоимости, безопасности и принятия человеком;
- Как связать offline-evals с реальными production outcomes и превратить их в release gates.

Для меня главный вывод такой: устойчивое качество создаёт не одна метрика и не конкретная модель. Нужен собственный каталог реальных задач, воспроизводимые проверки и понятный критерий, после которого новой версии агента действительно можно доверить работу.

#AI4SDLC #AI #Agents #Evals #Engineering #Metrics #Research
YouTube Разбираем построение работающих evals Как понять, что AI-агент действительно готов к production? Красивый ответ и даже высокий "pass rate" показывают только финал одного запуска. Агент мог подсмотреть решение, выбрать опасный путь, нарушить права или рассыпаться при повторном прогоне. В пятницу…
  • ❤ 7
  • 🔥 2
  • 👍 1
More from @book_cube
  1. Oct 4, 2026Один дизайнер и сотни материалов (Рубрика #AI) В этом видео «One Designer + AI. Hundreds o…
  2. Oct 4, 20263 AImigo S1E8: AI-native компания — материалы выпуска (Рубрика #AI4SDLC) Собрал материалы…
  3. Oct 4, 2026В процессе подготовки к переезду начал разбирать книжки и освобождать свою библиотеку. Нат…
  4. Oct 4, 2026Stanford CME295, лекция 1: как текст становится вычислениями (Рубрика #AI) Первая лекция к…
  5. Oct 3, 2026Камил видит руками (Рубрика #ForKids) Читаю своему пятилетнему сыну Кириллу перед сном эту…
  6. Oct 3, 2026Где деньги в своих данных: цены, клиенты, ассортимент — материалы второго выпуска (Рубрика…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →