TGViewer
Trashchenkov Trashchenkov @gigatrash · 769 subscribers
Post #243 522
🔗 LangChain продолжают тему автоматизации разработки эвалов

В июле я уже писал про их скилл eval-engineering, который помогает кодинговому агенту превращать реальные трейсы в оценочные задачи. Теперь LangChain подробнее расписали, как они масштабируют этот процесс.

Чтобы полноценно проверить возможности агента, нужны кейсы со входными данными, средой с инструментами и состоянием, а также способ проверить результат. И таких кейсов нужны десятки и сотни, чтобы покрыть разные сценарии и надёжно оценивать качество. Всё это долго и дорого собирать руками.

Для упрощения этого процесса LangChain вводят промежуточное представление — Task Spec. На основе реальных трейсов сначала выделяют конкретный пользовательский сценарий и описывают его в текстовом виде: что должен сделать агент, в какой среде он будет работать и как оценить итог.

После ревью человеком запускается Spec2Task: кодинговый агент превращает Task Spec в готовую исполняемую задачу в формате Harbor — собирает окружение, данные и проверку.

Параллельно формируется World Spec — общая база знаний для всего бенчмарка: схемы API, правила генерации данных, способы проверки, вспомогательные скрипты и другие общие для множества задач вещи.

World Spec наращивают итеративно. Сначала вместе с кодинговым агентом создают одну полноценную задачу и на её основе формируют первую версию. Затем проверяют её на следующих задачах и добавляют недостающие знания. Когда World Spec становится достаточно полным, процесс можно масштабировать:

трейсы → Task Specs → ревью человеком → Spec2Task → готовые задачи

Готовую задачу ещё прогоняют реальными агентами и смотрят их траектории. Так можно обнаружить проблемы среды — например, случайные подсказки, позволяющие угадать ответ вместо полноценного решения. А чтобы проверить сложность, задачу запускают на моделях разного уровня и при необходимости дорабатывают.

Но мне здесь больше всего нравится общая идея. LangChain рассматривают такой бенчмарк не только как инструмент оценки. Они выделяют три сценария его использования: evaluate — измерять качество, hill-climb — оптимизировать промпты и харнесс, post-train — дообучать саму модель. Разумеется, для обучения и независимой оценки при этом нужны разные задачи или сплиты.

То есть в идеале получается непрерывный цикл: собираем новые реальные трейсы → превращаем их в воспроизводимые задачи → оцениваем и улучшаем агента → снова смотрим, что происходит в проде.
Telegram Trashchenkov 🔗 LangChain выпустили скилл для разработки эвалов В марте я уже писал про официальные скиллы LangChain, которые можно подключить к любому кодинговому агенту. На тот момент их было 11, с тех пор количество увеличилось до 15, в том числе eval-engineering,…
  • 👍 10
  • 🔥 4
More from @gigatrash
  1. Oct 5, 2026🎬 Эксперимент: шортсы про ИИ, которые делает агент Последние пару месяцев я веду эксперим…
  2. Sep 23, 2026⚡ Jev — модель для быстрых решений В последние дни разработчики активно обсуждают Jev от T…
  3. Sep 22, 2026сам сделяль😂 Агенты - это новый пролетариат😆
  4. Sep 10, 2026🧠 GigaChat 3.5 Reasoning У GigaChat появилась первая модель с полноценным рассуждением —…
  5. Sep 7, 2026🔗 LangChain перешёл на новый MCP Еще в конце июля вышла спецификация MCP 2026-07-28, в ко…
  6. Sep 1, 2026🪄 Оркестр магических тварей: приручаем ИИ-агента Модель мы уже выбрали. Но сама по себе я…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →