TGViewer
Generative Ai Generative Ai @deeplearning_ru · 3.7K subscribers
Post #1185 1.06K

Forwarded from Всеволод Устинов (канал: ai, стартапы, пост-ирония)

Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами.

Схема такая:

planner → agent → evaluator

Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы.

1. Planner: верхний план и спринты

Planner получает короткий запрос и превращает его в структуру работы:

— что собираем
— какие большие части нужны
— в какой последовательности идти
— какие спринты должны получиться

Важная деталь: planner не расписывает всю техническую реализацию заранее.

Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы.

Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации.

2. Agent: сборка следующего спринта

Agent берёт следующий спринт и собирает фичу.

Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом.

Это главный механизм всей системы.

В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает.

Anthropic решает это через contract.

3. Contract: договорённость о готовом результате

Agent пишет: я соберу такую фичу, проверять её надо вот так.

Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку.

Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract.

Contract — это список конкретных проверяемых утверждений.

Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract.

Например, исходный запрос:

“сделай retro game maker”

А contract превращает его в конкретику:

— можно создать новый проект
— есть sprite editor
— есть play mode
— сохраняется состояние
— canvas работает корректно
— основные сценарии кликаются в браузере

В примере Anthropic для одного приложения получилось 27 contract criteria.

Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить.

Если критерии конкретные, он видит точную проблему.

4. Evaluator: жёсткая проверка через браузер

Evaluator — это отдельный агент-критик.

Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent.

Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция.

Agent собирает.
Evaluator атакует результат.

За счёт этого появляется нормальное давление на качество.

5. Финальный цикл

Итоговый процесс выглядит так:

1. planner разбивает задачу на спринты
2. agent берёт следующий спринт
3. agent и evaluator согласуют contract
4. agent строит
5. evaluator проверяет через браузер
6. agent чинит
7. цикл повторяется

С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку.

Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса.

6. Как собрать похожее самому

Нужны понятные примитивы:

— subagents для отдельных ролей
— Playwright / Chrome MCP для проверки интерфейса
— skills / rubrics для критериев качества
— auto mode / permissions для долгой автономной работы
— contract files для договорённости о “готово” до начала реализации



Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком.

Видео:
https://youtu.be/mR-WAvEPRwE
YouTube Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson Why self-evaluation is a trap and adversarial evaluator agents work better; why context compaction doesn't cure coherence drift but structured handoffs do; how to decompose work into testable sprint contracts; how to grade subjective output with rubrics an…
  • 🔥 3
  • ❤ 2
  • 🤔 1
More from @deeplearning_ru
  1. Sep 18, 2026Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3…
  2. Sep 17, 2026Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-…
  3. Sep 14, 2026Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническо…
  4. Sep 11, 2026Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с ро…
  5. Sep 10, 2026Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужи…
  6. Sep 9, 2026🛡 LLM, Guardrails и Zero Trust: вебинары о безопасной работе с ИИ ➡️ 15 сентября Как защи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →