TGViewer
Заметки LLM-энтузиаста Заметки LLM-энтузиаста @llm_notes · 1.01K subscribers
Post #303 844
Agentic Harness Deep Dive и текущие новости

🆕 На этой неделе Anthropic выпустили две большие новости.


16 апреля — Claude Opus 4.7, новая флагманская модель, которая обошла GPT-5.4 и Gemini 3.1 Pro на бенчмарках по agentic coding и scaled tool use. +13% на 93-task coding benchmark относительно 4.6, изображения до 2576 px по длинной стороне, новый уровень усилий xhigh и task budgets в API, команда /ultrareview в Claude Code. Цена без изменений — $5/$25 за MTok.

17 апреля — Claude Design от Anthropic Labs (VentureBeat): новый product line для дизайна, слайдов, прототипов и one-pagers, powered by Opus 4.7. Читает codebase и design-файлы команды, извлекает цвета, типографику, компоненты — и применяет их автоматически. Экспорт в PDF, PPTX, HTML или прямо в Canva.

📰 Подробнее об этих и других AI-событиях первой половины апреля — в новостном дайджесте.

🔗 Обе новости — про агентов. Opus 4.7 заточен под long-running задачи и agentic coding, Claude Design оркестрирует связку «дизайн → прототип → production code» внутри одной сессии. И там, и там за кадром остаётся то, что делает агентов в принципе работоспособными — обвязка. Именно про неё я и хочу написать.

Подготовил классический long read и гамифицированный вариант с тестами. А ниже краткие тезисы.

⚙️ Обвязка агента: почему инфраструктура важнее модели ?

OpenAI в феврале 2026 опубликовали отчёт об эксперименте команды Frontier Products: 5 месяцев, команда из 3 инженеров, выросшая до 7, с запретом писать код вручную, Codex-агенты в качестве исполнителей. Итог: ~1 млн строк кода, 1500 pull requests, ни одной строки, написанной человеком — включая файл AGENTS.md, который написал сам агент. Throughput: 3.5 PR на инженера в день.

Ключевой вывод главного инженера Райана Лополо: «Agents aren't hard; the Harness is hard». Работа инженеров сводилась к проектированию среды, формулированию намерений и созданию feedback-петель.

🔁 Три эпохи инженерии с LLM


▪️ 2022–2024 — Prompt Engineering: правильные слова в правильном порядке
▪️ 2025 — Context Engineering: термин ввёл Андрей Карпати, развил Anthropic. Не «правильные слова», а правильная конфигурация контекста в каждый момент времени
▪️ 2026 — Harness Engineering: термин кристаллизовал Митчелл Хашимото. Включает оба уровня плюс всю инфраструктуру — оркестрацию, состояние, ошибки, верификацию, безопасность

💰 $2B за обвязку

Столько Meta заплатила за Manus в декабре 2025. Не за модель, а за пять итераций перестройки обвязки за шесть месяцев — каждый раз с убиранием сложности (тезисы анонса здесь). Сложные определения инструментов стали общим shell execution, «management agents» — простыми structured handoffs. Инженерный опыт, который нельзя скачать с Hugging Face.

📊 Что разобрал в статье ?

1️⃣ Три эпохи инженерии с LLM и как менялись подходы к работе с моделями
2️⃣ Анатомия production-обвязки — все 13 слоёв: петля оркестрации, сборка промпта, tool layer, memory system, управление контекстом, state management, error handling, observability и другие
3️⃣ Meta-Harness — алгоритм автоматической оптимизации обвязки, который достиг 76.4% pass rate на TerminalBench-2 с Claude Opus 4.6 и превзошёл hand-designed системы
4️⃣ Десять ключевых инженерных дилемм: тонкая или толстая обвязка, минимализм инструментов vs полный арсенал, permissive vs restrictive права, harnessability кодовой базы, управление энтропией
5️⃣ Коэволюция модель ↔️ обвязка: как обвязка становится источником обучающего сигнала для следующих версий моделей (через детекцию model drift на длинных задачах)

🎮 Что в гамифицированной версии ?

Квизы, карточки и сценарии, где можно попробовать разные архитектурные решения и посмотреть, как они влияют на поведение агента. Формат для тех, кто предпочитает разбираться через практику.

🏗 Ключевой принцип: rippable harness

Обвязка — это строительные леса. Без них не построить здание, но как только здание готово — леса снимают. Принцип «rippable harness» (Anthropic, LangChain): проектировать каждый компонент так, чтобы его можно было убрать, когда следующая модель научится делать это сама.

@llm_notes @MAX

#harness #agents #llm
Anthropic Introducing Claude Opus 4.7 Our latest model, Claude Opus 4.7, is now generally available. Opus 4.7 is a notable improvement on Opus 4.6 in advanced software engineering, with particular gains on the most difficult tasks.
  • 👍 10
  • ❤ 6
  • ❤‍🔥 3
  • 🤡 1
More from @llm_notes
  1. Sep 12, 2026Cronjob Response: Мониторинг анонсов reset от лидера Codex (job_id: 7a5e133998e4) --------…
  2. Sep 12, 2026Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сб…
  3. Aug 25, 2026Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра Завтра, 26 авг…
  4. Aug 25, 2026Grok Bot против Hermes Agent: два подхода к одной задаче Коллеги, добрый вечер! Скорее все…
  5. Jul 27, 2026Claude Opus 5: почти Fable за половину цены Коллеги, всем привет! 24 июля Anthropic выпуст…
  6. Jul 1, 2026🔓🚀 Возвращение Fable 5 и появление Sonnet 5 Anthropic за сутки закрыла историю с приоста…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →