🆕 На этой неделе Anthropic выпустили две большие новости.
16 апреля — Claude Opus 4.7, новая флагманская модель, которая обошла GPT-5.4 и Gemini 3.1 Pro на бенчмарках по agentic coding и scaled tool use. +13% на 93-task coding benchmark относительно 4.6, изображения до 2576 px по длинной стороне, новый уровень усилий xhigh и task budgets в API, команда
/ultrareview в Claude Code. Цена без изменений — $5/$25 за MTok.17 апреля — Claude Design от Anthropic Labs (VentureBeat): новый product line для дизайна, слайдов, прототипов и one-pagers, powered by Opus 4.7. Читает codebase и design-файлы команды, извлекает цвета, типографику, компоненты — и применяет их автоматически. Экспорт в PDF, PPTX, HTML или прямо в Canva.
📰 Подробнее об этих и других AI-событиях первой половины апреля — в новостном дайджесте.
🔗 Обе новости — про агентов. Opus 4.7 заточен под long-running задачи и agentic coding, Claude Design оркестрирует связку «дизайн → прототип → production code» внутри одной сессии. И там, и там за кадром остаётся то, что делает агентов в принципе работоспособными — обвязка. Именно про неё я и хочу написать.
Подготовил классический long read и гамифицированный вариант с тестами. А ниже краткие тезисы.
⚙️ Обвязка агента: почему инфраструктура важнее модели ?
OpenAI в феврале 2026 опубликовали отчёт об эксперименте команды Frontier Products: 5 месяцев, команда из 3 инженеров, выросшая до 7, с запретом писать код вручную, Codex-агенты в качестве исполнителей. Итог: ~1 млн строк кода, 1500 pull requests, ни одной строки, написанной человеком — включая файл AGENTS.md, который написал сам агент. Throughput: 3.5 PR на инженера в день.
Ключевой вывод главного инженера Райана Лополо: «Agents aren't hard; the Harness is hard». Работа инженеров сводилась к проектированию среды, формулированию намерений и созданию feedback-петель.
🔁 Три эпохи инженерии с LLM
▪️ 2022–2024 — Prompt Engineering: правильные слова в правильном порядке
▪️ 2025 — Context Engineering: термин ввёл Андрей Карпати, развил Anthropic. Не «правильные слова», а правильная конфигурация контекста в каждый момент времени
▪️ 2026 — Harness Engineering: термин кристаллизовал Митчелл Хашимото. Включает оба уровня плюс всю инфраструктуру — оркестрацию, состояние, ошибки, верификацию, безопасность
💰 $2B за обвязку
Столько Meta заплатила за Manus в декабре 2025. Не за модель, а за пять итераций перестройки обвязки за шесть месяцев — каждый раз с убиранием сложности (тезисы анонса здесь). Сложные определения инструментов стали общим shell execution, «management agents» — простыми structured handoffs. Инженерный опыт, который нельзя скачать с Hugging Face.
📊 Что разобрал в статье ?
1️⃣ Три эпохи инженерии с LLM и как менялись подходы к работе с моделями
2️⃣ Анатомия production-обвязки — все 13 слоёв: петля оркестрации, сборка промпта, tool layer, memory system, управление контекстом, state management, error handling, observability и другие
3️⃣ Meta-Harness — алгоритм автоматической оптимизации обвязки, который достиг 76.4% pass rate на TerminalBench-2 с Claude Opus 4.6 и превзошёл hand-designed системы
4️⃣ Десять ключевых инженерных дилемм: тонкая или толстая обвязка, минимализм инструментов vs полный арсенал, permissive vs restrictive права, harnessability кодовой базы, управление энтропией
5️⃣ Коэволюция модель ↔️ обвязка: как обвязка становится источником обучающего сигнала для следующих версий моделей (через детекцию model drift на длинных задачах)
🎮 Что в гамифицированной версии ?
Квизы, карточки и сценарии, где можно попробовать разные архитектурные решения и посмотреть, как они влияют на поведение агента. Формат для тех, кто предпочитает разбираться через практику.
🏗 Ключевой принцип: rippable harness
Обвязка — это строительные леса. Без них не построить здание, но как только здание готово — леса снимают. Принцип «rippable harness» (Anthropic, LangChain): проектировать каждый компонент так, чтобы его можно было убрать, когда следующая модель научится делать это сама.
@llm_notes @MAX
#harness #agents #llm