TGViewer
Channel Public Channel
Книжный куб

Книжный куб

@book_cube

Канал Александра Поломодова (@apolomodov), cto & technical fellow.

https://polomodov.tech - сайт со всеми материалами
youtube.com/@tellmeabouttech - канал со всеми видео
Subscribers
15.7K
Photos
3K
Videos
6
Links
2.5K

Showing posts older than #4844 · Back to latest

Older Posts 19 shown
Post #4843 2.17K
Evolution of Agentic Surfaces: harness становится инфраструктурой (Рубрика #AI4SDLC)

Посмотрел доклад команды Applied AI из Anthropic — Gagan Bhat и Isabella Kai He — про эволюцию агентных поверхностей: от Messages API до Claude Managed Agents. Тезис, который я забираю: harness кодирует предположения о том, чего модель пока не умеет, поэтому это самая скоропортящаяся часть агентного стека. Доклад удачно собирает темы последних дней канала: минус 80% промпта Claude Code от Boris Cherny, облачные агенты Cursor и harness-подход Константина Крестникова,

Сюжет — три поколения поверхностей
1️⃣ Сначала Messages API: токены на входе, токены на выходе, а агентный цикл каждый писал сам
2️⃣ Потом Claude Agent SDK, упаковавший harness Claude Code в библиотеку: цикл, инструменты и файловая система приезжают в коробке, но hosting, изоляция, credentials и наблюдаемость остаются на вас
3️⃣ Теперь Claude Managed Agents: Anthropic забирает production-обвязку целиком, а вам остаются задача, контекст и доменная экспертиза. Граница «что моё» продолжает сжиматься — тот же сдвиг, что Джош Ма описывал для Cursor, только с другой стороны прилавка.

Лучшая иллюстрация скоропортящихся предположений — context anxiety у Sonnet 4.5: модель нервничала при приближении к границе контекста и сворачивала работу раньше времени (в Cognition наблюдали то же самое), поэтому команда встроила в обвязку сбросы контекста. Opus 4.5 вышел уже без этого поведения — и костыль превратился в чистый оверхед: лишняя латентность и некорректно сбрасываемый кеш. Когда модель сдвигается, а harness нет, обвязка начинает деградировать агента. Это то же явление, что и у Boris Cherny с системным промптом, только на уровне архитектуры, а не текста.

Инженерно самое интересное — разделение «мозга» и «рук». Пока агентный цикл и sandbox жили в одном контейнере, модель не могла начать рассуждать до конца сборки среды, а падение любой половины убивало агента целиком. После разделения reasoning стартует сразу, контейнер поднимается параллельно: по замерам команды, время до первого токена сократилось на 60% в медиане и более чем на 90% в P95. Отказы становятся восстановимыми: умерший sandbox пересоздаётся, умерший «мозг» поднимается из durable session log. Сам журнал сессии работает трижды: наблюдаемость, возврат выброшенных из контекста кусков и периодический batch-процесс dreaming, который переписывает память агента, чтобы следующие сессии начинались умнее.

После инцидента OpenAI и Hugging Face отдельно отмечу security-часть: credentials живут в vault и расшифровываются только в момент выполнения инструмента — модель их не видит; сеть среды ограничена списком allowed hosts; для строгих контуров есть self-hosted sandboxes в собственном VPC и MCP tunnels, чтобы MCP-сервер не выходил в публичный интернет. Ещё из любопытного — outcomes: вы описываете рубрику успеха, а отдельный grader-агент перезапускает основного, пока критерии не выполнены. По сути это production-grade evals, встроенные прямо в runtime.

Финальный тезис авторов — harness стал ограничивающим фактором для того, что могут модели, — стоит читать с поправкой на рассказ о собственном продукте. Но мой вывод даже сильнее: обвязка перестаёт быть конкурентным преимуществом и становится скоропортящейся инфраструктурой, которую разумно арендовать. Своими стоит оставлять задачу, контекст, доменные знания и evals — слои, где живёт ваша ценность.

#AI4SDLC #AI #Agents #Architecture #PlatformEngineering #Evals #Engineering
YouTube Claude Managed Agents and Evolution of Agentic Surfaces — Gagan Bhat & Isabella Kai He, Anthropic Sonnet 4.5 developed what Anthropic's Applied AI team came to call context anxiety: approaching its context window limit, it would wrap work up early and stop with room to spare. They built context resets into the harness to compensate. Then Opus 4.5 shipped…
  • 👍 7
  • ❤ 2
  • ✍ 1
  • 🔥 1
Post #4842 2.35K
Code of Leadership S2E13: Что остаётся дефицитным, когда код становится дешёвым? (Рубрика #Management)

Что остаётся дефицитным, когда код становится дешёвым: инструменты, инженерное мышление или доверие между компанией и разработчиками?

В пятницу в 18:00 по мск в очередном прямом эфире подкаста Code of Leadership поговорим с Сергеем Бережным (veged.ru) — директором по взаимодействию с разработчиками Яндекса, CTO Яндекс Практикума и одним из соавторов методологии БЭМ. Сергей работает в Яндексе с 2005 года и прошёл путь от разработки интерфейсов до DevRel, open source и образования. Но разговор будет не про карьерную ретроспективу. Хочу понять, как техническое лидерство выходит за границы одной команды и проявляется в методологиях, платформах, работе с сообществом и публичной ответственности.

Обсудим:
- Зачем бизнесу DevRel и чем измерять его результат;
- Почему внутреннюю технологию стоит открывать миру и как выбирать проекты для open source
- Как разработка проходит путь от автодополнения к AI-агентам и harness-системам;
- Что происходит с ролью руководителя, когда частью команды становятся агенты;
- Кого и чему учить, если привычные entry-level задачи всё чаще забирает AI.

Смотрите выпуск и приносите в комментарии свои вопросы и примеры.

#CodeOfLeadership #DevRel #OpenSource #AI #Leadership #Education
YouTube Code of Leadership S2E14: Что остаётся дефицитным, когда код становится дешёвым? Что остаётся дефицитным, когда код становится дешёвым: инструменты, инженерное мышление или доверие между компанией и разработчиками? В очередной серии подкаста Code of Leadership поговорим с Сергеем Бережным — директором по взаимодействию с разработчиками…
  • 🔥 5
  • ❤ 2
  • 👍 2
Post #4841 2.32K
Ю Су про агентов: интеллект + continual learning = экспертиза (Рубрика #AI)

Посмотрел доклад Ю Су «Intelligence + Continual Learning = Expertise» с трека Memory & Continual Learning на AI Engineer World's Fair 2026. Су — профессор Ohio State University, из его группы вышли Mind2Web, SeeAct, MMMU и HippoRAG, а в апреле 2026-го он вывел из стелса стартап NeoCognition ($40 млн seed) — про агентов, которые доучиваются на работе. За двадцать минут он отвечает на вопрос, который занимает и меня: почему кодинг-агенты — большой успех, а агенты для всего остального буксуют.

Рамка доклада такая.
🤖 Intelligence — способность рассуждать над незнакомой задачей из выданного контекста. Фронтирные модели делают это всё лучше, но каждый эпизод живёт отдельно.
💪 Expertise — накопленная и ситуативная компетентность: действовать в конкретном домене надёжно, эффективно и с суждением.
По Су, эти оси почти ортогональны, и, масштабируя только интеллект, мы получаем «самого умного в мире новичка»: он блестяще берётся за любую подсунутую задачу, но между задачами ничего не накапливает.

Почему тогда кодинг сработал? Код — привилегированный, language-native мир: всё уже записано символьно и структурировано, а тесты дают готовые награды. Происходящее Су называет современным парадоксом Моравека: «коронные» символьные дисциплины вроде кода и математики агентам даются, а повседневная цифровая работа — нет. Потому что это не один мир, а миллионы микромиров: каждая профессия и компания — даже два инстанса одного софта — настроены по-разному, со своей локальной физикой: структурами, ограничениями, динамикой. Слишком гетерогенно, чтобы одна статичная модель сжала это в себя.

Самая интересная часть — как Су раскладывает экспертизу, опираясь на когнитивистику. Эксперты не просто знают больше — они видят иначе: мгновенно узнают паттерны (в огромном баг-репорте — где именно копать), видят глубинную структуру задачи (назначить встречу — не поиск общего слота в календарях, а оптимизация с ограничениями по полномочиям, приоритетам и срочности), понимают условность правил и когда их можно гнуть, владеют суждением: что такое качество и когда «good enough». Фактически эксперт выучил world model своего микромира. Отсюда же токенная прожорливость агентов: интеллект расширяет поиск, запуская сотню параллельных попыток, а экспертиза сжимает его — shortcuts уже выучены.

Мост между осями — continual learning: адаптивное сжатие опыта в переиспользуемые структуры для будущего поведения. Четыре вопроса задают всё пространство решений:
1️⃣ Какой опыт - эпизоды, факты, процедуры, фидбек
2️⃣ Как сжимать - векторы, символьные индексы, дистилляция в параметры, RL
3️⃣ В какие структуры - адаптеры, графы, скиллы, world models
4️⃣ Как их использовать - вспоминание, предсказание, планирование, value function
Плюс в конце автор говорит про unbounded expertise from bounded intelligence — если алгоритмы continual learning станут достаточно хороши, после некоторого порога интеллекта сильнее модель не нужна: масштабировать надо обучение на опыте. А следующая возможность уровня «интернет как датасет» — опыт приватных микромиров, когда специализированные агенты начнут возвращать выученное в общие модели.

Что я забрал.
— Это удачная рамка для происходящего: memory-файлы, skill libraries и RL на проверяемых наградах уже дают кодинг-агентам примитивный continual learning. Открытый вопрос — как повторить это там, где нет ни символьного мира, ни бесплатных тестов.
— Управленческий вывод: если Су прав, moat компании — не доступ к модели, а learning loop поверх собственных микромиров, превращающий опыт людей и агентов в institutional memory.
— Unbounded expertise — это пока гипотеза, а не результат. Как измерять экспертизу и мирить надёжность с пластичностью — открытые вопросы, Су честно перечисляет их сам. Ну и NeoCognition продаёт ровно это, так что перед нами манифест основателя, а не нейтральный обзор.

#AI #Agents #Research #Engineering #Conference
  • 👍 6
  • 🔥 3
  • ❤ 2
Post #4839 2.49K
Планета муравьёв: книгу покупал сыну, а прочитал сам (Рубрика #Books)

Средний сын очень хотел небольшую колонию муравьёв, и мы её купили. Дальше сработала понятная родительская логика: раз появилась колония, хорошо бы подарить ему ещё и книгу про муравьёв. Я выбрал «Планету муравьёв» Эдварда Осборна Уилсона, но перед тем, как подарить, прочитал её сам. И она мне реально зашла.

Русское название тут немного обманывает. В оригинале книга называется "Tales from the Ant World" скорее переводится как «Истории из мира муравьёв», и это гораздо точнее. Перед нами не учебник по мирмекологии и не инструкция к муравьиной ферме, а сборник коротких научных историй, экспедиционных приключений и воспоминаний. Уилсон почти 80 лет изучал муравьёв, а эту книгу выпустил в 2020 году как поздний итог своей длинной научной жизни.

Сильнее всего в книге работает постоянная смена масштаба. Отдельный муравей кажется довольно простым существом. Но семья — это уже разведка, распределение ролей, логистика, защита, выращивание потомства, «животноводство», войны и сложная химическая связь. Снаружи всё похоже на идеально слаженное общество, но Уилсон сразу предостерегает от умиления: муравьиные миры воинственны, в них встречаются рабовладение, паразитизм и каннибализм. Даже риск распределён безжалостно: молодые рабочие ухаживают за потомством и трудятся внутри гнезда, а стражами, добытчиками и солдатами становятся старые. Люди отправляют воевать молодых, муравьи — старушек (там вообще матриархат и все муравьи - это женские особи, а мужские живут недолго и печально).

Так что популярный совет поучиться у муравьёв командной работе после этой книги звучит уже не так безобидно.

Одна из самых красивых историй — о том, как Уилсон в 1958 году пытался расшифровать феромоновый язык красных огненных муравьёв. Разведчик, найдя крупную добычу, возвращается в гнездо и оставляет химическую дорожку. По запаху сородичи понимают, что найдено и куда бежать. Уилсон отделял под микроскопом железы размером с пылинку, делал из их секрета искусственные следы и проверял реакцию колонии. Когда нужная железа наконец нашлась, муравьи хлынули из гнезда и побежали точно по нарисованной линии. По сути, он расшифровал одно слово чужого языка: «Следуйте за мной».

Рядом с такими почти фантастическими сценами остаётся нормальная живая наука: неудобные полевые выезды, неверные гипотезы, случайные находки и эксперименты, которые приходится повторять. Уилсон рассказывает о муравьях не как автор энциклопедии, который уже знает все ответы, а как человек, до сих пор изумлённый размером неизвестного.

Правда, эта книга не очень помогает в содержании колонии - она не объяснит, как устроить формикарий или чем кормить конкретный вид. Но чисто взрослой её тоже не назовёшь: во введении Уилсон пишет, что особенно надеется на читателей от десяти лет, мечтающих стать натуралистами, а моему среднему сыну как раз 10 лет. И я надеюсь, что эта книга покажет ему какой огромный и чужой мир скрывается за привычной суетой маленьких насекомых.

В общем, книгу я покупал сыну. А рекомендацию в канал пишу уже от себя: если хочется увидеть в обычном муравейнике почти инопланетную цивилизацию у нас под ногами, Уилсон с этим справляется отлично.

#Books #PopularScience #Biology #ForKids #ForParents
  • ❤ 22
  • 🔥 8
  • 👍 2
Post #4838 2.49K
3 AImigo S1E2: AI пишет больше кода. Почему поставка не ускоряется? (Рубрика #AI)

В пятницу в 12:00 по мск в новом выпуске подкаста 3 AImigo разбираемся с парадоксом, который всё чаще встречается в командах: AI заметно ускоряет отдельного инженера, кода становится больше, а до пользователей доходит примерно столько же изменений. Локальная скорость не равна принятому результату — и размер компании от этого не защищает.

Обсуждать будем втроём: Евгений Сергеев (linkedin), Алексей Литвинов (tg, Youtube) и я. У нас разная оптика: управление большой инженерной организацией, практическое внедрение AI-Assisted Engineering и архитектура AI4SDLC. Не будем искать одну «правильную» картину - сравним наши взгляды.

Поговорим о продуктовой команде, в которой после ускорения разработки вырос поток задач в тестирование, но вместе с ним увеличились возвраты и время переделки. Разберём AI-native стартап, где агенты закрывают множество задач, работают в изолированных окружениях и дежурят после релизов. Будет и пример крупной корпорации, где AI-инструменты широко используются, но важная миграция всё равно движется значительно медленнее ожиданий. Отдельно обсудим границу автоматизации. В геймдев-компании AI успешно справлялся с миграциями и изменениями, которые можно проверить компиляцией или тестами.

Поговорим о том, как находить настоящее бутылочное горлышко и что оптимизировать первым. Почему fire-and-forget не работает без замкнутого контура обратной связи. Как построить организационную память: собрать доступный агентам контекст, создать семантический слой и сделать знания действительно пригодными для поиска.

Обсудим и изменения инженерных ролей: что теперь должен уметь разработчик, как меняется карьерная лестница, куда перемещается ответственность и действительно ли hard skills становятся менее важны. А ещё — почему некоторым людям и подразделениям организационно невыгодно ускорять процесс.

Будут не только истории успеха, но и честные примеры того, что не сработало. Главный вопрос выпуска: что нужно изменить в системе разработки, чтобы скорость агентов стала скоростью бизнеса, а не просто новым объёмом кода?

#AI #AI4SDLC #Agents #Engineering #Architecture #Management #Metrics #DevEx #Productivity #Software
YouTube 3 AImigo S1E2: AI пишет больше кода. Почему поставка не ускоряется? В новом выпуске подкаста `3 AImigo` разбираемся с парадоксом, который всё чаще встречается в командах: AI заметно ускоряет отдельного инженера, кода становится больше, а до пользователей доходит примерно столько же изменений. Локальная скорость не равна принятому…
  • ❤ 8
  • 👍 4
  • 🔥 2
Post #4837 2.72K
Peter Steinberger: «Fun Is Velocity» — ретроспектива OpenClaw (Рубрика #AI)

Посмотрел выступление Peter Steinberger, создателя OpenClaw, на Y Combinator Startup School 2026. Его интервью про local-first агентов и тезис «80% приложений исчезнет» я уже разбирал, а тут другой жанр: ретроспектива восьми месяцев проекта изнутри — что пошло не так, почему автор сам перестал пользоваться собственным продуктом и почему «fun is velocity» — не лозунг, а вполне измеримая метрика.

Контекст: OpenClaw родился в ноябре 2025-го из личного раздражения — Питеру хотелось говорить со своими кодинг-агентами с телефона, и он собрал WhatsApp-релей до агента на своей машине. После Нового года проект стал виральным: по словам Питера, на пике — 4,7 млн скачиваний в неделю и около 3000 человек с коммитами в репозитории. Шутку про то, каково такой self-hosted агент поднимать, я уже постил:)

Самое ценное в докладе — честный разбор ошибок.

1️⃣ Раздувание фич как системный эффект open source

Каждая фича от сообщества требовала конфигурационной опции, чтобы не сломать существующие установки, — на пике набралось около 9500 опций. Отсюда лучшая цитата доклада: «в недели, когда мне было в кайф строить, продукт заметно улучшался; в недели, когда нет, — мы шипили конфигурационные опции».

2️⃣ «Бизнес-модель вашей зависимости — это ваша бизнес-модель»
OpenClaw был заточен под Claude Opus по подписке, и когда Anthropic закрыла подписочный доступ, разворот оказался болезненным. Забавно, что ту же январскую историю CEO OpenCode описывал как ускоритель своего роста — я разбирал его рассказ: одинаковый шок по зависимости разные продукты прожили противоположно.

3️⃣ Security и медиа-паника
По рассказу Питера, СМИ писали про «20% вредоносных skills», а собственный анализ команды показал 0,3% на 67 тысячах skills — обе цифры привожу с его слов, без независимой проверки. Вывод его универсален: «опровержение никогда не улетает так далеко, как страшилка». А безопасники собаку съели в страшилках и часто их на самом деле не интересует модель угроз - а важно создать шум.

4️⃣ Потеря себя как первого пользователя
Питер строил уже «для всех», а не для себя, и превратился в человека, который чинит баги и разбирает security-репорты. К маю скачивания просели до 835 тысяч в неделю — и восстановились, когда он вернулся к фичам, нужным ему самому.

Инженерно OpenClaw интересен прежде всего как эксперимент про агента, живущего не в IDE и не в облаке вендора, а на вашей машине: shell, файлы, браузер, а интерфейсом служит обычный мессенджер. Из доклада видно и пределы этой архитектуры: экономика always-on агента, где холостые heartbeat-циклы жгут токены (мой пост про token burn ровно об этом), распределение нагрузки по машинам и доверие к экосистеме skills. По сути это карта граблей для всех, кто строит персональных или корпоративных агентов.

Выводы Питера: первым пользователем продукта должен быть ты сам; чини то, что раздражает лично тебя; когда строить стало дешево, дорогим становится внимание, поэтому фокус решает; и «всё, что ты построил, можно форкнуть — нельзя форкнуть только твое имя».

А для меня главный вывод: «fun is velocity» — не про веселье, а про признак, что ты строишь из позиции пользователя с сохранившимся вкусом. Как только продукт становится обязанностью, скорость падает вместе с качеством решений — у Питера это видно даже на графике скачиваний.

#AI #Agents #Product #Engineering #Management #Startup
YouTube Peter Steinberger: "Fun Is Velocity" Last November, Peter Steinberger was annoyed that there was no good way to talk to his coding agents from his phone, so he built one himself. A few months later, OpenClaw had exploded into one of the biggest open source AI projects in the world, with nearly…
  • ❤ 17
  • 🔥 8
  • 👍 3
Post #4836 2.65K
DeepSeek Harness: когда история агента становится частью экономики инференса (Рубрика #AI4SDLC)

Посмотрел разбор Cloud Codes про DeepSeek Harness. Он хорошо продолжает мой лонгрид о совместной эволюции AI-разработки: здесь видно, как экономика инференса меняет архитектуру истории агента.

Главное правило DeepSeek Harness простое: если что-то уже увидела модель, запись об этом в журнале не переписывают. Сессия — этоне изменяемый массив сообщений, а append-only журнал типизированных событий. Всё видимое модели должно быть зафиксировано в нём или связанном объекте. Свежий экземпляр сессии может восстановить запрос байт-в-байт и сравнить с запросом рабочего цикла. Так формула Agent = Model + Harness становится конкретнее: обвязка отвечает не только за инструменты и промпт, но и за доказуемое происхождение контекста.

Зачем такая строгость?
API модели на каждом шаге снова получает историю, а prefix cache экономит вычисления только на совпадающем начале запроса. Автор ролика получает 120× экономии из таблицы цен на API на момент записи. Но 18 августа 2026 года прайс V4 Pro уже показывает $0,022 против $0,66 off-peak и $0,044 против $1,32 peak — разницу в 30×. Это не 30-кратное удешевление сессии: коэффициент относится только ко входным токенам, без учёта выхода, инструментов и инфраструктуры. Но архитектурный стимул остаётся сильным.

Самый красивый пример — compaction
Старый summarizer начинал запрос с нового system prompt и ломал прогретый префикс, когда история была самой длинной. Исправление почти комично: повторить прежние system prompt, tools и сообщения байт-в-байт, а инструкцию «сожми разговор» добавить последним user message. Даже неиспользуемые схемы инструментов остаются для выравнивания токенов.

Авторы правильно разделяют корректность и экономию. Cache hit идет с гарантией best effort: могут отличаться модель, маршрут, header запроса или диапазон compaction. Источником истины остаётся журнал, а независимый инвариант заново собирает запрос и не позволяет кешу рабочей сессии проверять самого себя. Это рифмуется с моим разбором Loop Engineering: сильная часть цикла — механизм, способный доказать, что система не потеряла состояние и не нарушила границу.

В репозитории также лежат сотни Agent Notes со статусами implemented, archived, proposed, rejected и обязательными alternatives considered. Код показывает, что сделали; заметка — почему отказались от других вариантов. Это почти буквальная реализация моего поста про PRD, ADR и BDD для людей и AI.

Связь с коэволюцией стека становится ещё заметнее в minimal preset. Репозиторий прямо описывает его как RL-agent composition:
- фиксированный короткий prompt
- persistent bash и str_replace_editor воспроизводят среду обучения
Получается контур harness → траектории → post-training → тот же harness. Но открытый код не доказывает, что пользовательские сессии идут в обучение; он показывает архитектурную возможность, а не фактическую политику данных.

Поэтому я бы уточнил финальный тезис видео. Продукт — не harness сам по себе, а меняющаяся связка model + serving + harness + tools + traces. Для обычной компании вывод прежний: не обязательно строить ещё один общий агентный цикл. Полезнее разложить стек по слоям и оставить своими воспроизводимые эпизоды, outcome-evals, контракты инструментов, идентичность и политики доступа.

Практически из DeepSeek Harness я бы забрал четыре проверки:

- Можно ли восстановить каждый запрос из долговечного журнала;
- Сохраняет ли compaction смысл истории и стабильный префикс;
- Есть ли независимый инвариант, который не доверяет рабочему циклу;
- Измеряем ли мы стоимость полезного результата, а не только cache hit.

DeepSeek Harness пока developer preview: репозиторий предупреждает о будущих несовместимых изменениях. Нейтрального бенчмарка качества в видео нет. Поэтому рейтинг стоит отложить, а архитектуру — внимательно прочитать.

#AI4SDLC #AI #Agents #Architecture #DevTools #Evals #Engineering
YouTube DeepSeek Harness Architecture: Insane Software Engineering Behind It Why did 72,000 developers star DeepSeek Harness in less than 24 hours, and what is the single golden engineering rule that makes it 120x cheaper to run long-context agent sessions? Meet the append-only event-sourced architecture behind npx @deepseek-ai/dsh…
  • 👍 6
  • ❤ 3
  • 🔥 2
Post #4835 2.67K
Paper: как выглядит дизайн-инструмент эпохи агентов (Рубрика #AI4SDLC)

Посмотрел выпуск Design Review от Y Combinator «How To Design In The Agent Era», опубликованный 7 августа 2026 года: Stephen Haney, основатель дизайн-инструмента Paper, вместе с партнером YC Aaron Epstein разбирает присланные зрителями сайты. Формально это шоу про редизайны, но мне интереснее другое: Paper — редкий пример инструмента, спроектированного под агентов с нуля, а не адаптированного к ним задним числом.

Сначала контекст. Haney копает проблему designer-developer handoff давно: он сооснователь Modulz и один из авторов Radix UI — одной из самых популярных библиотек React-компонентов. После продажи Modulz компании WorkOS он два года отвечал там за продукт, а Paper — его второй заход на тот же разрыв, теперь с учетом агентов.

Инженерная суть — в одном архитектурном решении. Классические дизайн-инструменты рендерят канвас проприетарными движками, и агенту приходится работать с ними через экспорт и plugin API: трансляция форматов стоит токенов, добавляет латентность и порождает отдельный класс галлюцинаций. В Paper канвас — это живые HTML и CSS: каждый объект на экране и есть код веба. Агент (Cursor, Claude Code и другие) подключается через MCP-сервер и пишет буквальный HTML, который канвас рендерит без слоя трансляции. Формула Haney: хороший handoff для людей автоматически оказывается хорошим handoff для агентов.

Рабочий контур получается таким: дизайнер оставляет комментарии или снимает живой сайт в редактируемые слои расширением Paper Snapshot, агент генерирует варианты хоть за ночь, человек курирует — удаляет, ветвит, дорабатывает. По словам Haney, их собственный маркетинговый сайт brand-дизайнер собрал в Paper и довел до Next.js-кода с анимациями и шейдерами примерно за неделю, без участия инженеров.

Практическая часть выпуска — каталог типовых признаков AI-генерированного дизайна: жирные начертания везде, пять-восемь размеров шрифта вместо трех, ALL-CAPS подзаголовки с разреженным letter-spacing, pill-бейджи на каждой карточке, фиолетовые градиенты (перекос обучающих данных после успеха Linear), перегруженные карточками секции, переключатель темной темы в MVP. Haney описывает это как неуверенного дизайнера, запеченного в веса модели, а лечит удалением: значительная часть дизайна — это deleting. На живых редизайнах (Legion Health, Sytex, Moreta) картина повторяется: тексты и value proposition обычно в порядке, проваливается визуальная сборка и иерархия.

Отдельно занятно, как команда Paper использует агентов сама: 12 человек, Cursor, Claude Code и Bugbot, но каждую строку кода читают люди — канвас должен стабильно держать высокую производительность, и такого уровня системного качества агенты пока не выдают. Принцип Haney: use agents to accelerate the people.

Это хорошо рифмуется с тем, что я уже разбирал. WebMCP — та же идея на уровне веба: вместо «посмотри на пиксели и угадай» сайт отдает агенту явные инструменты. Выступление Geoffrey Litt — про то, что генерация дешевеет, а узким местом становится понимание; у Haney та же логика про вкус: агенты быстро подтягивают тактику вроде весов, контраста и отступов, но выбор направления и поиск «следующей эстетики» остаются за человеком. А история продакта из Meta, который запускает продукты, почти не умея программировать, показывает ту же смену роли, только для дизайнера: меньше ручного производства, больше постановки задачи и кураторства.

Для меня главный вывод такой: артефакты, рассчитанные только на человеческий глаз, становятся налогом на агентный стек. Выигрывают инструменты, где человеческий и машинный доступ — один контракт: дизайн, который агент читает и правит как код, и код, который дизайнер видит как канвас. Насколько Paper действительно «самый быстрорастущий дизайн-инструмент со времен Figma» — пока утверждение YC и самой команды, но направление мне кажется правильным.

P.S.
После этого видео, я решил, что надо попробовать этот инструмент в деле:)

#AI4SDLC #AI #Agents #DevTools #Product #Engineering
YouTube How To Design In The Agent Era AI isn't just changing the tools designers use. It's changing how they build, ship, and stand out. In this episode of Design Review, Stephen Haney, founder of AI-native design tool Paper, joins YC General Partner Aaron Epstein to demo the agent-first workflow…
  • ❤ 6
  • 🔥 4
  • 👌 1
Post #4834

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🤔 15
  • 😁 11
  • 🔥 3
Post #4833 2.85K
Через 5 минут стартует прямой эфир с Михаилом Тюргановым, руководителем Департамента разработки цифровых сервисов Альфа-Банка, где мы поговорим про его путь от тестировщика, программиста и CEO малого бизнеса до технологического директора. Если кратко, то мы обсудим как меняется CTO, когда небольшая команда вырастает в организацию на тысячи человек? И что делать, если прежние методы сами становятся ограничением?
YouTube Как выстроить собственную систему управления с Михаилом Тюргановым Как меняется CTO, когда небольшая команда вырастает в организацию на тысячи человек? И что делать, если прежние методы сами становятся ограничением? 17 августа в 19:00 МСК в эфире Code of Leadership вместе с Михаилом Тюргановым, руководителем Департамента…
  • 🔥 9
  • ❤ 5
  • 👍 3
  • 🌚 2
Post #4832 2.82K
Материалы с первого выпуска подкаста "3 AImigo" (Рубрика #AI)

Наша первая серия о том, где сейчас находится AI-разработка вышла очень бодрой.
Мы обсуждали ее втроём: Евгений Сергеев, Алексей Литвинов и я, а ниже представлены материалы выпуска
- Страничка эпизода
- Видео: YouTube, VK Video
- Аудио: Podster, Яндекс Музыка
- Текст: Краткая расшифровка
И бонусный лонгрид, что я написал, когда я готовился к этому выпуску.

P.S.
У Леши есть свой канал в tg @tip_podcast и на Youtube, а у Жени пока нет:)

#AI #Management #Processes #Engineering #Software #AI4SDLC #Software #Agents #Leadership
polomodov.tech Где мы сейчас с AI в разработке — 3 AImigo Первый разговор 3 AImigo сверяет три практические оптики: AI4SDLC, внедрение AI-Assisted Engineering и управление большой инженерной организацией.
  • ❤ 8
  • 🔥 2
  • 👍 1
Post #4831 2.92K

Forwarded from ВыйтиИЗайти

Сегодня разбирала детскую бибилиотеку дома и вот вам подборка неочевидных детских книг, которые понравятся и взрослым:

1. Доктор Сьюз "Это только начало" - лучшее мотивационное чтение, если вдруг вы забыли как это, находить себя и не бояться ошибаться

2. Деби Глиори "Что бы ни случилось" - если вдруг вам стало одиноко и хочется просто тепла и знать, что вас любят

3. Жан-Люк Фроманталь "Не опаздывай медведь" - немного посмеяться над нашей вечной гонкой — и заодно подумать о том, какую власть над нами имеет время

4. Даниэла Кункель "Маленький Мы" - про то, что один в поле не воин и как в дружбе появляется что-то третье, наше "мы"

Классные они не только смыслом, но и тем, что прочитать их можно за 3-5 минут, а удовольствия получить на целый день❤️
  • ❤ 13
  • 👍 5
  • 🔥 5
  • 👎 1
Post #4830 2.8K
Мы разбирали эти книги вместе с моей женой, Настей, и она мне порекомендовала почитать "Доктор Сьюз "Это только начало" - лучшее мотивационное чтение, если вдруг вы забыли как это, находить себя и не бояться ошибаться. Эта книга отлично подходит для тех, кого ждут большие перемены:)
  • ❤ 6
  • 🔥 5
  • 👍 3
Post #4829 3.19K
Boris Cherny: We Cut 80% of Claude Code's Prompt (Рубрика #AI4SDLC)

Посмотрел выступление Boris Cherny, создателя Claude Code, на Y Combinator Startup School 2026 — записанное на следующий день после релиза Opus 5. Его интервью в подкасте Lightcone я уже разбирал, как и внутреннее устройство Claude Code, а тут главное — продуктовая философия: под новое поколение моделей команда вырезала больше 80% системного промпта, и, по словам Бориса, без измеримой потери качества на их кодинг-evals.

Логика такая: системный промпт — это по большей части накопленные заплатки под ошибки конкретного поколения моделей. Новая модель этих ошибок уже не совершает, а старые инструкции и примеры начинают ее ограничивать: «ты хочешь ответы вот такие» — и модель послушно равняется на устаревший образец. Поэтому методология у команды жесткая: с каждым релизом модели промпт вычищается почти до нуля, а строки возвращаются только тогда, когда модель повторно спотыкается на одном и том же. По рассказу Бориса, есть даже флаг CLAUDE_CODE_SIMPLE=1, убирающий вообще все промпты, включая зашитые в тулы, — и в таком «голом» режиме модель на замерах оказывается даже чуть умнее. То же с evals: они насыщаются за 1-3 поколения моделей, после чего их нужно пересобирать.

Продуктово мне понравился термин product overhang: у модели есть способности, которые продукт не раскрывает, потому что сам стоит у нее на пути. Claude Code родился именно из такого наблюдения: Sonnet 3.5 уже умел писать целые файлы и фичи, а продукты вокруг предлагали автокомплит и read-only чат. Получается, ценность харнеса не в том, что он добавляет поверх модели, а в том, чему он не мешает, — хорошая рифма к harness factory model из The New SDLC, который я разбирал.

Про навыки: Борис описывает сдвиг от prompt engineering через context engineering к elicitation — умению дать модели задачу «чуть сложнее, чем кажется возможным» плюс механизм верификации, не переспецифицируя решение. Формула как с сильным коллегой: задача, ограничения, критерии готовности. Забавно смотрится на фоне книги Prompt Engineering for LLMs — за полтора года дисциплина прошла путь от «как правильно писать инструкции» до «как их правильно удалять». И это согласуется с исследованием Anthropic про экспертизу: успех с агентом определяется умением ставить задачу и проверять результат, а не магическими формулировками.

Масштаб иллюстрируют две истории, обе со слов Бориса: команда Bun переписала с Claude больше 100 тысяч строк рантайма с Zig на Rust за 11 дней непрерывной работы (людьми — год с лишним), а его собственный эксперимент по переписыванию Electron-приложения на нативный Swift к моменту доклада шел третью неделю с тысячами порожденных агентов — и Claude сам завел Slack-канал, куда постит скриншоты прогресса.

Для меня главный вывод: системный промпт и CLAUDE.md — это технический долг со сроком годности в одно поколение моделей. Инструкции, накопленные под прошлую модель, для новой превращаются из подпорок в ограничители, поэтому «press delete» — не жест смелости, а регулярная инженерная процедура, как чистка зависимостей.

P.S.
В общем, если у вас есть неограниченный доступ к SOTA моделям, то вам все меньше надо императивно управлять потоком исполнения и загонять модель в рамки. Вместо этого вы переходите к классической инверсии контроля (IoC, Inversion of Control), где модель использует «голливудский принцип» («не звоните нам, мы сами вам позвоним») и модули низкого уровня не вызывают модули высокого уровня (а здесь это модель) напрямую. Вместо этого модель сама управляет вызовами и дергает доступные модули, когда ей это нужно.

#AI4SDLC #AI #Agents #Evals #DevTools #Engineering
YouTube Boris Cherny: We Cut 80% of Claude Code’s Prompt Fresh off the launch of Opus 5, Claude Code creator Boris Cherny joins Diana Hu at Startup School 2026 to talk about what the newest models can do, how Claude Code came to be, and what it means to build products when the underlying capabilities keep accelerating.…
  • ❤ 10
  • 👍 7
  • 🔥 2
Post #4828 3.07K
Материалы с третьей части AMA сессии с Лешей Литвиновым (Рубрика #AI4SDLC)

Мы успешно разобрали последние 6 вопросов и закончили свой марафон
- Страничка выпуска
- Видео: YouTube, VK Video
- Аудио: Podster, Яндекс Музыка
- Текст: Краткая расшифровка

P.S.
У Леши есть свой канал в tg @tip_podcast и на Youtube

#AI #Management #Processes #Engineering #Software #Architecture
polomodov.tech AI-внедрение: решает протокол, а не модель — Code of Leadership Третья AMA с Алексеем Литвиновым: системное внедрение AI, измерение ROI, OpenSpec и Spec Kit, evals и безопасная автономность агентов.
  • ❤ 2
  • 👍 1
  • 🔥 1
Post #4827 3.77K
UK Global Talent — endorsement получен (Рубрика #Changes)

Где-то к концу 2025 года я понял, что хочу заниматься технологиями, которые находятся близко к фронтиру. Весь 2025 год в Т-Банке я занимался AI4SDLC, но мне было ясно, что чего-то не хватает.

И к началу лета 2026 года я пришёл к тому, что хочу попробовать получить визу Global Talent в UK. Читатели помнят, что в этом году я уже пару раз ездил в Лондон: сначала только с женой, а потом с женой и детьми. Город меня вполне устроил с точки зрения места для жизни.

Дальше я занялся бюрократией и решил разобраться с процессом. Требования оказались вполне подъёмными:
- Надо заполнить онлайн-заявку, включая personal statement — аналог мотивационного письма;
- Приложить три рекомендательных письма от уважаемых в индустрии людей, которые знают твою работу не менее 12 месяцев и могут на конкретных примерах рассказать о твоих качествах и достижениях;
- Приложить evidence documents — максимум 10. Минимум два документа должны показывать, что тебя признают ведущим или потенциально ведущим специалистом, и ещё минимум четыре должны закрывать два дополнительных критерия — по два документа на каждый.
То есть минимально получается шесть evidence-документов.

А вообще, у Global Talent есть разные направления. Я шёл по Digital Technology route, внутри которого есть варианты Exceptional Talent и Exceptional Promise. Я подавался как Exceptional Talent.

К процессу я подошёл как менеджер и использовал working backwards: сначала нарисовал себе целевую картинку, а дальше начал отстраивать от неё шаги в обратную сторону.
- Написал personal statement.
- Подобрал уважаемых в индустрии людей, которые хорошо знали мою работу и могли подтвердить факты обо мне, укладывающиеся в общую историю заявки.
- Дальше нужны были evidence documents. Тут я решил собрать все свои достижения за разные годы на сайте polomodov.tech.
- Я долго работал над тем, чтобы свести туда презентации, подкасты, номинации на премии и другие материалы. Там же начал публиковать лонгриды.
- Когда вся фактура была собрана, я вместе с Claude и Codex разложил её по критериям и собрал примерный пакет документов, который лучше всего поддерживал мою заявку. Все факты и финальный выбор evidence, конечно, были моими.
- Дальше было большое количество доработок напильником.
- Потом — поход в бюро переводов, чтобы перевести часть evidence documents.
- Сначала я приложил оригиналы и переводы раздельно к письму, которое нужно было отправить в Home Office.
- Примерно через неделю мне ответили, что в моём пакете каждый перевод нужно объединить с соответствующим оригиналом в один файл — иначе получалось слишком много документов и превышался лимит.
- Я всё поправил и отправил исправленный пакет, а ещё через 11 дней получил положительное решение по endorsement и это произошло сегодня утром. Это, понятно, только таймлайн моего кейса, а не официальный ориентир.

В письме была такая формулировка:
Tech Nation has advised that you meet its criteria for Exceptional Talent and I am therefore satisfied that you can be endorsed under Global Talent.

Теперь остался второй этап: в течение трёх месяцев подать отдельную заявку на саму визу и получить решение уже по ней. А дальше — планировать переезд.
В общем, процесс не выглядел сложным, но это мой личный опыт, а не иммиграционная консультация, а требования меняются во времени, поэтому актуальные требования лучше всегда проверять на GOV.UK.

#Software #Engineering #RnD #Live #Leadership
  • 👍 45
  • 🔥 38
  • 😢 17
  • ❤ 9
  • 🕊 7
  • 👎 6
  • 👏 1
  • 🌚 1
  • 😡 1
Post #4826 3.4K
Claude Certified Architect: экзамен как карта агентной инженерии (Рубрика #AI4SDLC)

Посмотрел 20-минутный доклад Фрэнка Койла с AI Engineer World's Fair 2026 про экзамен Claude Certified Architect - Foundations. Его полезнее читать не как сертификат, а как карту решений, без которых агентная демка не становится производственной системой. Кстати, раньше я уже рассказывал про доклад Фрэнка про онтологии на этой же конфе.

CCAR-F - первая техническая сертификация Anthropic для архитекторов приложений с Claude. Это 60 заданий с одним или несколькими ответами на 120 минут; проходной scaled score - 720 из 1000. Четыре из шести сценариев выбираются случайно: поддержка, генерация кода, многоагентное исследование, инструменты для разработчиков, Claude Code в CI/CD и структурированное извлечение. Проверяется не меню продукта, а выбор архитектуры с учётом ограничений и отказов.

Темы экзамена хорошо показывают его приоритеты:

- Агентная архитектура и оркестрация - 27%: циклы, stop_reason, субагенты и hooks;
- Инструменты и MCP - 18%: схемы, ошибки и распределение инструментов;
- Claude Code - 20%: CLAUDE.md, skills, plan mode и CI/CD;
- Промпты и структурированный вывод - 20%: few-shot, JSON Schema и валидация;
- Контекст и надёжность - 15%: сжатие, происхождение данных, эскалация и проверка человеком.

Койл разбирает карту этого экзамена через антипаттерны. Не принимать ответ модели за действие: LLM формирует вызов инструмента, а код проверяет stop_reason, исполняет его и возвращает результат в цикл. Не давать одному агенту все инструменты, если хватит узкого подагента. Не вываливать его полную историю в основной контекст: возвращать вывод, факты и ссылки, а длинную сессию сжимать. Достаточно много Койл говорит про loop engineering, который мы вместе с Максом Смирновым разбирали в выпуске Research Insights Made Simple #19. Там мы говорили про повторяемый цикл и право проверяющего его остановить. CCA добавляет карту компетенций инженера вокруг цикла: инструменты, контекст, границы, проверку и восстановление.

Итого: польза этого экзамена не в бейдже, а в схеме подготовки, которую можно взять как учебный план и чек-лист архитектурного ревью: где остановка, кто исполняет вызов инструмента, что видит подагент, сохраняется ли источник и когда решение уходит человеку. Карта привязана к Claude, а сданный тест не доказывает опыт промышленной эксплуатации. Условия из доклада уже устарели: на 12 августа 2026 года экзамен подорожал до $125, но его вопросы полезны и тем, кто сдавать не планирует.

#AI #AI4SDLC #Agents #Architecture #Engineering #DevTools
YouTube Anthropic's CCA Exam as a Field-Guide for Agentic Engineering — Frank Coyle, UC Berkeley The Claude Certified Architect exam hands you six production scenarios and picks four at random, and Frank Coyle walks through them backwards, leading with the anti pattern in each one. Knowing what not to do is what points you toward what to do, the same…
  • ❤ 8
  • 👍 4
  • 🔥 4
Post #4825 3.35K
Harness: почему один агент с файлами вытесняет сложные обвязки (Рубрика #AI4SDLC)

Посмотрел доклад Константина Крестникова (CTO GigaChain, Сбер) «Harness: новый подход к созданию AI-агентов» с Data Fest 2026. Это компактная история о том, как индустрия за четыре года прошла путь от чат-бота до универсального агента, и почему сложные мультиагентные обвязки начали проигрывать «одному агенту с файлами».

Эволюция по докладу выглядит так:

- Конец 2022: чистые LLM и ранний ChatGPT — текст на входе, текст на выходе, без памяти и инструментов;
- 2023: ReAct-агенты — модель в цикле сама решает, вызвать инструмент или ответить, и рефлексирует результаты вызовов;
- Рубеж 2023–2024: агентов заворачивают в цепочки с пре- и постобработкой и structured output — время LangChain и LlamaIndex;
- Дальше (2024-2025) цепочки ветвятся в графы и мультиагентные системы: агент-планировщик, агент-критик, LangGraph, AutoGPT, CrewAI. Всё это scaffolding — «строительные леса» вокруг модели;
- Сейчас (с 2025): harness — один универсальный агент уровня Claude Code или Codex, работающий в пространстве файлов. Метафора в названии точная: LLM — тяговая сила, файлы — поле, harness — упряжка.

Ключевой сдвиг: мощным моделям сложная обвязка перестала быть нужна — достаточно положить агенту правильные файлы и инструкцию в AGENTS.md. Внутри любого харнеса всё тот же ReAct-цикл, а базовых инструментов четыре: чтение файла, поиск по файлам, редактирование и bash (всего из коробки 25–30). При этом, по наблюдению команды, при одной и той же модели харнес даёт разброс в 20–30 п.п. качества.

Практическая часть — как команда GigaChain выбирала харнес для GigaChat:

- Взяли open-source DeepAgents от LangChain: GigaChat подключился правкой конфига благодаря адаптеру langchain-gigachat;
- Замерились на соревновании из канала «LLM под капотом»: Claude Code с Sonnet решает 70 задач из 104, DeepAgents с той же моделью — 67. Просадка небольшая, при том что Anthropic оптимизирует харнес и модель друг под друга;
- Использовали киллер-фичу DeepAgents — профили моделей: вендор выпускает Python-пакет, учитывающий сильные и слабые стороны своей модели. Такой профиль сделали для GigaChat;
- Собрали свой бенчмарк harness-bench-fast: задачи на файлы, память, grep и разбор CSV с golden-ответами без LLM-judge, прогон около 20 минут на любом харнесе; выложен в open source;
- Запустили автоулучшение по циклу «гипотеза → замер → оставить или откатить» (около 15 гипотез, часть предложил Claude): по словам докладчика, это дало +22,5 п.п. на своём бенчмарке чистым промптингом, а на внешнем соревновании — рост качества на 41%.

Самая любопытная часть — про то, что дальше. Контекст любого харнеса заканчивается, а суммаризация резко «оглупляет» агента. Ответ — Ralph loop Джеффри Хантли: харнес запускают в бесконечном bash-цикле, состояние живёт в файлах, и каждый перезапуск возвращает модель в «умную зону» первых 30–40% контекста. Против вырождения (Карпаты показывает его на анекдотах: попросите у модели двадцать анекдотов — панчлайна будет три) Крестников добавил MetaLoop — внешний цикл, который стартует Ralph loop с чистого листа новым «поколением»; оно позже находит наработки предыдущего, но идёт своим путём.

Из этого вырос Anima SDK: в первом эксперименте агент с задачей «стань разумным существом» проработал 13 поколений за пять дней, однажды попробовал замолчать — вывел несколько точек и записал, что молчать агент не может. Практичнее применять то же самое к исследованиям, переводам больших книг и автоулучшению агентов — задачам, где оптимальный путь заранее неизвестен.

Итого, из этого короткого доклада видно, что центр тяжести инженерии агентов сместился из кода обвязки в среду — файлы, инструкции, тесты и бенчмарки, удерживающие агента (Хантли называет это backpressure). А выбор харнеса стал отдельным инженерным решением, которое стоит замерять на своих задачах, а не принимать по умолчанию.

#AI #AI4SDLC #Agents #Evals #DevTools #Engineering
YouTube Константин Крестников | Harness: новый подход к созданию AI-агентов Спикер: Константин Крестников, управляющий директор, Сбер Data Fest 2026: https://ods.ai/events/datafest2026 Презентацию к докладу Вы можете скачать в треке секции GenAI от Сбера https://ods.ai/tracks/df26_sber_genai ______ Наши соц.сети: Telegram: ht…
  • 🔥 12
  • ❤ 5
  • 👍 3
Post #4824 2.64K
Материалы с подкаста "PRD == evals: как AI стирает границу между продактом и ML Engineer" с Альбиной Мунировой из Т-Банка (Рубрика #ProductManagement)

Мы поговорили про изменения в профессии продакт менеджеров, когда граница между ним и ML-инженером становится заметно тоньше.
- Страничка выпуска
- Видео: YouTube, VK Video
- Аудио: Podster, Яндекс Музыка
- Текст: Краткая расшифровка

P.S.
У Альбины есть свой канал в tg @aimunirova и на Youtube

#AI #Management #Processes #Engineering #Software #Architecture #ML
polomodov.tech PRD == evals в AI-продуктах — Code of Leadership PRD == evals: прототипирование, проверки качества и новая граница ответственности между продактом и ML-инженером. В гостях — Альбина Мунирова.
  • ❤ 3
  • 👍 3
  • 🔥 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →