TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4903 2.6K
An Illustrated Guide to AI Agents: полное издание (Рубрика #Agents)

В марте я уже рассказывал про "An Illustrated Guide to AI Agents". Тогда это был Early Release: готовы были шесть глав, а я обещал следить за продолжением. Теперь издательство O'Reilly выпустило полное издание — 450 страниц и 10 глав. Вернуться к книге стоит не только из-за новых страниц: она перестала выглядеть как сильная половина будущего учебника и наконец собралась в цельный маршрут — от устройства LLM до проверки и эксплуатации агентной системы.

Если сравнить финальное оглавление с тем, что было готово весной, доехали четыре большие главы.

1️⃣ Large Language Models делает книгу самодостаточной. Здесь есть tokens, system prompt, tool calls, pre-training и post-training, Transformer, context length, KV cache и Mixture of Experts — причем всё это привязано к поведению, задержке и стоимости агента. Становится понятнее, как сама модель, длина контекста и KV cache влияют на всю систему.
2️⃣ Evaluating Agents — пожалуй, самая важная новая глава. Авторы разбирают public benchmarks, outcome и trajectory evaluation, LLM-as-a-judge, rubrics, reliability, safety и собственные evals. Особенно полезна пара метрик: pass@k отвечает на вопрос «получилось ли у агента хотя бы раз за k попыток», а pass^k — «успешны ли все k попыток». Для эффектного демо часто хватает первого, для рабочего процесса гораздо важнее второе.
3️⃣ Multi-Modal Understanding объясняет, как агент начинает видеть изображения, слышать аудио и разбирать видео: encoder переводит вход в embeddings, connector приводит их к формату LLM, дальше модель использует их как контекст. Заодно хорошо показаны компромиссы: простой projection дешевле, query-подход лучше сжимает длинный вход, fusion обычно выразительнее, но сложнее и дороже.
4️⃣ Code Agents and Code LLMs доводит тему от генерации функции до работы внутри репозитория. Здесь есть инструменты для файлов и терминала, SQL, песочницы для исполнения кода, карты репозитория, кэширование и сжатие контекста, планирование, тесты и ручное подтверждение. Важная мысль: иногда фиксированный workflow надежнее полноценного агента, а доступ к shell — это не удобная галочка, а граница безопасности, от которой зависит масштаб возможного ущерба.

Кстати, финальная версия уже знакомой главы про Multi-Agent Systems включает orchestration patterns, communication protocols, deep research agents и сценарии вроде AI co-scientist. Но цельность книги создаёт сквозная конструкция. В первой части авторы последовательно собирают одного TinyAgent: LLM → reasoning → memory → tools → planning → evals. Во второй показывают, как та же архитектура специализируется в multi-agent, multi-modal и coding systems. Получился уже не каталог модных фреймворков, а понятный инженерный цикл.

Для инженера это закрывает несколько конкретных сценариев:
- спроектировать внутреннего исследовательского агента или агента поддержки и понять, где хранить контекст и какие инструменты ему дать;
- проверять изменения промпта, модели и памяти через регрессионные evals не только по ответу, но и по траектории;
- собрать code agent с поиском по репозиторию, тестами и песочницей;
- добавить изображения, звонки или видео туда, где текстовый агент просто не видит часть задачи.

Для техлида или руководителя сценарии другие:
- решить, где нужен агент, а где достаточно детерминированного workflow;
- выбрать single-agent или multi-agent архитектуру и посчитать цену координации;
- сравнить поставщиков на собственных задачах как связку «model + harness», учитывая надёжность, задержку и стоимость;
- задать границы автономности — права, необратимые действия, сценарии безопасности и места, где обязательно ручное подтверждение.

Если первые главы уже читали весной, начинать заново необязательно: главу 2 можно пробежать для связки с экономикой агента, главу 7 я бы точно не пропускал, а дальше — главы про мультимодальность и кодинговые агенты. Именно эта связка превращает ранний набор хороших объяснений в законченную инженерную книгу.

#Agents #Books #AI #Engineering #Architecture #Management #Software
Telegram Книжный куб An Illustrated Guide to AI Agents (Рубрика #Agents) Пока летел обратно из Лондона в Москву успел прочитать эту книгу и могу ее рекомендовать всем. Ее пишут Jay Alammar и Maarten Grootendorst - авторы крутой книги "Hands-On Large Language Models", о которой…
  • 🔥 11
  • ❤ 6
  • 👍 6
More from @book_cube
  1. Oct 1, 2026AMD договорилась купить World Labs за $8,2 млрд (Рубрика #AI) Я уже разбирал доклад Фей-Фе…
  2. Oct 1, 2026Заходите на прямой эфир с Никитой Белокопытовым, где мы с ним поговорим про его карьеру и…
  3. Oct 1, 2026Материалы выпуска: как руководить тем, в чём пока не разбираешься — Леонид Черный (Рубрика…
  4. Sep 30, 2026Как обычно превосходный юмор и очень точное попадание во всех топ-менеджеров AI компаний.…
  5. Sep 30, 2026Как инженер учится договариваться (Рубрика #Leadership) 2 октября в 10:30 по МСК в прямом…
  6. Sep 30, 2026Залетайте в прямой эфир про профит от данных, который начнется через 5 минут. Там наше тво…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →