Глубокое понимание ИИ-агента: принципы проектирования и инженерные практики
Книга посвящена основной формуле Agent = LLM + контекст + инструменты.
Краткий обзор содержания книги (главы 1-10):
1️⃣ Базовые знания об агенте.
Сформулируйте основную формулу: Agent = LLM + Контекст + инструмент и внедрите инженерные разработки - все инженерные возможности, кроме модели, являются реальной конкурентоспособностью.
2️⃣ Разработка контекста.
Контекст определяет верхний предел возможностей агента. Изучите контекстную структуру API для больших моделей, дизайн, удобный для кэширования KV, разработку подсказок, динамические подсказки и навыки агента, метаинформацию в строке состояния и стратегии сжатия контекста.
3️⃣ Пользовательская память и база знаний.
Пусть Агент запоминает пользователей в разных сеансах и получает доступ к внешним знаниям.Она охватывает системы пользовательской памяти, базовые конвейеры RAG, а также организацию знаний и поиск информации (структурированные индексы, карты знаний и т.д.), которые выходят за рамки простого текста.
4️⃣ Инструменты: Инструменты - это руки агента.
Поговорим о классификации инструментов и общих принципах проектирования, протоколе MCP и проблемах выбора инструментов, инструментах восприятия/исполнения/совместной работы и асинхронных агентах, управляемых событиями.
5️⃣ Программист и генерация кода.
Код - это “инструмент, который может создавать новые инструменты” и является мета-способностью обычного агента. Возьмем в качестве примера средство разработки производственного уровня, чтобы продемонстрировать полную реализацию этого самого мощного универсального инструмента.
6️⃣ Оценка агента.
Превратите работу агента в сопоставимый сигнал. От среды оценки, разработки набора данных, системы индексов до статистической значимости, наблюдаемости, отбора на основе оценки, внутренней оценки и моделирования на производственном уровне.
7️⃣ Постмодельное обучение: трехэтапная панорама предварительной подготовки, SFT и RL.
Когда выбирать SFT, когда выбирать RL, RLHF, сравнение алгоритмов, данные и среда, а также передовые исследования, позволяющие моделям научиться вызывать инструменты и повышать эффективность выборки.
8️⃣ Саморазвитие агента.
Вы можете расти, не меняя свой вес. Три парадигмы обучения - от обучения на основе опыта, активного поиска инструментов до “от пользователя инструмента к создателю инструмента“ - позволяют агенту перейти от ”умного“ к ”опытному".
9️⃣ Мультимодальное взаимодействие в режиме реального времени: распространение восприятия и действий с текста на голос, графический интерфейс и физический мир.
Три режима передачи речи (каскадный /сквозной полный режим/полный дуплекс), восприятие и синтез потоковой речи, использование компьютера и управление роботом.
1️⃣0️⃣ Мультиагентное сотрудничество: интеллект группы может быть выше, чем у отдельного человека.
Многоагентная система классификации, когда она действительно лучше, чем один агент, взаимодействие между разделяемыми и не разделяемыми контекстами, закономерности сбоев и появление “сообщества агентов”.
Post #372
1.35K
AI-Agents-in-Depth-Bojie-Li-v1.2.pdf17.3 MB
- 👍 8
- ❤ 4
- 🔥 4