Перевёл и законспектировал.
Короткая суть - ваш агент отлично работает первые 10 шагов. А на пятнадцатом начинает тупить. Большинство винит модель. Почти никогда дело не в модели, дело в том, что модель видит.
Организация того, что видит модель, называется контекстной инженерией. И это стремительно становится главным навыком для тех, кто строит агентов.
Почему это вообще проблема. Контекстное окно агента по сути оперативная память. Она заполняется и исследования вапоказывают : деградация начинается задолго до жёсткого лимита. Модель с окном в 200K токенов может заметно тупить уже на 50K. Плюс эффект «Потерянного в середине» неросети хорошо помнят начало и конец, середину игнорируют.
4 стратегии контекстной инженерии:
Запись - дайте агенту способ помнить. Черновики, файлы правил (CLAUDE.md), извлечение памяти между сессиями.
Отбор - не давайте агенту всё. Дайте то, что нужно прямо сейчас. RAG поверх описаний инструментов: точность выбора растёт с 14% до 43%, токенов вдвое меньше.
Сжатие - контекст накапливается. Сохраните смысл, обрежьте токены. Скользящее резюме истории, автосжатие, очистка старых результатов инструментов.
Изоляция - самая мощная. Суб-агенты, раздельные контекстные окна. Исследовательский шум не загрязняет фазу написания кода.
4 способа отказа агентов:
Отравление, ошибка на шаге 5 отравляет все последующие
Отвлечение, агент перестаёт думать и начинает пережёвывать
Спутанность, слишком много инструментов, модель не может рассуждать
Конфликт, системный промпт говорит одно, документ — другоеИ про деньги. KV-кэш: если начало контекста стабильно между вызовами, провайдер кэширует вычисления. Разница в стоимости в 10 раз. Стабильный контент в начало, динамический в конец.
Полный перевод статьи в файле. Кому интересно разобраться, почему агент тупит и что с этим делать.
