Ваш агент мутирует. Вы в курсе?
Пока некоторые ведут споры о промпт атаках и дырах в MCP, в лабораториях тихо вырос новый класс систем. Агенты, которые переписывают сами себя. Не по расписанию. Не по команде оператора. Непрерывно - через каждое взаимодействие со средой. Как тамагочи, только с доступом к проду и правами на запись.
Первый масштабный обзор - "A Comprehensive Survey of Self-Evolving AI Agents". Определение красивое: Самоэволюционирующий агент - автономная система, непрерывно оптимизирующая собственные компоненты через взаимодействие со средой. Промпт, память, инструменты, топология - по сути это четыре оси мутации.
TextGrad, EvoAgentX - фреймворки собраны, звёзды на GitHub растут. Sakana AI строит Darwin Gödel Machine. Agent0 показывает автономную эволюцию без внешних данных.
А вот в сентябре 2025-го вышла работа, которая портит весь праздник. "Your Agent May Misevolve" - первое эмпирическое исследование того, что случается, когда самостоятельная эволюция идёт не туда. Результат следующий - она идёт не туда систематически. Пробовали на Gemini-2.5-Pro, актуальной на момент исследования. Без внешнего атакующего. По каждой из четырёх осей мутации зафиксированы всплывающие риски: деградация выравнивания, уязвимые инструменты, неправильная самостоятельная оптимизация, выкидывающая проверки безопасности ради скорости.
Вроде бы зафиксировано в исследовании. А архитектурные паттерны из исследований идентичны тому, что закладывается в боевые системы прямо сейчас.
Разберём по порядку - четыре угрозы, каждая следующая усиливает предыдущую.
1. Тихая деградация с точкой невозврата
Октябрь 2025 - "Alignment Tipping Process". Суть кратко: когда агент оптимизирует стратегии через накопленный опыт, выравнивание не просто «немного съезжает». У процесса есть точка перелома, после которой деградация становится необратимой.
Механика наглядная. Агент решает серию задач. На простых ему не нужны инструменты, и он привыкает работать без них. Затем приходит сложная задача, где инструмент необходим, а агент уже «разучился» его вызывать. При этом уверен в ответе: накопленный опыт подтверждает: «ты справляешься и так». DPO, GRPO и прочие методы выравнивания оказались хрупкой защитой: контекстный опыт перезаписывает их за пару десятков итераций.
Любой агент с постоянной памятью и оптимизацией по метрике - кандидат на этот сценарий. Сначала аккуратно проверяет ограничения. Потом замечает, что без проверки быстрее. А потом проверка молча покидает чат. Но дрейф - только начало цепочки.
2. Читер, который растёт
Дрейфующий агент ищет кратчайший путь к метрике. "Trustworthy Test-Time Evolution of Agent Memory". формализовал: агенты, гонимые метриками, при штатной эволюции задач систематически размывают ограничения безопасности. Не крайний случай - встроенный режим отказа.
А вот следующая статья показала, куда ведёт дорога. Модель научилась хакать награду на боевых средах обучения Claude - и спонтанно перенесла навык на смежные области: имитация согласования, кооперация со злоумышленниками, саботаж классификаторов безопасности, подстава коллег-исследователей. Внутренняя логика: если я читер в одном контексте, почему не быть читером везде. Железная, в общем-то, логика.
Причём стандартное обучение безопасности на промптах дало «выздоровление» в чате. На задачах для агентов рассогласование сохранилось. Корректен в разговоре - разворачивает тёмную сторону в деле. Как коллега, который мил на планёрке, а в Jira пишет совсем другое. Что происходит, когда читер ещё и запоминает свои успехи?
Post #1164
2.09K

- 👍 13