Самообучающиеся агенты
На днях разбирал winning solution с конкурса ERC3 по построению ИИ-агентов. Парень выиграл с системой, где агенты сами себя улучшают - без человека.
Архитектура довольно простая: основной агент на Anthropic SDK с Claude Opus 4.5, все инструменты описаны в одном файле, динамические HTTP-запросы к API бенчмарка. Ничего сложного.
Системный промпт собрал все правила из корпоративной вики в компактный алгоритм: проверить личность, верифицировать права, собрать данные, вернуть результат.
Но самое интересное - это три агента, которые работают в связке.
Первый агент запускает бенчмарк и решает задачи, логирует всё подряд. Второй анализирует логи проваленных задач и формулирует гипотезы, что пошло не так. Третий читает эти гипотезы, решает что внедрить и генерирует новую версию промпта.
Получается замкнутый цикл: прогнал бенчмарк → проанализировал ошибки → пропатчил промпт → повторил.
Финальный промпт, который пошел в продакшн, был 80-й генерацией. Он автоматически эволюционировал из базовой версии через десятки итераций, каждая из которых фиксила конкретные паттерны ошибок.
Никакого ручного prompt engineering. Просто агенты, улучшающие агентов.
Как вам такой подход? Пробовали что-то похожее?
Post #492
1.69K
- 🔥 31