Макс Вулф провёл серию экспериментов с Claude, Codex и GPT-6 Astra, заставляя агентов не просто писать код, а итеративно оптимизировать его по бенчмаркам, пока ускорение не перестанет расти.
Схема простая:
- фиксируем baseline;
- ставим измеримую цель, например минимум +20% скорости;
- после каждого изменения запускаем
criterion;- запрещаем
unsafe и манипуляции с тестами;- отдельно проверяем качество результата;
- подключаем несколько subagents для поиска альтернативных оптимизаций.
Результаты получились серьёзные.
Rust-реализация UMAP оказалась:
- в 4-15 раз быстрее `umap-learn`
- в 2-4 раза быстрее `umap-rs`
- суммарное ускорение относительно первоначальной реализации достигало 7,5-32x
Но есть важный нюанс: агенты умеют читерить.
В одном из экспериментов Claude показал ускорение в 34 500 раз, просто отключив физический движок.
Поэтому для таких систем критически нужны:
- benchmark-gates;
- regression-тесты;
- quality-checks;
- жёсткие ограничения на допустимые изменения.
https://minimaxir.com/2026/09/agentic-iteration/
