Я начала использовать кодинговых агентов (вроде Codex/Claude Code) в марте 2026 года. Первые 3–4 месяца я применяла их в основном для запуска новых экспериментов на базе уже имевшегося у меня кода рисерч проектов, который я полностью написала сама или с соавторами. Это получалось довольно хорошо: агенты отлично справляются с масштабированием экспериментов, а проверять их работу в таких случаях довольно просто, и это в итоге сэкономило мне массу усилий. Но недавно я начала пробовать использовать Claude Code для новых проектов, попросив его написать много нового кода, используя внешние GitHub репо только как ориентиры, добавив сверху новой логики и датасетов. Агент весьма уверенно заявлял, что написал код и запустил эксперименты. Но когда я решила проверить этот код, то там обнаружились ряд проблем с методологией и выбором гиперпараметров, причем некоторые из них выявились только через некоторое время. Дальше я попросила Claude внимательно перепроверить код. Он действительно нашел несколько ошибок и согласился, что некоторые гиперпараметры были выбраны случайно — он не сумел/не захотел нормально проанализировать внешний GitHub репо и понять, какие гиперпараметры верные. Но один цикл такой проверки и исправления не решил всех проблем. Ради интереса я попросила Claude повторить проверку и исправление еще несколько раз, и в следующих нескольких циклах он находил новые баги, часть из которых влияла на постанову эксперимента, а часть вообще возникала из-за предыдущих исправлений.
К чему это я: это явно не сюрприз, что агенты делают ошибки, а я, безусловно, не самый опытный пользователь подобных агентов, и мои конфиги и промпты далеки от идеала. Но беспокоит меня вот что: я вполне могу представить людей, которые используют агентов для запуска экспериментов и написания статей на основе полученных результатов. Но без нормального понимания методологии исследований и тщательной проверки кода такие эксперименты с высокой вероятностью будут содержать ошибки или даже окажутся некорректными. Понятно, что и до появления агентов не было гарантии, что все эксперименты, описанные в статьях, точно верны. Но теперь порог входа стал сильно ниже, и стало гораздо проще получить неверные результаты, даже не подозревая о наличии в них ошибок.
Возможно, одним из способов решения этой проблемы могло бы быть обязательное требование прикладывать код проекта к сабмиту статьи. Мы могли бы сделать автоматическую проверку структуры экспериментов для тех статей, которые скорее всего будут приняты, и более внимательно ревьюить те работы, в которых эта проверка выявит что-то подозрительное.
Post #1045
3.28K
- ❤ 98
- 👍 43
- 🔥 14
- 👎 2
- 💯 2
- ☃ 1