TGViewer
DLStories DLStories @dl_stories · 15.6K subscribers
Post #1045 3.28K
Я начала использовать кодинговых агентов (вроде Codex/Claude Code) в марте 2026 года. Первые 3–4 месяца я применяла их в основном для запуска новых экспериментов на базе уже имевшегося у меня кода рисерч проектов, который я полностью написала сама или с соавторами. Это получалось довольно хорошо: агенты отлично справляются с масштабированием экспериментов, а проверять их работу в таких случаях довольно просто, и это в итоге сэкономило мне массу усилий. Но недавно я начала пробовать использовать Claude Code для новых проектов, попросив его написать много нового кода, используя внешние GitHub репо только как ориентиры, добавив сверху новой логики и датасетов. Агент весьма уверенно заявлял, что написал код и запустил эксперименты. Но когда я решила проверить этот код, то там обнаружились ряд проблем с методологией и выбором гиперпараметров, причем некоторые из них выявились только через некоторое время. Дальше я попросила Claude внимательно перепроверить код. Он действительно нашел несколько ошибок и согласился, что некоторые гиперпараметры были выбраны случайно — он не сумел/не захотел нормально проанализировать внешний GitHub репо и понять, какие гиперпараметры верные. Но один цикл такой проверки и исправления не решил всех проблем. Ради интереса я попросила Claude повторить проверку и исправление еще несколько раз, и в следующих нескольких циклах он находил новые баги, часть из которых влияла на постанову эксперимента, а часть вообще возникала из-за предыдущих исправлений.

К чему это я: это явно не сюрприз, что агенты делают ошибки, а я, безусловно, не самый опытный пользователь подобных агентов, и мои конфиги и промпты далеки от идеала. Но беспокоит меня вот что: я вполне могу представить людей, которые используют агентов для запуска экспериментов и написания статей на основе полученных результатов. Но без нормального понимания методологии исследований и тщательной проверки кода такие эксперименты с высокой вероятностью будут содержать ошибки или даже окажутся некорректными. Понятно, что и до появления агентов не было гарантии, что все эксперименты, описанные в статьях, точно верны. Но теперь порог входа стал сильно ниже, и стало гораздо проще получить неверные результаты, даже не подозревая о наличии в них ошибок.

Возможно, одним из способов решения этой проблемы могло бы быть обязательное требование прикладывать код проекта к сабмиту статьи. Мы могли бы сделать автоматическую проверку структуры экспериментов для тех статей, которые скорее всего будут приняты, и более внимательно ревьюить те работы, в которых эта проверка выявит что-то подозрительное.
  • ❤ 98
  • 👍 43
  • 🔥 14
  • 👎 2
  • 💯 2
  • ☃ 1
More from @dl_stories
  1. Sep 15, 2026Что делать, если базу в Data Science уже собрал? Можно продолжать учиться. А можно за год…
  2. Sep 14, 2026На основной конференции ECCV я презентовала статью EquiSteer: Cross-Attention Steering Tow…
  3. Sep 10, 2026Я, Борис @boris_again и какой-то рандомный чел проф из Оксфорда. Вот так вот выглядит конф…
  4. Sep 10, 2026Открыт набор на осенний семестр Deep Learning School DLS — онлайн-школа, где мы учим deep…
  5. Sep 8, 2026В мае я писала, что меня позвали в программный комитет Practical ML Conf. С тех пор мы про…
  6. Sep 1, 2026А сегодня ещё, наконец, вышел пост на Lesswrong по этой статье, его написал мой соавтор. Е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →