TGViewer
Data, Stories and Languages Data, Stories and Languages @datastorieslanguages · 3.71K subscribers
Post #751 1.82K
Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели

Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.

Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.

Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.

И иногда агенты неожиданно тупо ломались:

- Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз.
- Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк.
- Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел.
- неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками.
- Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное.

Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно.

Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое.

Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам.

Блог
Medium
Ycombinator

#ai #kaggle
Andrey Lukyanenko How AI agents helped me win a Kaggle silver medal — and how they failed me A write-up of the ROGII Wellbore Geology Prediction competition: how I adopted an AI driven approach and got a silver medal.
  • 🔥 14
  • 👍 11
More from @datastorieslanguages
  1. Sep 21, 2026​​DeepSeek-V4.1-Flash: Frontier Agents on a Smaller Memory Budget Большая часть недавнего…
  2. Sep 17, 2026Data & AI London Meetup https://www.meetup.com/data-ai-london/events/316165116/ 22 сентябр…
  3. Sep 16, 2026photo post
  4. Sep 15, 2026​​GDE Swag Недавно я рассказывал как я пробовал Antigravity в рамках программы Google Deve…
  5. Sep 13, 2026Рекомендую канал Хочу порекомендовать вам интересный канал о регулировании систем ИИ по вс…
  6. Sep 12, 2026Post #755
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →