TGViewer
AI Makes Me Hate AI Makes Me Hate @aimakesmehate · 564 subscribers
Post #187 445

Forwarded from Data, Stories and Languages

Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели

Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.

Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.

Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.

И иногда агенты неожиданно тупо ломались:

- Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз.
- Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк.
- Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел.
- неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками.
- Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное.

Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно.

Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое.

Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам.

Блог
Medium
Ycombinator

#ai #kaggle
Andrey Lukyanenko How AI agents helped me win a Kaggle silver medal — and how they failed me A write-up of the ROGII Wellbore Geology Prediction competition: how I adopted an AI driven approach and got a silver medal.
  • ❤ 5
More from @aimakesmehate
  1. Sep 22, 2026Популярные скиллы и их адопшен Сейчас я много работаю над харнессом и тп. И одна из главны…
  2. Sep 21, 2026Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля.…
  3. Sep 18, 2026На подлодке было много вопросов. После доклада мы еще на час остались на неофициальную час…
  4. Sep 17, 2026впервые закончил недельную подписку на 200$ за два дня просидев на астре в effort ultra +…
  5. Sep 16, 2026скилл чтоб делать презы https://github.com/slidevjs/slidev
  6. Sep 16, 2026video post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →