TGViewer
Information Retriever Information Retriever @inforetriever · 4.12K subscribers
Post #55 2.53K
Про ML соревнования.

Свои первые деньги, не связанные со студенческими стипендиями, я заработал ~шесть лет назад, заняв второе место в ML соревновании. На часть из полученных 200 тысяч я собрал мощный комп с 1080ti, чтобы нейроночки обучать и в ведьмака играть :)

Первые два года изучения ML меня очень сильно драйвили соревнования, вплоть до того, что я посвящал им почти все свободное время. Подозреваю, что от улучшения метрик и карабканья по лидерборду у меня выделяется довольно большое количество серотонина, потому что я тогда фигачил без отдыха месяцами, на чистом энтузиазме.

Мой первый контест — Sberbank Data Science Journey 2017; определение релевантности вопроса параграфу текста. Обогнал своего препода с кафедры, заняв 8-е место. Изучал NLP и классический ML буквально по ходу соревнования, и такое изучение теории на практике для меня работало очень хорошо. Еще помню, что там часть вопросов была синтетическая, сгенерированная, и надо было научиться отличать их от настоящих, чтобы сразу ставить им нолики. Я применил марковскую цепь как языковую модель для генерации синтетики и очень радовался, что это сработало :)

Основное, что я вынес с соревнований (и вспомнил во время написания этого поста):

1. Успешность идеи очень сильно зависит от реализации. У контестов, как правило, были чаты, где участники активно общались по ходу соревнования. Я неоднократно наблюдал, как те же идеи, что давали много профита у меня, у других людей не срабатывали. И наоборот. Осталось ощущение, что почти из любой идеи можно выжать профит, если рассмотреть ее под правильным углом.

На работе с этим сложнее: конкретные эксперименты проводит один человек, и если эксперименты закончились неудачно, то всегда остается некоторая неопределенность, почему так получилось. Здесь помогают (1) статьи, по которым мы иногда точно понимаем, что что-то должно работать. (2) правильные формулировки задач, смещение акцента с оффлайн-метрик базового качества на интерпретируемые вопросы и гипотезы, (3) перепроверки друг за другом, а также (4) возвращение к старым направлениям экспериментов.

2. Получил очень много опыта по ведению экспериментов. С одной стороны, оптимизировать какое-то не совсем интерпретируемое чиселко в отрыве от бизнеса — не очень продуктивно. Соревнования сильно разнятся по степени "осмысленности", это зависит от осознанности организаторов. С другой стороны — в отличие от работы, здесь ты соревнуешься с другими людьми, и есть возможность себя относительно них очень хорошо откалибровать. Насколько хорошо ты ставишь эксперименты, а именно: находишь правильные гипотезы, быстро их проверяешь, правильно реализуешь.

На работе все сильно зависит от самокритичности человека, это иногда и плохо, и хорошо. Из неудачной серии экспериментов можно сделать совсем разные выводы. Самый частый вывод — что гипотеза неудачная или задача нерешаемая; он особенно плох, если не получилось при этом сформировать правильную интуицию происходящего. В соревнованиях же, если ты находишься низко по лидерборду, то у этого может быть только одна причина :)

Итого, плюсы соревнований:
* опыт экспериментирования
* возможность откалиброваться относительно других экспериментаторов
* доп. источник заработка

Минусы:
* осмысленность поставленных задач сильно зависит от осознанности организаторов
* прошлый пункт, на самом деле, еще иногда приводит к страшным эффектам по типу ликов в данных и к совсем необобщающимся на бизнес зависимостям, без которых высокую метрику не получишь
* если у вас хорошая работа, то на ней задачи интересней, и необходимость в соревнованиях отпадает. На работе у меня есть возможность самому формулировать задачи, и при этом мне доступны почти неограниченные ресурсы с т.з. данных и железа. После выхода в Яндекс ~3.5 года назад, я перестал участвовать в соревнованиях

На бустерс @boosters после долгого молчания платформы началось новое соревнование по рекомендашкам от hh. Вашего покорного слугу на лидерборде тоже можно найти. Решил тряхнуть стариной :)
  • 👍 25
  • 🔥 11
  • 🏆 2
More from @inforetriever
  1. Sep 19, 2026А я сегодня стал лауреатом премии Yandex ML Prize! В номинации “Преподаватели”. Спасибо вс…
  2. Sep 19, 2026Я не покемон, но меня можно сегодня поймать на Practical ML Conf :)
  3. Sep 18, 2026WARNING: пост на отвлеченную тему)) Я люблю историю. В детстве мне попадались различные кн…
  4. Sep 15, 2026Yandex Advanced Personal Intelligence Lab (лаборатория перспективных исследований персонал…
  5. Sep 15, 2026photo post
  6. Sep 13, 2026Небольшой тизер :) Таксую чисто для души (шучу)
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →