Любопытно, что мы создаем текущий ВсОШ ИИ именно как олимпиаду по ML "с идеями". Любая задача практического тура, хотя по формату и очень похожа на любое соревнование с Кагла, отличается тем, что вместо реальных данных и реальной задачи мы создаем задачу так, чтобы ее было "интересно" решать, и нужно было что-то "увидеть".
В реальных задачах (и соревнованиях с кагла тоже) часто бывают особенности, которые делают их неудобными для формата "реши соревнование за 1-2 часа" (как на ВсОШ). Например, если это ML, то часто лучшая из идей - это использовать катбуст. Просто катбуст действительно мощный и в задаче действительно может не быть ничего другого, что он не может вытащить:) Лет 5-10 назад такие задачи, кстати, чаще могли бы быть интересными, там приходилось бы как-нибудь хитро генерить фичи или делать target encoding, но уже не сейчас)
Если это DL, то часто либо файнтюн дает лучший скор, либо задачу просто невозможно решить за 1-2 часа - слишком много данных, процесс обучения долго заводится, нужно сделать много экспериментов и так далее:)
И во всех задачах бывает так, что не очевидно, где именно искать следующее хорошее решение. Приходится попробовать десяток идей, чтобы найти одну стоящую - это тоже не формат 1-2 часового соревнования.
Еще одна проблема, что шаги решения могут быть неравноценными. Например, обучив катбуст, можно получить 80% скора, и потом всякими улучшениями добивать ваше решение, но наверное, в олимпиадах за самую очевидную идею не должны даваться 80% результата)
Что же тогда такое соревнования по ML "на идею"? Мы уже видели такие на IOAI, и вот теперь они появляются на ВсОШ.
Обычно, для решения нужно что-то "заметить". Например, на задаче по классификации с межнара, нужно было заметить, что раз у вас всего 4 размеченных объекта (с таргетом), и несколько сотен неразмеченных, значит вам может помочь кластеризация. После несложной кластеризации можно было увидеть, что действительно объекты разбиваются на 2 кластера - и их можно было разметить как класс 0 и класс 1. Другой подход, который мог бы сработать (но не сработал тут) - это пседолейблинг - но для него тут слишком мало размеченных данных и слишком много фичей (аж 4:). Псевдолейблинг - это тоже идея, которая может пригодиться при решении таких задач.
Словарь (список) этих идей пока не сформировался, и это делает составление этих задач еще более интересным - это буквально возможность предложить то, что может стать предметом изучения "олимпиадного" ML/DL в следующие годы.
https://t.me/vsosh_ii/9