В данной работе пытаются пронаблюдать различные типы поведения мета-обученных моделей в зависимости от условий. В каких случаях модель просто запоминает трейнсет задач, а в каких обучается обучаться новым задачам?
1) В каждой задаче мета-датасета будем как-то рандомно трансформировать MNIST. Каждый "мета-сэмпл" состоит последовательности пар "объект-метка" - обучающего датасета, и одного объекта без метки. Мета-трансформер должен посмотреть на эту последовательность и в конце предсказать метку для последнего объекта в последовательности. То есть он должен за 1 forward pass выучить классификатор на "датасете" и тут же его применить.
2) Создадим мета-тренировочный сет задач D, состоящий из
X рандомно трансформированных MNIST-подзадач. Кроме того, сделаем мета-тестовый сет задач с другими трансформациями. Можно брать и не MNIST.3) Будем обучать мета-трансформер с размером скрытого слоя
H
Авторы обучают огромный набор мета-трансформеров с разными значениями X и H, и смотрят на поведение модели на мета-тренировочном датасете и на мета-тестовом. И что же они видят?Если использовать достаточно большую модель и достаточно большой сет задач, то модель обучается обучаться на новых задачах. Если задач недостаточно, то модель просто запоминает мета-трейнсет. А если у модели слишком мало параметров, то у неё возникают трудности даже на мета-трейнсете. Этот эффект повторяется и при мета-тестировании на FashionMNIST.
Интересно было бы помучить Аду на предмет out-of-distribution работы, поскольку там как раз и модель большая, и задач много, но это всё-таки RL. Вообще, эта интуиция о том, как форсить обучаемость у мета-моделей, нам ещё понадобится.
@knowledge_accumulator
