Нам нужен не просто Meta-Learning
Чтобы система обрела автономность уровня человека, ей недостаточно оптимально обучаться на случайной задаче из какого-то распределения, даже если мета-алгоритм успешно работает на заданиях не из обучающего распределения.
Нам нужен алгоритм, который умеет переиспользовать знания, полученные при решении предыдущих задач, чтобы быстро учиться чему-то новому. Но, в отличие от классического transfer learning и других few-shot подходов, она должна уметь переносить знания на задачи, радикально отличающиеся от того, что было до этого.
То есть нам нужен meta-meta-learning - обучение обучаться новым задачам после обучения старым. Похожие мысли высказывает и автор статьи Learning to acquire novel cognitive tasks with evolution, plasticity and meta-meta-learning [2021], указывая на необходимые 4 уровня вложенности цикла в таком процессе, если применять его в RL - итерации алгоритмов, задач для каждого алгоритма, эпизодов внутри задач и таймстэмпов внутри эпизодов.
В названии статьи есть небольшой обман - автор называет meta-meta-learning-ом обычный meta-learning, применённый в RL. Так что подробно мы её разбирать не будем, там грустная версия того, что было в этом посте.
Самое классное - это то, что на практике добавить этот цикл вложенности просто - нужно прогонять каждый экземпляр алгоритма в процессе его оценки не на 1 задаче, а на N задачах, и оценивать результат по кумулятивной награде по всем задачам. Но на это, конечно, нужно ещё больше вычислительных ресурсов. Когда ресёрчеры перестанут тратить миллиарды долларов на разработку костылей для языковых моделей, может быть, руки дойдут и до этого.
@knowledge_accumulator
Post #93
1.69K

- 👍 16
- 👏 4
- 😁 1