Memo [2022] - пластическая хирургия против проблем с забыванием
Недавно я рассказывал про обзор так называемого Class-Incremental Learning - постановки задачи, в которой данные для обучения поступают не все сразу, а последовательно - например, по 2 класса.
Если обучать модель в лоб на таких упорядоченных данных, происходит так называемое катастрофическое забывание - знания о новых классах вытесняют уже существующие знания.
Сегодня посмотрим на работу, в которой проблему решают в том числе и с помощью хирургических манипуляций с моделью. Но обо всём по порядку.
Начнём с базы. Почти везде в CIL используются экземпляры - это относительно небольшое количество объектов "предыдущих" классов, которое мы сохранили на память.
Тем или иным способом модель продолжают на них учить, чтобы избежать забывания. В 2021 году вышла статья DER, в которой происходит следующее:
Для каждой новой пачки классов мы создаём новую нейросеть, которая превращает объект в эмбеддинг. Все предыдущие нейросети сохраняем и замораживаем. Конкат всех этих эмбеддинговых моделей подаётся в новый обучаемый линейный слой, который выдаёт финальные вероятности.
Весь этот классификатор мы учим предсказывать правильный ответ на сохранённых экземплярах и на новых классах.
Каждую отдельную эмбеддинг-модель можно делать поменьше, но тем не менее, проблема очевидна - создавать новую модель это дорого по памяти, а их все ещё применять надо.
Авторы Memo задались вопросом - а все ли слои эмбеддинг-модели нужно создавать заново? Проведя парочку экспов, они перепроверили известное представление о том, что первые слои моделей учат более общие представления, а вот специализация в конкретные классы начинается в конце модели.
Получается, что первые слои моделей можно продолжать использовать одни и те же, а создавать новые куски только для последних слоёв в эмбеддинг-модели.
Открытым остаётся другой вопрос - какие куски модели замораживать? Тут всё зависит от начальных условий - если модель была предобучена на большом количестве классов, первые слои нужно вообще сразу заморозить. Если предобучения не было, то надо продолжать их доучивать. Замораживать старые последние слои нужно всегда.
Судя по их замерам, а также замерам того самого обзора, про который я писал, Memo обгоняла всех своих конкурентов в 2022-2023 годах при фиксированном бюджете памяти, хотя разница с тем же DER не очень большая. Так что, до предела явно ещё очень далеко.
@knowledge_accumulator
Post #321
2.95K

- 👍 8
- ❤ 5
- 🔥 3