TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #321 2.95K
Memo [2022] - пластическая хирургия против проблем с забыванием

Недавно я рассказывал про обзор так называемого Class-Incremental Learning - постановки задачи, в которой данные для обучения поступают не все сразу, а последовательно - например, по 2 класса.

Если обучать модель в лоб на таких упорядоченных данных, происходит так называемое катастрофическое забывание - знания о новых классах вытесняют уже существующие знания.

Сегодня посмотрим на работу, в которой проблему решают в том числе и с помощью хирургических манипуляций с моделью. Но обо всём по порядку.

Начнём с базы. Почти везде в CIL используются экземпляры - это относительно небольшое количество объектов "предыдущих" классов, которое мы сохранили на память.

Тем или иным способом модель продолжают на них учить, чтобы избежать забывания. В 2021 году вышла статья DER, в которой происходит следующее:

Для каждой новой пачки классов мы создаём новую нейросеть, которая превращает объект в эмбеддинг. Все предыдущие нейросети сохраняем и замораживаем. Конкат всех этих эмбеддинговых моделей подаётся в новый обучаемый линейный слой, который выдаёт финальные вероятности.

Весь этот классификатор мы учим предсказывать правильный ответ на сохранённых экземплярах и на новых классах.

Каждую отдельную эмбеддинг-модель можно делать поменьше, но тем не менее, проблема очевидна - создавать новую модель это дорого по памяти, а их все ещё применять надо.

Авторы Memo задались вопросом - а все ли слои эмбеддинг-модели нужно создавать заново? Проведя парочку экспов, они перепроверили известное представление о том, что первые слои моделей учат более общие представления, а вот специализация в конкретные классы начинается в конце модели.

Получается, что первые слои моделей можно продолжать использовать одни и те же, а создавать новые куски только для последних слоёв в эмбеддинг-модели.

Открытым остаётся другой вопрос - какие куски модели замораживать? Тут всё зависит от начальных условий - если модель была предобучена на большом количестве классов, первые слои нужно вообще сразу заморозить. Если предобучения не было, то надо продолжать их доучивать. Замораживать старые последние слои нужно всегда.

Судя по их замерам, а также замерам того самого обзора, про который я писал, Memo обгоняла всех своих конкурентов в 2022-2023 годах при фиксированном бюджете памяти, хотя разница с тем же DER не очень большая. Так что, до предела явно ещё очень далеко.

@knowledge_accumulator
  • 👍 8
  • ❤ 5
  • 🔥 3
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →