TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #88 1.59K
General-Purpose In-Context Learning by Meta-Learning Transformers [2022] - экспериментальный анализ феномена мета-обучения

В данной работе пытаются пронаблюдать различные типы поведения мета-обученных моделей в зависимости от условий. В каких случаях модель просто запоминает трейнсет задач, а в каких обучается обучаться новым задачам?

1) В каждой задаче мета-датасета будем как-то рандомно трансформировать MNIST. Каждый "мета-сэмпл" состоит последовательности пар "объект-метка" - обучающего датасета, и одного объекта без метки. Мета-трансформер должен посмотреть на эту последовательность и в конце предсказать метку для последнего объекта в последовательности. То есть он должен за 1 forward pass выучить классификатор на "датасете" и тут же его применить.
2) Создадим мета-тренировочный сет задач D, состоящий из X рандомно трансформированных MNIST-подзадач. Кроме того, сделаем мета-тестовый сет задач с другими трансформациями. Можно брать и не MNIST.
3) Будем обучать мета-трансформер с размером скрытого слоя H

Авторы обучают огромный набор мета-трансформеров с разными значениями X и H, и смотрят на поведение модели на мета-тренировочном датасете и на мета-тестовом. И что же они видят?

Если использовать достаточно большую модель и достаточно большой сет задач, то модель обучается обучаться на новых задачах. Если задач недостаточно, то модель просто запоминает мета-трейнсет. А если у модели слишком мало параметров, то у неё возникают трудности даже на мета-трейнсете. Этот эффект повторяется и при мета-тестировании на FashionMNIST.

Интересно было бы помучить Аду на предмет out-of-distribution работы, поскольку там как раз и модель большая, и задач много, но это всё-таки RL. Вообще, эта интуиция о том, как форсить обучаемость у мета-моделей, нам ещё понадобится.

@knowledge_accumulator
  • 🔥 7
  • 👍 5
  • 🤔 4
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →