TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.68K subscribers
Post #135 2.17K
Towards General-Purpose In-Context Learning Agents [2023] - перспективное направление или тупик?

Не смог обойти стороной новую статью автора VSML, посвящённую In-Context трансформерам (ICT).
В его другой статье была проанализирована способность ICT обучаться обучаемости, а не запоминать все задачи. Иногда это происходит, и те же факторы были перенесены в контекст RL.

По сути данная работа - это модификация Algorithm Distillation. Его идея состоит в том, что мы обучаем ICT на траекториях, сгенерированных при обучении PPO. Таким образом мы хотим научить ICT подражать алгоритму, и по каким-то странным причинам он иногда учится быстрее изначального алгоритма.

В модифицированном же подходе было обнаружено, что если увеличить разнообразие тренировочных задач, т.е. случайно проецировать пространство состояний, то ICT начинает лучше работать на задачах, не похожих на тренировочные.

На мой взгляд, ICT - это плохой путь с точки зрения создания обучающих алгоритмов. Архитектура, в которой на каждом шаге мы смотрим на всю историю своей жизни и делаем одно действие, не масштабируется на длинную историю и не имеет ничего общего с тем, как информацию обрабатывает человек. В некоторых few-shot сценариях это имеет смысл, но кому это надо...

Чтобы ICT умел в совсем out-of-distribution задачи, ему нужно безумное распределение задач, и шагом в этом направлении является AdA, но пока нет свидетельств, что AdA обобщается за пределы XLand 2.0. А это всего лишь 265M-модель!

Иначе говоря, проблема ICT в том, что это перегруженный параметрами обучающий алгоритм. А чем больше параметров в обучающем алгоритме, тем больше он переобучается под тренировочные задачи. Мотивируясь этим, автор и пришёл к VSML изначально.

Возможно, всё дело в том, что это лаба Шмидхубера, и в ней запрещено развивать перспективные направления, чтобы потом можно было говорить, что придумал всё 20 лет назад. В принципе, и на этом спасибо, если что, смогу сам потом масштабированием заняться, как будет возможность 😁

@knowledge_accumulator
  • 👍 7
  • 🔥 2
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →