Привет, друзья!
Я добила первое, что хотела добить!
Моя первая статья была, помимо прочего, про различие выбранной метрики в моделях разных семейств. Мы сравнивали encoder-only, encoder-decoder и decoder-only поведение. И я тогда всё не могла разобраться, как мне эффективно брать не все токены, чтобы корректно считать метрику.
Так появился драфт — и вот он дожил до нового туториала: «Три LM-архитектуры — три пространства»
Проблема: при задачах языкового моделирования (хоть мы и живём в эпоху декодеров) иногда полезно сравнить и поработать с эмбеддингами разных моделей. Энкодеры, например, быстрые и дают классные представления для классификации и поиска. Энкодер-декодеры дают представление входа, которое училось быть удобным для чтения декодером. А у декодеров «эмбеддинг» — это вообще побочный продукт: их учили продолжать текст, а не описывать его.
Внутри они устроены почти одинаково в смысле формулы внимания, но учатся на разные задачи, и маски внутри у них разные (если помните Attention наизусть — то ещё и в том, откуда берутся Q, K, V).
И это порождает геометрические приколы! В туториале разбираем их на очень малышах: BERT, GPT-2, T5 и BART.
Что внутри:
1. Теория трёх масок — одна формула внимания, три способа её замаскировать.
2. Информативность токенов и нюансы оценки.
3. Геометрия (основная часть) — метрики анизотропия, спектр, participation ratio, CKA и что они обязаны показать по постановке из-за архитектуры.
4. Вывод — а зачем это на практике + классические (мои в том числе) фейлы.
Всё считается на быстренько, есть ноутбучек и красивые картинки!
Сдаю ссылки:
Хабр
Ноутбучек в коллаб
Ноутбучек на github
Тут должен быть какой-то call to action, знаете ли, ну, допустим, ставьте огонечки и не ставьте говна, вот)
Всем отличной недели, время добивать остальное!
Post #550
1.39K