TGViewer
Data Blog Data Blog @jdata_blog · 2.4K subscribers
Post #550 1.39K
Привет, друзья!
Я добила первое, что хотела добить!

Моя первая статья была, помимо прочего, про различие выбранной метрики в моделях разных семейств. Мы сравнивали encoder-only, encoder-decoder и decoder-only поведение. И я тогда всё не могла разобраться, как мне эффективно брать не все токены, чтобы корректно считать метрику.

Так появился драфт — и вот он дожил до нового туториала: «Три LM-архитектуры — три пространства»

Проблема: при задачах языкового моделирования (хоть мы и живём в эпоху декодеров) иногда полезно сравнить и поработать с эмбеддингами разных моделей. Энкодеры, например, быстрые и дают классные представления для классификации и поиска. Энкодер-декодеры дают представление входа, которое училось быть удобным для чтения декодером. А у декодеров «эмбеддинг» — это вообще побочный продукт: их учили продолжать текст, а не описывать его.

Внутри они устроены почти одинаково в смысле формулы внимания, но учатся на разные задачи, и маски внутри у них разные (если помните Attention наизусть — то ещё и в том, откуда берутся Q, K, V).

И это порождает геометрические приколы! В туториале разбираем их на очень малышах: BERT, GPT-2, T5 и BART.

Что внутри:

1. Теория трёх масок — одна формула внимания, три способа её замаскировать.
2. Информативность токенов и нюансы оценки.
3. Геометрия (основная часть) — метрики анизотропия, спектр, participation ratio, CKA и что они обязаны показать по постановке из-за архитектуры.
4. Вывод — а зачем это на практике + классические (мои в том числе) фейлы.

Всё считается на быстренько, есть ноутбучек и красивые картинки!

Сдаю ссылки:
Хабр
Ноутбучек в коллаб
Ноутбучек на github

Тут должен быть какой-то call to action, знаете ли, ну, допустим, ставьте огонечки и не ставьте говна, вот)
Всем отличной недели, время добивать остальное!
Хабр Три Language modeling архитектуры — три пространства Какой кодер, такой и result, друзья. При проектировании эксперимента мы тестируем разные архитектуры. В прикладном применении нам важен выход и побочные характеристики (скорость, поддержка...
  • 🔥 38
  • ❤ 10
  • 👏 6
  • 😁 1
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →