TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.36K subscribers
Post #2750 158

Forwarded from Dealer.AI

Немного поясню за_looped_transformer 📦

В посте про спекуляции о размере Astra я уже упомянул такое "новое" направление как looped transformers.

На самом, деле, Дядя оч за новые подходы к архитектурам, инженерии, что даёт ап метрик и пробивает текущее плато продуктивности моделей. 💪 Конечно, хотелось бы и парадигму next token prediction сменить. Но об этом будет говорить в рамках поделок Лекуна. 👍

Однако, луп трансформер не новый подход, он ещё известен с моделей albert и ещё раньше. Первые упоминания в UTS (universal transformers) от гугл аж в 2018. 🚬

Идея не сложная. Вместо роста архитектурной глубины по слоями – числу стаков блока трансформера, а также в ширину – размер hidden state, мы делаем реюз базового блока (например в 22 блока трансформера, ширины D). И делаем это как в Альберт, те выходы с базового блока рекурентно отдаём его на вход этого же блока К раз. Таким способом, мы не растим реальную глубину и ширину, увеличивая размер модели в параметрах, подбираем эффективную базовую глубину и число повторений её рекурентного переиспользования.

К примеру, в статье разборе С. Рашка модель Nanbeige 4.2 (3B) имеет 22 стака по 2,что сопоставимо по вычислениям 44 блокам трансформера. В памяти, это конечно поменьше занимает, но по времени same. Также same по времени обучения, а ещё KV параметров больше на число проходов по стаку, тк над хранить qkv для всех проходов. Т.е. выйгрыш только в емкости весов в памяти gpu. 😮‍💨

Тут конечно влетают идеи у Дяди 😎:

1. Использовать принцип palbert с early exit и lambda слоями. Те модель сама решает с какого блока повтора и слоя выйти заранее.

2. Mixture of Recursions. Иметь роутинг по стэкам для каждого токена. Мы решаем сколько каждый токен пройдёт рекурсивных блоков. Исследование показало, что при достаточно большом размере модели MoR может превосходить обычный трансформер при том же вычислительном бюджете. 🤙

Разница в 1 и 2 подходе, что ponder решает ранний выход для всей последовательности, а MoR для отдельных токенов. 👴

И я очень советую лидерам рнд, кто видит этот пост опробовать оба этих метода, особенно, выделяю MoR тк статья от 2025 года, где указано, что такой сетап может быть эффективнее по KV кэшу, скорости инфера и по глубине.

В целом, это все. Ничего особо сложного. 💪
More from @mlsecfeed
  1. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
  2. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  3. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  4. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
  5. Sep 23, 2026Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов Компания Unreal Labs…
  6. Sep 22, 2026Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →