TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.3K subscribers
Post #6011 2.17K
Очень прикольная работа, продолжает другую работу этих же авторов, где проблема отслеживания состояния внутри трансформеров (которое только уползает вверх и ограничено глубиной сети) только обозначалась. Здесь же она решается довольно элегантным образом, используя свойство аддитивности residual stream. Если подмешивать в более ранние слои репрезентации с более поздних, то проблема снимается. Никакого дообучения вообще.

Recirculation
Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu
Paper: https://arxiv.org/abs/2608.17981
Review: https://arxiviq.substack.com/p/recirculation
Code: N/A
Model: N/A

ЧТО сделали: Авторы предложили рециркуляцию (recirculation) — метод модификации прямого прохода, превращающий стандартные feedforward-трансформеры в динамические системы на инференсе. Подход подмешивает нормированную часть скрытых активаций из глубоких слоёв обратно в ранние слои на последующих шагах генерации, не меняя при этом предобученные веса.

ПОЧЕМУ это важно: Обычные feedforward-трансформеры не способны произвольно отслеживать состояние на длинных последовательностях, поскольку передача контекста принципиально ограничена глубиной сети. Рециркуляция предлагает вычислительно дешёвый механизм без необходимости дообучения, который опирается на линейное выравнивание residual stream для поддержания устойчивых скрытых состояний. Это даёт заметное снижение перплексии и прирост качества на прикладных задачах (например, относительный рост на 21% на GSM8k).

Для практиков: Современные LLM часто теряют контекст диалога или меняющийся смысл понятий, так как вычисляют представления строго по слоям снизу вверх. Вместо дорогостоящего изменения архитектуры или файнтюнинга авторы показывают, что в готовых моделях уже заложено нужное внутреннее выравнивание представлений. Подмешивая небольшую долю глубоких репрезентаций в ранние слои по ходу чтения текста, можно существенно повысить стабильность контекста, цепочки рассуждений и точность следования инструкциям на инференсе, вообще не трогая параметры модели.

Рециркулировать тут: https://t.me/gonzo_ML_podcasts/4804
arXiv.org Recirculation We describe an inference-time architectural enhancement for off-the-shelf foundation models that markedly reduces perplexity and boosts accuracy across generation and reasoning tasks. Our approach...
  • 🔥 10
  • ❤ 3
  • 👍 3
More from @gonzo_ml
  1. Sep 22, 2026photo post
  2. Sep 22, 2026photo post
  3. Sep 22, 2026photo post
  4. Sep 22, 2026Давайте для разнообразия про что-то полезное в народном хозяйстве. Про погоду. WeatherNext…
  5. Sep 21, 2026Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy…
  6. Sep 21, 2026Хотите доказать своего Навье-Стокса-Чейна? Это не так далеко, как кажется.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →