TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.3K subscribers
Post #5555 3.23K
Как геймеры в своё время проспонсировали железо для глубокого обучения, так и нынешние пользователи LLM с CoT проспонсируют железо для следующего поколения ИИ. Классический текстовый CoT -- это крайне неэффективный способ трекинга состояния. Токенов или ещё каких-то состояний можно было бы тратить на порядки меньше. Статья в целом про это, что топология трансформеров должна поменяться.

The Topological Trouble With Transformers
Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne Liu
Paper: https://arxiv.org/abs/2604.17121
Review: https://arxiviq.substack.com/p/the-topological-trouble-with-transformers
Code: N/A
Model: N/A

# TL;DR

ЧТО сделали: Авторы представили глубокую архитектурную критику стандартных полносвязных (feedforward) трансформеров, подробно объяснив, почему их сугубо однонаправленная топология принципиально ограничивает динамическое отслеживание состояния (state tracking). Чтобы наметить пути развития будущих архитектур, они предложили подробную двумерную таксономию, которая классифицирует рекуррентные и непрерывно мыслящие варианты трансформеров по оси рекуррентности (глубина или шаги) и соотношению входных токенов к шагам рекуррентности.

ПОЧЕМУ это важно: Современные ИИ-системы сильно полагаются на неэффективные с вычислительной точки зрения костыли вроде явной цепочки рассуждений (CoT), чтобы обойти бутылочное горлышко между глубиной модели и её состоянием. Эта работа показывает, почему такие явные стратегии неэффективны, и призывает к стратегическому переходу к неявной динамике рекуррентных активаций. Это даёт чёткую дорожную карту для проектирования фундаментальных моделей, способных поддерживать долгосрочную когнитивную согласованность.

Для практиков: Для сложных задач последовательного отслеживания стандартные трансформеры требуют глубины, растущей линейно с длиной контекста. Вместо того чтобы тратить бюджет токенов на раздутый CoT, исследователям стоит присмотреться к гибридным решениям с рекуррентными связями SSM, DeltaNet или подходам с неявным планированием во внутреннем пространстве активаций.

Снова читать про рекуррентность тут: https://t.me/gonzo_ML_podcasts/4019
arXiv.org The Topological Trouble With Transformers Transformers encode structure in sequences via an expanding contextual history. However, their purely feedforward architecture fundamentally limits dynamic state tracking. State tracking -- the...
  • ❤ 7
  • 🔥 3
  • 👍 1
  • 👌 1
  • 🥴 1
More from @gonzo_ml
  1. Sep 20, 2026photo post
  2. Sep 20, 2026В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрова…
  3. Sep 20, 2026Мемы про муху не прекращаются. Извинити.
  4. Sep 20, 2026photo post
  5. Sep 20, 2026photo post
  6. Sep 20, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →