TGViewer
Python Portal Python Portal @pythonportal · 50.3K subscribers
Post #5857 5.9K
Google выложила исследование, которое может пошатнуть монополию трансформеров.
Последние 7 лет почти все крупные модели, от ChatGPT и Claude до Gemini, строились на одной и той же архитектуре: Transformer.

Проблема в том, что у трансформеров дорогая память. Чтобы учитывать контекст, они сравнивают каждый токен со всеми остальными. Из-за этого вычислительная стоимость растёт квадратично вместе с длиной контекста.
Альтернатива существует давно: RNN. Они быстрые, дешёвые и работают линейно, но страдают от другой проблемы.

Чем длиннее последовательность, тем больше информации они забывают.
Google предлагает компромисс.

В работе Memory Caching: RNNs with Growing Memory исследователи добавили RNN возможность сохранять промежуточные состояния в кэш по мере обработки последовательности.

Вместо фиксированной памяти модель получает память, которая может расти вместе с длиной контекста.
Авторы реализовали несколько вариантов механизма, включая выборочное сохранение состояний, где модель сама решает, какие участки контекста стоит запомнить.

На задачах с длинным контекстом и интенсивным использованием памяти такие Memory-Cached RNN заметно сократили разрыв с трансформерами.

При этом им не требуется платить квадратичную цену за обработку всей истории на каждом шаге.
Самая интересная мысль из статьи: возможно, для длинных диалогов и больших контекстов необязательно постоянно прогонять всю историю через attention.

Если подход масштабируется так же хорошо, как выглядит на бумаге, нас может ждать первая за долгое время серьёзная альтернатива Transformer-архитектуре.

https://arxiv.org/pdf/2602.24281

👉 @PythonPortal
  • ❤ 26
  • 👍 8
More from @pythonportal
  1. Oct 5, 2026DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащи…
  2. Oct 4, 2026Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный уче…
  3. Oct 4, 2026«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить мате…
  4. Oct 3, 2026«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024…
  5. Oct 3, 2026Tencent выпустила новую модель для перевода, которая, по их словам, обходит Google Transla…
  6. Oct 2, 2026Один из лучших ресурсов по производительности SQL: use-the-index-luke.com 👉 @PythonPortal
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →