TGViewer
Python Portal Python Portal @pythonportal · 50.3K subscribers
Post #5999 4.93K
Kimi снова это сделали!

В Kimi K3 они разработали новый подход к работе с residual connections (остаточными связями) в Transformer-архитектурах — механизмом, который практически не менялся со времён ResNet в 2015 году.

В стандартном Transformer каждый слой добавляет свой выход обратно к входу с фиксированным весом 1.
То есть каждый слой получает одинаковую важность независимо от того, что именно нужно конкретному токену.
При глубине в 40, 60, 80+ слоёв скрытое состояние превращается в сумму всех предыдущих представлений с одинаковыми весами.

Более глубоким слоям приходится создавать всё более крупные выходные значения, чтобы хоть как-то влиять на итоговое представление. При масштабировании моделей это делает обучение менее стабильным.

Attention Residuals решают эту проблему, заменяя фиксированное сложение на softmax attention по глубине сети.
Теперь каждый слой сам учится определять, сколько информации брать из каждого предыдущего слоя — в зависимости от входа. Благодаря этому разные токены могут извлекать разные представления из разных слоёв, ориентируясь на то, что действительно полезно.

Идея повторяет то, что оригинальный Transformer сделал с последовательностями.

RNN сжимали всю предыдущую информацию о токенах в одно состояние, которое передавалось по времени. Transformer заменил это механизмом attention. Attention Residuals применяют ту же идею, но уже к глубине модели.

Когда Kimi впервые проверили этот подход на своей модели Kimi Linear 48B в марте, Block AttnRes показал такую же производительность, как базовая модель, обученная с в 1,25 раза большим количеством вычислений, при этом добавив менее 2% задержки на инференсе.

Kimi K3 стала первой моделью, где этот подход применяется в масштабе фронтирной модели: 2,8 трлн параметров, вместе с Kimi Delta Attention, который обеспечивает до 6,3× более быстрое декодирование при работе с контекстом размером в миллион токенов.

👉 @PythonPortal
  • 👍 16
  • ❤ 5
More from @pythonportal
  1. Oct 4, 2026«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить мате…
  2. Oct 3, 2026«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024…
  3. Oct 3, 2026Tencent выпустила новую модель для перевода, которая, по их словам, обходит Google Transla…
  4. Oct 2, 2026Один из лучших ресурсов по производительности SQL: use-the-index-luke.com 👉 @PythonPortal
  5. Oct 2, 2026Многие постоянно путаются в этом: В чём на самом деле разница между 100 МБ/с и 100 Мбит/с?…
  6. Oct 1, 2026Исследователи MIT математически доказали, что ChatGPT устроен так, что может затягивать по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →