TGViewer
Python Portal Python Portal @pythonportal · 50.2K subscribers
Post #5775 5.9K
DeepSeek выпустили фундаментальную переработку архитектуры трансформера.

Она решает проблему «кризиса идентичности», которая ломает очень большие модели ИИ.

Последние десять лет почти все крупные модели ИИ опирались на остаточные связи. Это быстрые обходные пути, которые позволяют сигналу перескакивать через слои и сохранять стабильность обучения.

Без них глубокие сети начинают терять информацию по пути и становятся плохо обучаемыми.

Но есть проблема: при росте глубины и размера моделей такие простые «пропуски» перестают работать.

Информация размывается. Градиенты нестабильны. Математика начинает ломаться.

DeepSeek (включая исследователей, среди которых Вэньфэн Лян) опубликовали работу с введением mHC: манивольд-ограниченные гипер-связи.

Это полная переработка того, как данные проходят внутри модели.

Вместо одного «обходного пути» они расширили его до нескольких параллельных потоков. Эти связи называют гипер-связями.

Но на этом не остановились.

Когда появляется несколько потоков, система обычно уходит в хаос. Модель теряет «отображение идентичности» — перестаёт корректно передавать информацию без искажений.

Ключевой шаг DeepSeek — принудить эти связи жить на заданном математическом многообразии.

Проецируя связи на многогранник Бёркгофа с помощью алгоритма Синхорна–Кноппа, они заставили модель оставаться устойчивой.

Сохраняется богатство маршрутов передачи данных, но сигнал не теряется и не «взрывается».

Результаты:

Стабильность: удалось обучить модель на 27 млрд параметров, которую раньше нельзя было стабилизировать с обычными гипер-связями.

Производительность: значительное улучшение на бенчмарках кодирования, математики и рассуждений (BBH и DROP).

Эффективность: несмотря на усложнение, кастомное ядро добавляет примерно 6,7% накладных расходов на обучение.

Последние годы индустрия пыталась делать модели умнее через увеличение масштаба.

DeepSeek показали, что реальный прирост даёт исправление «инфраструктуры» внутри модели.

Будущее масштабирования — не только в увеличении числа слоёв.

Оно в более качественных связях между ними.

👉 @PythonPortal
  • 🔥 31
  • 👍 6
  • ❤ 5
  • 🤔 4
  • 👀 1
More from @pythonportal
  1. Oct 6, 2026Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это…
  2. Oct 5, 2026«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая да…
  3. Oct 5, 2026DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащи…
  4. Oct 4, 2026Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный уче…
  5. Oct 4, 2026«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить мате…
  6. Oct 3, 2026«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →