TGViewer
BRAIn Lab: Optimization and Beyond BRAIn Lab: Optimization and Beyond @brainlaboratory · 1.11K subscribers
Post #240 1.34K
Разбираем нашу статью, принятую на UAI 2026!

Markovian Compression: Looking to the Past Helps Accelerate the Future

[статья]

Обучаешь модель на куче устройств — и упираешься не в вычисления, а в коммуникации: узлы без конца шлют на сервер градиенты, канал захлебывается. Лечат это компрессией: отправляешь не весь вектор, а кусочек. Самый простой вариант — RandK: берём случайные K% координат, отправляем только их.

Но почти все компрессоры живут без памяти. Каждую итерацию заново тянут случайные координаты, как будто прошлых шагов не было. Одни улетают раз за разом, другие простаивают, а история отправок никак не учитывается. Жалко.

💡 Идея

Завязать выбор координат на прошлые итерации. Формально это марковская цепь — отсюда и название. Под описание попадает целый класс операторов, мы разбираем два:

🔵BanLast(K) — обычная разреженная отправка, но координаты из последних $K$ шагов под временным запретом.
🔵KAWASAKI — то же мягче: недавним координатам не запрещаем выпасть, а просто снижаем вероятность.

Координаты перестают залипать, вектор покрывается ровнее.

⚙️ Куда вставлять

В обычный QSGD — получаем Markovian QSGD, с моментумом — Accelerated MQSGD. Те же операторы живут поверх DIANA и SGD. Своей архитектуры метод не требует: это просто компрессор, который докручивается к тому, что уже есть, и комбинируется с классическими вроде Natural.

📐 Теория

Сходимость доказана сразу для всего класса: оценки выписаны для произвольного марковского компрессора при эргодических условиях. Конкретный оператор подставляется в них со своими константами, теорема одна на всех. Покрыты non-convex, PL и сильно выпуклый случай, ускоренная версия обгоняет базовую.

📊 Цифры:

🔵Логрегрессия (MNIST, LibSVM): обе схемы быстрее RandK, PermK и Natural
🔵ResNet-18 / CIFAR-10: у KAWASAKI train loss 0.0305 против 0.0743, точность 89.05% против 87.9%
🔵DeBERTaV3 / GLUE: та же картина

На простых задачах BanLast и KAWASAKI идут вровень, но чем задача невыпуклее, тем заметнее: мягкое накопление истории бьет жесткий бан. Помнить прошлое полезно, копить память надо аккуратно.
  • 🔥 9
  • ❤ 5
More from @brainlaboratory
  1. Sep 13, 2026Присоединяйтесь к проектам BRAIn Lab и других лабораторий ИИИ МФТИ В рамках проекта можно…
  2. Sep 4, 2026🧠Как мы делали ИИ-ассистента для египтологов Год назад мы в BRAIn Lab c Институтом восток…
  3. Sep 2, 2026📚 Курс «Методы и алгоритмы машинного обучения» Наш курс по классическому ML, который мы р…
  4. Sep 1, 2026BRAIn Lab: Optimization and Beyond pinned a photo
  5. Aug 31, 2026Собираемся в осень и подводим итоги лета с нашим ML-бинго ☀️ Мы решили подвести итоги лета…
  6. Aug 25, 2026✈️ На прошлой неделе команда BRAIn Lab побывала на конференции UAI 2026 в Амстердаме, где…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →