TGViewer
ML — это ОК ML — это ОК @mlvok · 2.1K subscribers
Post #110 1.56K
ML — это ОК RANKITECT: RANKING ARCHITECTURE SEARCH BATTLING WORLD-CLASS ENGINEERS AT META* SCALE https://arxiv.org/abs/2311.08430 *Meta признана экстремистской организацией в России
🤖Есть хорошие способы лишить ML-инженеров работы, кроме LLM – например, AutoML. Сегодняшний пост про Rankitect – Neural Architecture Search (NAS), способный автоматически находить архитектуру ранжирующей модели с заданным количеством FLOPs. Причем точность этой модели будет даже немного выше, чем точность модели, придуманной ML-инженерами мирового уровня (по мнению самих инженеров).

С высоты птичьего полета система работает так:
1. Создаём supernet – огромный ранкер, который объединяет в себе все возможные варианты ранкеров поменьше. Блоки supernet включают в себя трансформации признаков, взаимодействия между признаками и связи с другими блоками (см. картинку).
2. Даём возможность отключать разные куски supernet с помощью масок. В зависимости от того, какие маски включены, получается конкретная реализация subnet-ранкера.
3. Используем NAS-алгоритм, позволяющий выбрать лучшую (с точки зрения метрики качества) конфигурацию масок при заданном ограничении FLOPs.
4. Применяем к supernet найденную лучшую маску и получаем искомый ранкер.

Авторы пробовали три алгоритма NAS:
- Sampling-based метод, основанный на Neural Predictor, умно семплирует subnet-кандидаты и выбирает лучшие по метрике.
- One-shot NAS with Reinforcement Learning параллельно с ранкером обучает RL-ного агента, который семплирует маски. Награда агенту – качество ранкера, измеренное на батче. Этот вариант показал себя как оптимальный с точки зрения времени обучения и качества полученных моделей.
- DNAS – маски заменяются на дифференцируемые функции с помощью Gumbel-Softmax трюка и обучаются вместе с моделью (вау).

В экспериментах Rankitect конкурировал с продакшн-моделью и новой архитектурой DHEN, которую инженеры мирового уровня придумали, пока авторы статьи пилили NAS. В итоге у Rankitect и DHEN получилось победить бейзлайн, но соотношение качества и FLOPs оказалось примерно одинаковым. Во втором эксперименте авторы использовали свой фреймворк, чтобы улучшить уже DHEN. В течение 4 дней на кластере из 64 GPU настраивались только размеры слоев DHEN. В итоге получилось превзойти базовую конфигурацию на 0,02% по метрике качества при том же FLOPs.

Статью стоит почитать: предложенный подход выглядит интересно и технологично. Но применять его имеет смысл, когда уже собраны все низко висящие фрукты, средне висящие фрукты, и остался только последний банан на самой верхушке пальмы 🌴.
  • ✍ 10
  • 👏 7
  • 👍 3
More from @mlvok
  1. Dec 18, 2025Пришло время для SilverTorch! Сегодня на ридинг-группе — фреймворк, который бросает вызов…
  2. Dec 16, 2025В этот раз в рамках ридинг-группы обсудим SilverTorch — фреймворк, нацеленный на упрощение…
  3. Dec 4, 2025📢 Осталось 10 минут до ридинг-группы! Поговорим о том, как Taobao через RecGPT переосмысл…
  4. Dec 2, 2025На ближайшей ридинг-группе 4 декабря обсудим RecGPT — подход Taobao к пересборке классичес…
  5. Nov 24, 2025🔹Поделились записью ридинг-группы от 20 ноября в AI VK Hub — обсудили, как Spotify адапти…
  6. Nov 20, 2025📢 До начала ридинг-группы осталось 10 минут! Поговорим, как Spotify превращает контекст в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →