TGViewer
Awesome DL Awesome DL @awesome_dl · 871 subscribers
Post #98 2.44K
Привет! Меня зовут Олег, я исследую, как оптимально скейлить языковые модели в Jülich Supercomputing Centre. Пока Андрей подзаряжается энергией для будущих постов, с его позволения поделюсь тут нашей новой работой — “Optimal Scaling Needs Optimal Norm”. Всем, кто задумывался о правильном тюнинге гиперпараметров — будет интересно!

Главная проблема в скейлинге — как подбирать гиперпараметры (learning rate, batch size и т.д.) на масштабе >1B параметров и >100B токенов, когда перебор брутфорсом уже не вариант. Известные подходы вроде muP и других параметризаций гарантируют оптимальность при скейлинге модели, но не объясняют, что делать при увеличении размера датасета — скажем, с 1B до 1T токенов. Эмпирические scaling laws (пример или наша прошлая работа) помогают, но теории объединяющей всё вместе пока не существует.

Мы подошли к этой проблеме со стороны norm-based optimization. Сейчас на хайпе Muon, который бьёт Adam, а в основе всего лежит теория Jeremy Bernstein (Modular Duality) — очень советую глянуть, это прям база. Также этот подход позволяет отслеживать эволюцию норм по слоям, и именно в них оказывается кроется секрет оптимального скейлинга!

С Scion (улучшенная версия Muon) мы показали: чтобы достичь оптимального скейлинга одновременно модели и(!) датасета, нужно удерживать веса на одном и том же manifold’е — то есть сохранять норму весов постоянной при любом масштабе. Кроме того, мы вывели, как оптимально подбирать batch size и learning rate в этом сэтапе, выпустили Distributed Scion для тренировки на множестве GPU + открыли логи 2000+ экспериментов.

В общем, всех инсайтов вкратце не описать, так что гляньте статью — буду рад обсудить идеи и услышать ваши мысли в комментах 😌

И апвоутните нас на Hugging Face! Было бы круто попасть в топ Daily Papers, мы уже очень близко 🚀
arXiv.org Optimal Scaling Needs Optimal Norm Despite recent progress in optimal hyperparameter transfer under model and dataset scaling, no unifying explanatory principle has been established. For Adam and Scion optimizers, we discover that...
  • 🔥 12
  • ❤ 1
  • 👏 1
More from @awesome_dl
  1. Jul 31, 2026Age of Autoresearch Был обычный вечер, и мне было откровенно лень гонять гипотезы руками.…
  2. Jul 22, 2026Слухи о том, как китайцы дистиллировали frontier и как claude стрельнул себе в ногу через…
  3. Jun 16, 2026Новая эра интерфейсов Мне давно хочется создавать системы, которые живут и адаптируются ка…
  4. May 13, 2026Krea-2: taste is what matters 4 месяца назад я перешёл в Krea и вчера мы выкатили модель K…
  5. Mar 31, 2026История о том, как штука для рисования треугольников стала самым важным чипом на планете М…
  6. Mar 15, 2026Когда мы получим realtime видео? Считаю от first principles (Лонгрид) Мне всегда было инте…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →