🍏 Apple показала элегантный способ переиспользовать гиперпараметры - без ретюнинга
Обычно, если меняешь размер модели, число слоёв, batch size или длину обучения,
гиперпараметры приходится настраивать заново. На маленьких моделях это дёшево,
но при масштабировании — боль и недели поиска.
В этой работе Apple показывает: настроенные однажды параметры
можно масштабировать и повторно использовать без нового тюнинга.
Главная идея
Гиперпараметры - это «ручки» обучения:
как сильно обновляются веса, сколько шума в градиентах, как сильно веса тянет к нулю.
При увеличении модели эти значения обычно «ломаются».
Apple предлагает рецепт Complete(d)P - пересчёт параметров по группам весов так,
чтобы динамика обучения оставалась похожей при изменении:
- размера слоёв
- числа слоёв
- batch size
- длины обучения
Они масштабируют AdamW, чтобы уровень шума обновлений оставался стабильным,
разрешают разным модулям иметь свои настройки,
и ищут параметры безопасно (trust region), потому что область устойчивости узкая.
Результаты
> Модель 7.2B с перенесёнными настройками
> вышла на тот же loss и training-error, но обучалась в 1.32× быстрее.
Иначе говоря:
маленький эксперимент → пересчитали параметры → большая модель — без доп. поиска.
Почему это важно
- меньше времени на подбор
- меньше затрат на вычисления
- безопасное масштабирование
- разные части модели обучаются с разной скоростью, а не с одним LR на всё
Итог: маленькие настройки можно переносить на большие модели
и не тратить недели на новый тюнинг.
arxiv.org/abs/2512.22382w
Post #1313
2.23K

- ❤ 9
- 👍 1
- 🥰 1