Сильная новая работа от Meta.
Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.
В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.
Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.
Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.
Ещё одна важная часть. Вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.
Почему это важно?
Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.
Работа: https://arxiv.org/abs/2608.07222
Post #3665
22.4K
