Вторая картинка хорошо визуализирует, почему такое усреднение может работать. Тут кажется важным, что два набора весов находятся около одного и того же минимума. Поэтому, например, усреднять веса моделей, которые были по разному инициализированы, представляется не такой разумной затеей)
Получили профит относительно похожих бейзлайнов: дистилляция ансамбля, SWA (усреднение чекпоинтов вдоль одной траектории обучения), SAM (модифицированный оптимизатор, который ищет wide минимумы функции потерь).
В основном эксперименты были с CV сетками, но и про NLP кое что есть (не делает хуже, иногда немного лучше).
Много классных визуализаций и огромный аппендикс с кучей графиков, даже страшные формулы есть для любителей)
Paper
Post #13
432

- 👍 2
- ❤ 1
- 🔥 1