tabular-dl-optimizers
В репозитории опубликован код масштабного исследования оптимизаторов для MLP-моделей в задачах глубокого обучения на табличных данных. Авторы обращают внимание на любопытный перекос в современной практике, где архитектуры для табличного DL активно развиваются и сравниваются, а вот выбор оптимизатора чаще всего остаётся почти автоматическим. Для этого авторы предлагают единый бенчмарк 15 оптимизаторов на 17 датасетах в стандартной постановке обучения с учителем. Главный вывод работы — оптимизатор Muon стабильно превосходит AdamW как на простых MLP, так и на более современных архитектурах. Muon выигрывает у AdamW на большинстве датасетов и для всех рассмотренных семейств моделей. Дополнительно авторы показывают, что экспоненциальное скользящее усреднение весов заметно улучшает AdamW на обычных MLP, хотя на более сильных моделях эффект EMA уже менее стабилен. Таким образом, Muon выглядит как новый сильный практический бейзлайн для табличного DL, а AdamW+EMA — как простая и разумная альтернатива. Работа будет полезна исследователям табличного глубинного обучения, разработчикам прикладных моделей для табличных данных и всем, кто хочет строить честные и воспроизводимые пайплайны обучения.
статья | код
Post #157
725

- ❤ 7
- 🔥 5
- 👍 3
- 😍 1