✔️ Почему Adam иногда требует меньше подбора гиперпараметров, чем SGD
▶️ Adam автоматически адаптирует шаг обучения на основе статистик градиентов. Это делает его более устойчивым к неудачно выбранным начальными learning rate.
▶️ В случае SGD неправильный выбор learning rate (слишком большой или слишком маленький) может серьёзно замедлить или даже сорвать обучение.
Adam же, благодаря нормализации по второй моментной оценке градиентов, сглаживает такие перекосы и чаще выходит на стабильный режим обучения без тонкой ручной настройки.
🐸 Библиотека собеса по Data Science
Post #1175
751
- 👍 6