➡️ Чем Adam отличается от адаптивных методов, таких как RMSProp или Adagrad
Adam объединяет идеи из предыдущих оптимизаторов:
➡️ RMSProp отслеживает экспоненциальное скользящее среднее квадратов градиентов, чтобы адаптировать скорость обучения по каждому параметру, но не учитывает среднее значение самих градиентов.
➡️ Adagrad накапливает сумму квадратов градиентов, что также адаптирует шаги, но может приводить к слишком малым скоростям обучения на поздних этапах.
💡 Чтобы глубже понимать, как работают оптимизаторы и почему математика так важна в ML, посмотри курс Математика для Data Science — сейчас на него действует скидка –40%.
🐸 Библиотека собеса по Data Science
Post #1220
771
- ❤ 1
- 👍 1