TGViewer
Kaggling Kaggling @kaggling · 472 subscribers
Post #68 438
Вот сама модификация градиентного спуска: шаг обновления складывается из двух частей — накопленной инерции предыдущих шагов с коэффициентом μ и градиента функции с коэффициентом η. Ключевое отличие от обычного momentum в том, что градиент вычисляется не в текущей точке, а в предсказанной: там, где мы окажемся, сделав только инерционную часть шага. Обычно μ=0.9, а η — темп обучения (learning rate).

Для машинного обучения, используя классические обозначения, x=w — веса модели, а f(w)=L(θw​(*), y) — функция ошибки, где θw​(*) — предсказание модели, параметризованной w, а y — искомое значение. При этом градиент берётся по w.
  • ❤ 6
More from @kaggling
  1. Aug 21, 2026Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradie…
  2. Aug 21, 2026Добрый день, друзья! Многие, в том числе и я, упустили достаточно важное событие в сфере м…
  3. Jul 30, 2026И вот еще одна RL сорева Это RL-обгон? У нас будет 4 подряд соревнования на РЛ. Видимо, по…
  4. Dec 31, 2024Добрый день, друзья! Вот и подходит к концу 2024-й год — время оглянуться назад и вспомнит…
  5. Sep 3, 2024Добрый день, друзья! Во-первых, поздравляю всех причастных к началу учебного года. Желаю,…
  6. Jun 11, 2024Добрый день, друзья! Извините что автор данного канал отсутствовал столь продолжительное в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →