TGViewer
fmin.xyz fmin.xyz @fminxyz · 4.71K subscribers
Post #17 4.7K
l₁ регуляризация стимулирует разреженность решения

🤨 При обучении линейной регрессии иногда хочется найти не просто вектор весов, с которыми надо учитывать фичи, но и стимулировать этот вектор обладать некоторыми свойствами.

📝Фишки l₂ - регуляризации (Ridge-регрессия):
* Единственность решения, чего нельзя гарантировать в исходной задаче.
* Новая задача становится лучше обусловлена.
* Задача гарантированно становится сильно выпуклой.

📝Основная фишка l₁ - регуляризации (Lasso-регрессия) - это разреженность решения или автоматический выбор признаков. В векторе оптимального решения будет заметное количество нулей, что позволяет снизить количество используемых признаков.

🤔 На гифке показано решение эквивалентных задач оптимизации (сверху Ridge, снизу Lasso) - выбор из шара единичной нормы вектора, который обеспечивает минимальное значение квадратичной функции потерь. Тут важно отметить, что каждому коэффициенту регуляризации на самом деле соответствует некоторый радиус такого шарика и наоборот (точной формулы соответствия, к сожалению, нет, но можно записать ККТ и приближенно найти довольно легко). Сверху и снизу нарисованы шарики в 2 норме и в 1 норме и точка на границе - это оптимальное решение. Точка рисуется красной, если одна из двух координат равна нулю. Черные концентрические линии - линии уровня квадратичных функций.

🧐 Легко видеть, что в случае l₁ - регуляризации гораздо чаще оптимальное решение - разрежено, чем в случае l₂ - регуляризации. Однако, это не бесплатное удовольствие, сама по себе задача с l₁ регуляризацией становится негладкой, что влечет за собой дополнительные проблемы (например, немонотонное убывание функции потерь, в отличие от гладкого случая при градиентном спуске).

💻 Код для построения гифки. Исходный код был отсюда.
  • ✍ 4
More from @fminxyz
  1. Jul 4, 2025🧬 Эволюционные алгоритмы Полтора месяца назад DeepMind выкатил AlphaEvolve, где LLM-агент…
  2. Feb 28, 2025QR алгоритм 🥸 Одна из жемчужин численных методов. Он используется для поиска собственных…
  3. Feb 12, 2025Наглядно о том, зачем нужна нормализация признаков Простая анимация, которая показывает фи…
  4. Jan 31, 2025Подбор шага с помощью линейного поиска в градиентном спуске Если нам известны характеристи…
  5. Dec 5, 2024О чем пишут на ICLR 2025 Пока все ждут результаты ревью одной из самых главных конференций…
  6. Nov 30, 2024Как ускоряли обучение GPT-2 S в 10 раз 🤩Очень интересный репозиторий Modded-NanoGPT, и на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →