Какая математика реально используется в Data Science и AI-инженерии
Вопрос «нужна ли математика» обычно ставится слишком широко, поэтому и ответы на него получаются бесполезными. Предлагаем посмотреть, какие разделы и в каких конкретно задачах всплывают в работе, и на каком уровне их необходимо знать.
1️⃣Линейная алгебра
🟣Скалярное произведение и нормы. Косинусная мера, на которой держится поиск по эмбеддингам и векторные базы данных, это нормированное скалярное произведение. Нормы L1 и L2 определяют вид регуляризации и различие между Lasso и Ridge.
🟣Собственные значения и векторы. Метод главных компонент строится на спектральном разложении ковариационной матрицы.
🟣Сингулярное разложение. Лежит в основе понижения размерности, латентно-семантического анализа и матричных методов в рекомендательных системах. Малоранговая аппроксимация из SVD напрямую используется в LoRA, наиболее распространенном способе дообучения больших моделей.
🟣Ранг, ортогональность, обусловленность. Определяют, почему мультиколлинеарность ломает линейную регрессию и когда решение системы численно неустойчиво.
2️⃣Математический анализ и оптимизация
🟣Градиент и правило дифференцирования сложной функции.
🟣Якобиан и гессиан. Объясняют разницу между методами первого и второго порядка и происхождение адаптивных шагов в Adam.
🟣Выпуклость и условия оптимальности. Показывают, почему линейные модели и SVM обучаются устойчиво, а нейросети требуют подбора начальных приближений и расписания скорости обучения.
🟣Поведение производных на длинных композициях. Отсюда следуют затухание и взрыв градиентов, а вместе с ними остаточные связи и нормализация слоев.
3️⃣Теория вероятностей и математическая статистика
🟣Распределения и условная вероятность. Формула Байеса дает наивный байесовский классификатор, байесовскую оптимизацию гиперпараметров и вероятностную интерпретацию предсказаний.
🟣Метод максимального правдоподобия. Кросс-энтропия и среднеквадратичная ошибка не выбираются произвольно, обе выводятся из правдоподобия при разных предположениях о распределении шума.
🟣Проверка гипотез, мощность, доверительные интервалы, бутстрап. Основа A/B-тестирования и любой оценки того, значим ли прирост качества модели.
4️⃣Теория информации
Небольшой по объему раздел, прямо описывающий функции потерь современных моделей.
🟣Энтропия и кросс-энтропия. Стандартная функция потерь в классификации и в языковом моделировании.
🟣Расстояние Кульбака — Лейблера. Используется в вариационных автокодировщиках, в дистилляции знаний и в методах выравнивания вроде DPO и PPO, где ограничивает отклонение обучаемой модели от исходной.
🟣Перплексия. Экспонента от кросс-энтропии, базовая метрика качества языковых моделей.
5️⃣Дискретная математика и вычислительная сложность
🟣Оценка асимптотики. Без нее невозможно понять, почему классическое внимание требует квадратичного числа операций от длины последовательности и откуда берутся ограничения на размер контекста.
🟣Графы. Нужны в графовых нейронных сетях, в рекомендательных системах и в подходах, где извлечение построено на графе знаний.
🟣Комбинаторика. Возникает в оценке пространства гиперпараметров и в задачах сэмплирования.
6️⃣Численные методы
Соотношение с ролями
🟣Аналитику данных нужны прежде всего статистика и теория вероятностей, линейная алгебра на уровне понимания метода главных компонент и регрессии.
🟣Инженеру машинного обучения дополнительно требуются оптимизация, матричное дифференцирование и численные методы, поскольку он отвечает за сходимость и за поведение модели в продакшене.
🟣Исследователю необходим весь перечисленный набор в формальном виде, включая доказательную часть.
Post #589
808
