📝Математика для Data Scientist’а: 3 меры расстояния, часть 1
• Евклидово расстояние (Euclidean Distance) – измеряет длину отрезка, соединяющего две точки. Самая распространенная мера, но не масштабируемая, т.к. вычисленные расстояния могут искажаться в зависимости от единиц измерения объектов. Поэтому перед использованием этой метры нужно нормализовать данные. По мере увеличения размерности данных полезность евклидова расстояния уменьшается. Но эта мера отлично работает для данные с низкой размерностью. Например, методы kNN и HDBSCAN показывают с этой мерой хорошие результаты. Наконец, евклидово расстояние интуитивно понятно в использовании и просто в реализации.
• Косинусное подобие (Cosine Similarity) - косинус угла между двумя векторами. Этот способ помогает устранить недостатки евклидова расстояния для высокой размерности. Два вектора с одинаковой ориентацией имеют косинусное сходство, равное 1, а векторы, диаметрально противоположные друг другу, имеют сходство, равное -1. Величина векторов не имеет значения, поскольку это мера ориентации. Поэтому данная мера не слишком подойдет для рекомендательных систем, т.к. косинусное сходство не учитывает разницу в шкале оценок между разными пользователями. Тем не менее, косинусное сходство пригодится, когда есть многомерные данные и величина векторов не имеет значения, например, для анализа текстов.
• Расстояние Хэмминга (Hamming distance ) - количество значений, которые отличаются в двух векторах. Обычно используется для сравнения двух двоичных строк одинаковой длины, например, чтобы сравнить, насколько они похожи друг на друга, путем вычисления количества отличающихся символов. Расстояние Хэмминга сложно применить, когда два вектора имеют разные длины. Например, для исправления или обнаружение ошибок при передаче данных по компьютерным сетям при определении количества искаженных битов в двоичном слове как способа оценки ошибки. Также можно использовать расстояние Хэмминга для измерения расстояния между категориальными переменными.
Post #124
426