TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #92 302
👻Что такое обнаружение аномалий и как это работает
Обнаружение аномалий - это математический поиск отклонений в контролируемых и неконтролируемых числовых данных в зависимости от того, насколько конкретное значение отличается от окружающих или от стандартного отклонения в представленной выборке. Есть множество различных методов обнаружения аномалий, называемых алгоритмами обнаружения выбросов, каждый из которых имеет различные критерии их обнаружения и поэтому используется в разных сценариях. Чаще всего для обнаружения аномалий используются следующие методы:
• Общие методы, основанные на плотности: метод K-ближайшего соседа (KNN), локальный фактор выброса (LOF), метод изолированных лесов (Isolation Forests) и прочие алгоритмы, которые могут применяться для сценариев регрессии или классификации. Каждый из них генерирует ожидаемое поведение, следуя линии наивысшей плотности точек данных. Точки, которые выпадают на статистически значимое количество за пределами этих плотных зон, помечаются как аномалия. Большинство этих методов основаны на расстоянии между точками, поэтому для получения точных результатов важно нормализовать единицы измерения и масштаб в датасете. Например, в KNN точки данных взвешиваются по значению 1 / k, где k - расстояние до ближайшего соседа. Поэтому, что точки, которые расположены ближе друг к другу, имеют большой вес, и влияют на то, что является стандартом, больше удаленных точек. Алгоритм отмечает точки с низким значением 1 / k как выбросы. Это подходит для нормализованных данных без меток, когда нет желания и возможности использовать алгоритмы с более сложными вычислениями.
• Машина опорных векторов с 1 классом (One-class support vector machine) – алгоритм обучения с учителем, создающий надежную модель прогнозирования. Часто используется для классификации. Имеется обучающий набор примеров, каждый из которых помечен как часть одной из двух категорий. Система создает критерии для сортировки новых примеров по каждой категории, сопоставляет примеры с точками в пространстве, чтобы максимально различать обе категории. Система помечает выброс, если он выходит за пределы любой категории. При отсутствии размеченных данных, можно использовать метод обучения без учителя, который ищет кластеризацию среди примеров для определения категорий. Это подходит для работы с 2-мя категориями данных, когда нужно найти, какие точки данных лежат за пределами каждой из них.
• Алгоритм кластеризации K-средних, сочетающий KNN-подходы, основанные на близости каждой точки данных к другим близлежащим точкам и SVM, т.к. он ориентирован на классификацию по различным категориям. Здесь каждая точка данных разделена на категории в зависимости от ее характеристик. Категория имеет центральную точку, которая служит прототипом для всех других точек данных в кластере. Все они сравниваются с этими прототипами, чтобы определить их k-среднее значение, которое играет роль показателя разницы между прототипом и текущей точкой данных. Точки данных с более высоким k-средним находятся ближе к прототипу, образуя кластер. Кластеризация K-средних может обнаруживать аномалии, отмечая точки, которые не соответствуют ни одной из установленных категорий. Это подходит для сценариев, когда есть немаркированные данные из множества различных типов, которые нужно организовать по аналогии с изученными прототипами.
Есть и другие более сложные алгоритмы для неконтролируемого обнаружения аномалий и работы с многомерными наборами данных. Например, гауссовский как альтернативная версия алгоритма K-средних с распределением Гаусса вместо стандартного отклонения. А байесовский использует байесовское понимание вероятности для обнаружения аномалий. Также для обнаружения аномалий могут применяться автоэнкодеры - нейросети, создающие закодированные правила для ожидаемого вывода в зависимости от входного значения. То, что выходит за рамки этих повторяющихся значений, считается аномалией и хорошо подходит для задач их обнаружения в размерности.
More from @bdscience_ru
  1. Oct 1, 2026Перезапуск Microsoft Copilot как «суперприложения» Компания Microsoft официально представи…
  2. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  3. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  4. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  5. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  6. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →