🔒 Как устроена защита от ботов в Яндексе
Меня зовут Руслан Сабиргалиев, я руковожу группой аналитиков службы доверия и надёжности. В Яндексе есть сервис для защиты сайтов и приложений от DDoS‑, веб‑атак и ботов — Yandex Smart Web Security, который разрабатывают несколько команд. C помощью схемы защиты с reverse proxy можно обезопасить ресурс даже вне контура Yandex Cloud. В качестве базовой технологии защиты от роботов и DDoS‑атак на уровне приложений (L7 модели OSI) в сервисе мы используем SmartProtection‑модуль на базе сервиса «Антиробот», который защищает в том числе и весь Яндекс.
Мы делаем фокус на простых инструментах управления и недавно добавили в сервис новую функциональность по работе с роботами — Bot Management. Пользователям облачной платформы она даёт возможность самостоятельно настраивать правила для выделения роботного трафика буквально с помощью пары бегунков.
Хочу рассказать, какая инженерная работа стояла за этими, казалось бы, небольшими улучшениями интерфейса.
♒️ Скоринг запроса
Мы присваиваем оценки от 0 (человек) до 100 (бот). Модель обучается на разметке weak supervision и CatBoost с монотонными ограничениями — например, чем больше запросов с одного IP, тем выше скорбалл.
Для настройки чувствительности у нас есть шкала: 0–20 (человек), 20–40 (вероятно, человек), 40–60 (зона неуверенности), 60–80 (вероятно, бот), 80–100 (бот).
🤖 Верификация полезных роботов
Мы вручную верифицировали более 100 роботов по комбинациям User-Agent + IP/подсети, User-Agent + ASN и обратному DNS. И разбили их на 17 категорий.
Наши критерии: принадлежность компании, стабильные идентификаторы, региональная специфика, значительность трафика и известность бота.
🔍 Больше полезных сигналов и резюме
Мы расширили возможность борьбы с автоматизированным и подозрительным трафиком и добавили ASN (номер автономной системы) и tls‑fingerprint (JA4 и JA3). Это позволило ещё более гранулярно профилировать трафик защищаемого ресурса и управлять им.
Также мы научили сервис поставлять дополнительные сигналы в виде логов и заголовков, которыми обогащается запрос, что позволяет использовать наш скоринг в собственных антифрод-движках, расследованиях инцидентов и очистке логов от роботного трафика.
⏩ Читайте больше подробностей в статье на Хабре. Там я поделился тем, как мы вообще пришли к созданию новых механизмов управления трафиком, и рассказал об устройстве weak supervision и практических сценариях использования.
Подписывайтесь:
💬 @Yandex4Security
📹 @YandexForSecurity
Post #287
1.89K

- 👍 12
- 🔥 9
- ❤ 8