🧨 Данные с сайтов воруют AI-агенты, а CAPTCHA больше не помогает
Раньше было достаточно защититься от обычных веб-сканеров. Сегодня этого уже мало. Всё больше компаний используют agentic crawlers, т.е. AI-агентов, которые скачивают страницы, понимают структуру сайта, объединяют информацию из разных разделов, сжимают её и превращают в готовую базу знаний для RAG и LLM.
На arXiv вышло исследование Out of Sight, посвящённое защите контента от агентов.
⚙️ Контент стал новой добычей
Современный crawler умеет гораздо больше, чем пройтись по ссылкам. Он открывает документацию, следует по внутренним переходам, анализирует API, собирает статьи в единое представление, удаляет повторы и оставляет только самую ценную информацию.
В результате developer-порталы, базы знаний, help-центры и техническая документация превращаются в готовый источник данных для обучения моделей, построения RAG-систем или анализа инфраструктуры потенциальной цели.
🧠 Победить AI его же оружием
Авторы предлагают отказаться от борьбы с самим сканированием. Вместо этого они предлагают защищаться от сжатия информации. AI-агент почти всегда пытается максимально сократить объём данных без потери смысла. Если критически важные детали распределить по документу таким образом, чтобы они терялись или искажались при автоматическом summarization, ценность украденного контента резко падает.
Защита начинает работать не против HTTP-запроса, а против всей цепочки «чтение → анализ → сжатие → построение базы знаний».
🛡️ Новая гонка вооружений
Похоже, в эпоху AI-агентов защищать придётся уже не только доступ к данным, но и способность моделей понимать и эффективно извлекать их смысл.
🔗 Исследование: https://arxiv.org/abs/2607.08180
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #RAG #WebSecurity #ThreatModeling #DataProtection #CyberSecurity #SecureTechTalks
Post #810
190

- 👍 1