Правила веб-скрейпинга для обучения ИИ от EDPB
Европейский совет по защите данных (EDPB) опубликовал проект рекомендаций по использованию веб-скрейпинга при разработке генеративного ИИ.
Комментарии можно направить до 30 октября 2026 года.
❗️Если данные публично доступны, еще не значит, что свободны для обучения моделей.
1️⃣Минимизация данных начинается еще до запуска краулера.
Компания должна заранее определить критерии отбора, выбрать источники, оценить возможность использования синтетических данных и исключить сайты, содержащие чувствительные данные или данные детей.
2️⃣Технические запреты приобретают юридическое значение.
Если сайт использует robots.txt, ai.txt, CAPTCHA или иные механизмы защиты от скрейпинга, это следует учитывать при оценке законности обработки и разумных ожиданий пользователей.
Фактически регулятор предлагает строить датасеты по принципу privacy by design.
3️⃣ Публикация данных в интернете не означает согласия на их использование для обучения ИИ.
EDPB отдельно подчеркивает, что публикация информации в открытом доступе и даже отсутствие robots.txt не являются согласием на использование данных для обучения AI.
При использовании законного интереса необходимо, опираясь на полный трехступенчатый тест, доказать не только наличие законной цели, но и невозможность достичь ее менее инвазивными способами, например с помощью синтетических или обезличенных данных.
EDPB вводит важный критерий " reasonable expectations."
При оценке законности нужно учитывать:
▪️где опубликованы данные;
▪️насколько сайт публичный;
▪️есть ли ограничения на автоматический сбор;
▪️мог ли пользователь разумно ожидать использование своих данных для обучения ИИ.
4️⃣EDPB допускает, что индивидуально уведомить всех субъектов данных (миллионы) иногда невозможно.
Но тогда компания должна:
▪️опубликовать подробную Privacy Notice;
▪️максимально подробно раскрыть источники данных;
▪️описать категории данных;
▪️объяснить цели обработки;
▪️по возможности указать перечень доменов и URL, с которых собирались данные;
▪️предоставить механизм реализации прав субъектов данных.
5️⃣ Особые категории данных требуют отдельной защиты.
Даже если компания не собиралась получать специальные категории персональных данных, они могут попасть в датасет случайно, поэтому рекомендуется:
▪️фильтровать такие данные до начала сбора;
▪️автоматически удалять их после обнаружения;
▪️использовать фильтры при генерации ответов модели;
▪️регулярно тестировать модель на утечки персональных данных;
▪️внедрять меры против заучивания и дословного воспроизведения.
6️⃣ Требование достоверности распространяется и на результаты работы модели.
Поэтому качество источников, проверка данных и фиксация даты их получения становятся вопросом соблюдения GDPR, а не только хорошей инженерной практики.
❕Под контроль и требования GDPR подпадает весь жизненный цикл разработки ИИ ( от выбора источников данных до предотвращения воспроизведения персональных данных обученной моделью).
#LawAndDisorder
————
@pattern_ai | AI GDPR Navigator
Post #421
148