TGViewer
Pattern AI Pattern AI @pattern_ai · 402 subscribers
Post #421 148
Guidelines EDPB on web scraping.pdf286.7 KB
Правила веб-скрейпинга для обучения ИИ от EDPB

Европейский совет по защите данных (EDPB) опубликовал проект рекомендаций по использованию веб-скрейпинга при разработке генеративного ИИ.
Комментарии можно направить до 30 октября 2026 года.

❗️Если данные публично доступны, еще не значит, что свободны для обучения моделей.

1️⃣Минимизация данных начинается еще до запуска краулера.
Компания должна заранее определить критерии отбора, выбрать источники, оценить возможность использования синтетических данных и исключить сайты, содержащие чувствительные данные или данные детей.

2️⃣Технические запреты приобретают юридическое значение.
Если сайт использует robots.txt, ai.txt, CAPTCHA или иные механизмы защиты от скрейпинга, это следует учитывать при оценке законности обработки и разумных ожиданий пользователей.
Фактически регулятор предлагает строить датасеты по принципу privacy by design.

3️⃣ Публикация данных в интернете не означает согласия на их использование для обучения ИИ.
EDPB отдельно подчеркивает, что публикация информации в открытом доступе и даже отсутствие robots.txt не являются согласием на использование данных для обучения AI.

При использовании законного интереса необходимо, опираясь на полный трехступенчатый тест, доказать не только наличие законной цели, но и невозможность достичь ее менее инвазивными способами, например с помощью синтетических или обезличенных данных.
EDPB вводит важный критерий " reasonable expectations."
При оценке законности нужно учитывать:
▪️где опубликованы данные;
▪️насколько сайт публичный;
▪️есть ли ограничения на автоматический сбор;
▪️мог ли пользователь разумно ожидать использование своих данных для обучения ИИ.

4️⃣EDPB допускает, что индивидуально уведомить всех субъектов данных (миллионы) иногда невозможно.
Но тогда компания должна:
▪️опубликовать подробную Privacy Notice;
▪️максимально подробно раскрыть источники данных;
▪️описать категории данных;
▪️объяснить цели обработки;
▪️по возможности указать перечень доменов и URL, с которых собирались данные;
▪️предоставить механизм реализации прав субъектов данных.

5️⃣ Особые категории данных требуют отдельной защиты.
Даже если компания не собиралась получать специальные категории персональных данных, они могут попасть в датасет случайно, поэтому рекомендуется:
▪️фильтровать такие данные до начала сбора;
▪️автоматически удалять их после обнаружения;
▪️использовать фильтры при генерации ответов модели;
▪️регулярно тестировать модель на утечки персональных данных;
▪️внедрять меры против заучивания и дословного воспроизведения.

6️⃣ Требование достоверности распространяется и на результаты работы модели.
Поэтому качество источников, проверка данных и фиксация даты их получения становятся вопросом соблюдения GDPR, а не только хорошей инженерной практики.

❕Под контроль и требования GDPR подпадает весь жизненный цикл разработки ИИ ( от выбора источников данных до предотвращения воспроизведения персональных данных обученной моделью).

#LawAndDisorder
————
@pattern_ai | AI GDPR Navigator
More from @pattern_ai
  1. Sep 21, 2026ИИ-агент впервые оказался в уведомлении об утечке персональных данных Испанское агентство…
  2. Sep 18, 2026Требования новой инициативы EU KIDS Act Интересное получилось "совпадение". 8 сентября OEC…
  3. Sep 17, 2026Результаты проверки Ray-Ban Meta от немецкого регулятора Про ассиметрию осведомленности пр…
  4. Sep 16, 2026Кто на самом деле читает ваши диалоги с ChatGPT? Уже обсуждали в постах, что OpenAI может…
  5. Sep 2, 2026AI&Online Safety Law Tracker еще один полезный ресурс от энтузиастов с подборкой законов в…
  6. Sep 1, 2026🎙 #AIShelf 🔹Бесплатные лекции Гарварда и книги MIT; 🔹Чек-листы при внедрении ИИ на соот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →