На днях Илья Гусев криво спарсил Хабр, а Хабр криво защитился с помощью стажёра
Хронология:
1. Илья скачивает и публикует датасет с именами, статьями и комментариями с Хабра (страница уже скрыта, но вы можете посмотреть ее через web.archive.org),
2. Ему приходит письмо от Хабра, где говорится «удоли»,
3. Илья запрашивает обоснование для удаления,
4. В ответ приходит следующее письмо от Хабра, где говорится «ты нарушил ВСЁ, вот тебе все статьи, которые нам удалось нагуглить».
На мой субъективный взгляд, здесь не правы все.
1. Во-первых, не правы корпораты. Я прекрасно понимаю боль Хабра — им важно удерживать у себя интересных авторов, которые могут дать читателю уникальный контент. При этом абсолютно все крупные LLM (лингвистические модели) естественно обучаются на материалах Хабра, лишая их самоценности. Этому способствует довольно бессмысленная концепция Fair Use: она запрещает копировать «как есть» и позволяет хранить данные только в векторном виде, но РАЗУМЕЕТСЯ все разработчики LLM плевали на нее потому, что хранение датасета в переработанном виде не дает переиспользовать его на новом поколении обработчиков. И РАЗУМЕЕТСЯ проверить это Хабр никак не может.
2. Во-вторых, не прав Хабр. Нет, имя и фамилия, указанные пользователем в нике, сами по себе не являются персональными данными. И нет, данные, собранные в базу данных самим автором базы, не защищают эту базу от него самого. И в базе нет ничего, что может быть признано интеллектуальной собственностью Хабра. И 99% комментариев не попадают под защиту авторских прав. Так что письмо почти целиком похоже на попытку напугать, в надежде, что кто-то напугается.
3. В-третьих, не прав Илья. Если вы занимаетесь парсингом в 2026 году, вы должны быть так хорошо подкованы в нюансах, что комар носа не подточит. Эту базу можно было бы собрать без нарушений, но пока не вышло.
p.s. Будет интересно понаблюдать, появится ли у Хабра вакансия специалиста по защите от парсинга 😄
Post #56
1.85K
- 😁 11
- 😱 6
- 🔥 3
- 🤔 3
- ❤ 1