Привет, это Денис! 👋
Тут Cloudflare недавно объявила, что будет по умолчанию блокировать ботов, которые парсят сайты для обучения ИИ — без разрешения владельца. А открывать доступ – за доплату. Новость громкая, но тренд ожидаемый. Особенно на фоне истории с Reddit, NYT и другими крупными площадками, которым надоело «кормить» ИИ бесплатно.
А как у нас?
Пока «акции» в защиту создателей контента не наблюдал, но несколько месяцев назад ЦМУ ССОП рекомендовал по умолчанию закрывать из соображений безопасности доступ к веб-ресурсу юзер-агентам всяких GPT – но, опять же, рекомендовал.
Где справедливость?
С одной стороны, контент стоит денег и усилий, почему кто-то должен использовать его без спроса? С другой — давайте честно: краулинг был и будет. С появлением ИИ поиск информации трансформировался: парсинг контента веб-страниц ИИ-агентами стал нужен тем, кто хочет попасть в поле зрения потребителей контента, которые уже сначала спрашивают ИИ, а потом уже Гугл.
Я считаю, что ИИ-краулинг должен быть контролируемым. Спросил у старших коллег, они согласны:
«Боты для обучения ИИ относятся к категории автоматизированного трафика, как и краулеры поисковиков. Разработчики часто маркируют их (например, через UserAgent или IP-адреса), но финальное решение — блокировать или нет — всегда за владельцем ресурса».
Инструменты для тонкой настройки фильтрации ботов есть и у нас в NGENIX – блокируйте нежелательных ботов и управляйте доступом к данным. Можно самостоятельно принимать такие решения, исходя из бизнес-цели.
Так что, имхо, вопрос не в том, пропускать или запрещать, а в том, кто контролирует доступ. Я не думаю, что это должна быть Cloudflare, – но это другая юрисдикция, да и наверняка есть другие мнения.
🗯Кто что думает? Похоливарим в комментах?😅
