Книги как «чистый» источник данных в обучении ИИ
Согласно расследованию издания 404 Media, ведущие ИИ-компании активно скупают печатные книги, изданные до 2022 года, для использования в качестве обучающих данных.
Интернет переполнен контентом, сгенерированным самими же нейросетями — так называемым «ИИ-слопом» (AI slop). Использование таких данных для обучения ведет к деградации моделей, известной как «коллапс модели». Печатные книги, особенно изданные до эры массовых LLM, являются гарантированно «чистым» источником, созданным человеком.
Посредником в этих сделках выступает компания ISBNdb, позиционирующая себя как крупнейшая в мире база данных книг. Она предлагает ИИ-корпорациям услуги по оптовой закупке печатной продукции — от 1 000 до 1 000 000 экземпляров за один заказ.
Особого внимания заслуживает этическая сторона вопроса. Сканирование в больших масштабах обычно приводит к необратимому повреждению книг: рабочие срезают корешок, чтобы отделившиеся страницы быстрее прошли через машину, что значительно дешевле более бережных методов оцифровки. ISBNdb прямо признает репутационные риски для клиентов, гарантируя полную анонимность сделок.
Всё это становится частью уже разгорающейся битвы за авторские права. Американский судья одобрил мировое соглашение с компанией Anthropic на сумму 1,5 миллиарда долларов по делу о пиратских книгах и постановил, что использование купленных и отсканированных книг в учебных целях считается добросовестным использованием. Однако массовая загрузка миллионов наименований из теневых библиотек, таких как LibGen и Pirate Library Mirror, под это определение не подпадает.
Дополнительный материал доступен по ссылке.
❤PULSE SCIENCE 👍 ID SCIENCE 💙VK 💬MAX
Post #4394
328