Не так давно всплыла история, которая уже успела взорвать интернет. В начале 2024 года группа авторов подала иск против Nvidia, обвиняя компанию в использовании пиратских книг для обучения своих моделей. Книги были частью датасета Books3, и, по словам Nvidia, все это попадает под «добросовестное использование». Но вот теперь дело разрастается.
Недавно в рамках этого судебного разбирательства появилась переписка, которая добавила масла в огонь. Оказалось, что сотрудники Nvidia вели переговоры с Anna’s Archive — пиратской библиотекой, в которой хранятся книги и статьи, включая защищенные авторским правом материалы. В переписке сотрудник Nvidia спрашивал, как получить доступ к этому «счастливому» корпусу книг.
Что любопытно, Anna’s Archive сразу предупредила, что данные незаконны, и попросила подтвердить, что у сотрудника есть внутреннее разрешение работать с такими материалами. Через неделю руководство Nvidia дало зеленый свет, сославшись на давление со стороны конкурентов, и доступ был предоставлен 💃
Здесь начинается настоящая драма. Пока точные цифры скрыты, предполагается, что Nvidia получила около 500 терабайт данных — это, представьте себе, миллионы книг. И, как утверждают авторы и юристы, компания, скорее всего, использовала и другие незаконные источники, такие как LibGen, Sci-Hub, Z-Library.
Более того, ходят слухи, что Nvidia якобы распространяла скрипты, которые позволяли корпоративным клиентам скачивать такие датасеты. Ну, это уже требует дополнительных расследований.
Data Science
