Чтобы построить конкурентный искусственный интеллект, нужно много данных. Очень много. Когда инженеры из экстремистской Meta начали работу над Llama 3 — языковой моделью, которая должна была тягаться с ChatGPT, — они столкнулись с неприятной дилеммой: либо платить за книги и научные статьи, либо просто… украсть их. В итоге они выбрали второй вариант — и пошли на LibGen.
LibGen — это огромная пиратская библиотека, в которой сегодня более 7,5 млн книг и 81 млн научных публикаций. Она была создана в районе 2008 года предположительно группой российских ученых, которые преследовали цель открыть знания соотечественникам (в 10-е для этой же цели появился Sci-Hub). Однако в отличие от последнего LibGen в итоге эволюционировал до библиотеке со всеми типами книг — от профессиональных до беллетристики. Именно туда и ринулась Meta.Для компании это имело смысл, так как экономила косты — получение легальной лицензии заняло бы около месяца для каждой книги, тогда как на LibGen было доступно все бесплатно. «Нам нужно получить книги как можно быстрее», — писал один из менеджеров. Судя по документам, разрешение на скачивание пришло от “MZ” — вероятно, Марка Цукерберга.
Документы, ставшие основой этого расследования, были опубликованы в рамках коллективного иска, поданного против Meta группой американских писателей. Авторы утверждают, что их книги незаконно использовались для обучения LLM без согласия и роялти. Параллельно идут аналогичные процессы и против OpenAI — обе компании пытаются защититься, ссылаясь на доктрину "fair use", которая допускает некоммерческое использование защищённых авторским правом материалов для трансформации в нечто новое.
Важно понимать масштаб происходящего. Речь не о том, что Meta случайно наткнулась на пиратский файл. Судебные документы показывают, что команда целенаправленно искала способы маскировки своей активности, обсуждала удаление строк с упоминаниями ISBN, Copyright, ©, All rights reserved (то есть любых явных признаков авторства и защиты прав), и и даже запрет на генерацию первых страниц книг по запросу — например, блокировали запросы типа «покажи три первые страницы “Гарри Поттера”».
Книги скачивали через BitTorrent и вот в чем фишка. Когда Meta скачивала библиотеку LibGen, она могла не только загрузить пиратские книги, но и невольно начать их раздавать другим пользователям. По законам об авторском праве это уже считается распространением нелегального контента — то есть нарушением. В Meta утверждают, что приняли меры, чтобы этого не произошло, но технически доказать это сложно. OpenAI, по слухам, тоже использовала LibGen, но пока неизвестно, как именно она загружала данные.
ИИ-компании настаивают, что обучение моделей на таких данных трансформирует тексты и потому допустимо. Но главный вопрос не столько в законе, сколько в будущем авторства. Если миллиарды долларов будут зарабатываться на переработке чужих работ без согласия авторов — кто вообще станет писать книги, проводить исследования или делиться знаниями?
Meta и OpenAI уверяют, что их модели помогут науке. Вот только кто захочет бесплатно делиться знаниями с теми, кто обещает отобрать у них работу - вопрос со звездочкой.
Хотя американские медиа вот согласились. Может, и среди остальных найдутся наивные.