TGViewer
ПолитИИзация ПолитИИзация @aipolitics · 413 subscribers
Post #233 215

Forwarded from Нецифровая экономика (🐈Egor Sonin)

Как Meta и OpenAI тренировали ИИ на российской пиратской библиотеке

Чтобы построить конкурентный искусственный интеллект, нужно много данных. Очень много. Когда инженеры из экстремистской Meta начали работу над Llama 3 — языковой моделью, которая должна была тягаться с ChatGPT, — они столкнулись с неприятной дилеммой: либо платить за книги и научные статьи, либо просто… украсть их. В итоге они выбрали второй вариант — и пошли на LibGen.

LibGen — это огромная пиратская библиотека, в которой сегодня более 7,5 млн книг и 81 млн научных публикаций. Она была создана в районе 2008 года предположительно группой российских ученых, которые преследовали цель открыть знания соотечественникам (в 10-е для этой же цели появился Sci-Hub). Однако в отличие от последнего LibGen в итоге эволюционировал до библиотеке со всеми типами книг — от профессиональных до беллетристики. Именно туда и ринулась Meta.

Для компании это имело смысл, так как экономила косты — получение легальной лицензии заняло бы около месяца для каждой книги, тогда как на LibGen было доступно все бесплатно. «Нам нужно получить книги как можно быстрее», — писал один из менеджеров. Судя по документам, разрешение на скачивание пришло от “MZ” — вероятно, Марка Цукерберга.

Документы, ставшие основой этого расследования, были опубликованы в рамках коллективного иска, поданного против Meta группой американских писателей. Авторы утверждают, что их книги незаконно использовались для обучения LLM без согласия и роялти. Параллельно идут аналогичные процессы и против OpenAI — обе компании пытаются защититься, ссылаясь на доктрину "fair use", которая допускает некоммерческое использование защищённых авторским правом материалов для трансформации в нечто новое.

Важно понимать масштаб происходящего. Речь не о том, что Meta случайно наткнулась на пиратский файл. Судебные документы показывают, что команда целенаправленно искала способы маскировки своей активности, обсуждала удаление строк с упоминаниями ISBN, Copyright, ©, All rights reserved (то есть любых явных признаков авторства и защиты прав), и и даже запрет на генерацию первых страниц книг по запросу — например, блокировали запросы типа «покажи три первые страницы “Гарри Поттера”».

Книги скачивали через BitTorrent и вот в чем фишка. Когда Meta скачивала библиотеку LibGen, она могла не только загрузить пиратские книги, но и невольно начать их раздавать другим пользователям. По законам об авторском праве это уже считается распространением нелегального контента — то есть нарушением. В Meta утверждают, что приняли меры, чтобы этого не произошло, но технически доказать это сложно. OpenAI, по слухам, тоже использовала LibGen, но пока неизвестно, как именно она загружала данные.


ИИ-компании настаивают, что обучение моделей на таких данных трансформирует тексты и потому допустимо. Но главный вопрос не столько в законе, сколько в будущем авторства. Если миллиарды долларов будут зарабатываться на переработке чужих работ без согласия авторов — кто вообще станет писать книги, проводить исследования или делиться знаниями?

Meta и OpenAI уверяют, что их модели помогут науке. Вот только кто захочет бесплатно делиться знаниями с теми, кто обещает отобрать у них работу - вопрос со звездочкой.

Хотя американские медиа вот согласились. Может, и среди остальных найдутся наивные.
The Atlantic The Unbelievable Scale of AI’s Pirated-Books Problem Meta pirated millions of books to train its AI. Search through them here.
  • 👍 3
More from @aipolitics
  1. Sep 29, 2026😇Правда или bullshit? В эссе On Bullshit философ Гарри Франкфурт предложил различать ложь…
  2. Sep 6, 2026Напишет ли ООН правила для ИИ? Товарищи по осмыслению международного развития ИИ выпустили…
  3. Sep 1, 2026В рамках нашей студенческой лаборатории мы активно экспериментируем с ИИ инструментами. Я…
  4. Sep 1, 2026🎙 Дебаты нейросетей: должен ли ИИ платить налоги? Наш коллектив продолжает эксперименты с…
  5. Aug 28, 2026Написал статью о том, как мировой ИИ петляет между открытостью и закрытостью Ровно год наз…
  6. Aug 18, 2026Акционеры развития ИИ: почему прогресс не гарантирует больших благ Тайвань собирается выпл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →