NVIDIA пыталась получить доступ к крупному архиву пиратских книг для обучения ИИ
Доказательства обнаружили в электронных письмах сотрудников компании.
Коллектив писателей подал в суд на компанию NVIDIA. Корпорацию обвиняют в попытке получить доступ к электронной библиотеке Anna’s Archive для обучения моделей искусственного интеллекта. Anna’s Archive — некоммерческая система с открытым исходным кодом, агрегирующая пиратские библиотеки. Архив сервиса состоит из 40,3 миллиона книг и 98,4 миллиона научных статей.
Согласно материалам иска, NVIDIA пыталась получить высокоскоростной доступ к 500 ТБ данных и включить этот массив в датасеты для предварительного обучения LLM. Представители Anna’s Archive предупреждали сотрудников компании, что сервис распространяет нелегальный контент, однако, как утверждают истцы, руководство NVIDIA всё равно рассматривало возможность его использования.
В предыдущих судебных разбирательствах представители NVIDIA заявляли, что обучение моделей — это не копирование текста, а обучение на статистических паттернах, которое попадает под термин «добровольное использование». Новый иск компания пока не прокомментировала.
Post #2853
1.35K

- ❤ 5
- 😁 3
- 🤣 3