Я сторонник инноваций и поддерживаю развитие ИИ, его обучение. Но слепую веру мы не поддерживаем и не закрываем глаза на аргументы против.
Вот, не закрываю.
Итак, ИИ-модель, согласно разным позициям, может нарушать права на чужую IP двумя основными способами:
➡Через обучающий датасет (который создается на основании чужого IP и, скорее всего, не удаляется после обучения модели, ибо существует дрифт данных и концепции, про который можно почитать тут).
➡Через саму модель, которая в своих параметрах может «сохранять» чужие объекты или их охраняемые элементы.
В части обучающего датасета всё более-менее понятно – это точно воспроизведение, и нужен какой-то доп. костыль, чтобы это было правомерно без согласия правообладателей.
С моделью, как будто, всё должно быть проще, но отнюдь. Вот что об этом пишут в материале Бюро авторского права США и в исследовании по заказу Европейского парламента (обобщил на свой лад):
Если модель способна воспроизвести произведение почти дословно или с высокой степенью схожести (без явного указания в запросе), это означает, что произведение «хранится» внутри её параметров.
Веса модели — это фиксированные наборы чисел, которые можно копировать и распространять. Если они содержат «запомненные» произведения, то такое копирование может считаться воспроизведением самих произведений, даже если копирование совершает третье лицо, не участвовавшее в обучении.
Как и в случае с файлами (например, MP3 или JPEG), произведение не обязательно должно быть напрямую «видимым» в весах модели — достаточно, чтобы его можно было извлечь и воспроизвести с помощью техники (в данном случае, запуска модели).
Получается, что и модель, и обучающий датасет могут быть источниками риска. Проблема есть, а как ее решать?