Не прошло и месяца с тех пор, как подписан закон о Суверенном ИИ, который разрешил бигтеху свободно парсить любые книги, фильмы и статьи в рунете для обучения ИИ, как вдруг ВНЕЗАПНО проснулось лобби правообладателей, которое выкатило поправки в Гражданский кодекс.
В новой логике само по себе обучение ИИ теперь предложено считать способом использования объектов авторских прав. Если вы скармливаете нейросети защищенный текст или картинку, вы обязаны выплатить правообладателю вознаграждение. Размер тарифов, порядок сбора и распределения этих денег, естественно, будет определять специально назначенная комиссия 👨🦳
Я хз как юридически и технически доказать, что конкретная нейросеть обучалась на конкретной книге Донцовой 👨🔬... ты берешь 5 ТБ сырого текста, токенизируешь его, и алгоритм обновляет миллиарды чисел с плавающей точкой. Исходный текст физически уничтожается в процессе. Внутри нет зазипованных книг, там только вероятности того, какое слово пойдет за следующим. Сделать grep невозможно.
ИМХО, раз доказать факт использования конкретного контента технически нельзя, значит, внедряется старая проверенная схема... налог на болванки имени Михалкова.
Напомню зумерам, что в РФ существует легализованный сбор в 1%, который берется с каждого ввезенного телефона, ноута и диска. Логика сбора такова:
на этом диске теоретически можно хранить пиратскую музыку, поэтому плати процент в Российский союз правообладателей
С нейросетями будет тот же самый момент. Никто не будет искать, чьи именно статьи кто спарсил. Введут условный налог на размер датасета, который все разработчики ИИ будут обязаны отслюнявливать в единый госфонд, а тот уже будет раздавать 🤑
Сберу и Яндексу по барабану, они просто заложат эти издержки в стоимость API для клиентов. А вот для опенсорс энтузиастов, мелких студий и стартапов... будет тяжелее ⚰️
Типичный 🥸 Сисадмин