📚 Можно ли учить ИИ на чужих текстах?
Минюст США поддержал OpenAI в споре с The New York Times. По мнению ведомства, обучение нейросетей на материалах, защищенных авторским правом, может считаться добросовестным использованием — fair use. Как обстоят с этим дела у нас и стоит ли нам сделать так же, обсудила с Анной Швецовой из Comnews.
🇷🇺 Что в России?
Российские ИИ-модели могут обучаться на материалах, защищенных авторским правом, но сейчас для их использования необходимо правовое основание: например, разрешение правообладателя или лицензия.
Отдельное исключение именно для обучения ИИ начнет действовать с 1 марта 2027 года. Федеральный закон № 243-ФЗ предусматривает, что с этой даты анализ охраняемых материалов и их краткосрочное воспроизведение в памяти компьютера для обучения суверенных и национальных больших фундаментальных моделей ИИ не будут считаться нарушением авторских и смежных прав при соблюдении установленных условий.
Речь идет о случаях, когда разработчик получил экземпляр произведения правомерно либо материал был доведен до всеобщего сведения и доступен для анализа без технических ограничений. Поэтому публикация текста или изображения в интернете еще не дает универсального разрешения использовать его для обучения любой модели. Новое исключение распространяется только на суверенные и национальные большие фундаментальные модели.
До вступления нормы в силу наиболее надежный вариант — использовать собственные данные, лицензированный контент, произведения из общественного достояния или материалы под открытыми лицензиями.
🇺🇸 Нужно ли России перенимать подход США?
Сначала важно уточнить: позиция Минюста США — это не новый закон и не решение суда, а позиция правительства в конкретном разбирательстве. В США действует концепция fair use, причем вопрос о добросовестности использования решается судом с учетом обстоятельств каждого дела.
Россия уже выработала собственный подход. С 1 марта 2027 года у нас появится отдельное исключение для обучения суверенных и национальных больших фундаментальных моделей ИИ. Оно распространяется только на определенные категории моделей и устанавливает условия доступа к исходным материалам.
Разработчикам нужен доступ к большим массивам качественных данных, но правообладатели должны понимать, как используется их контент. Поэтому теперь важно посмотреть, как новый механизм заработает на практике и обеспечит ли он российским разработчикам достаточный доступ к качественным данным.
🧠 Есть ли риск отставания от зарубежных моделей?
Такой риск есть, особенно для больших языковых и мультимодальных моделей. Их возможности во многом зависят от объема, качества и разнообразия данных. Если значительная часть книг, СМИ, изображений и профессиональных текстов окажется недоступна, разработчикам будет сложнее создавать модели с широкими знаниями и хорошим пониманием российского контекста.
Новый режим, который начнет действовать в 2027 году, должен снизить этот риск для суверенных и национальных больших фундаментальных моделей. Дополнительно разрыв можно сокращать за счет лицензионных соглашений, партнерств с издателями и платформами.
Поэтому главный вопрос — насколько широкий и качественный набор материалов российские разработчики смогут легально использовать на практике.
⏺«Богатырёва о цифре» в Максе
Post #5309
20.2K
Forwarded from Богатырёва о цифре