Дистилляция. Почему DeepSeek юридически возможен
YouTube | Подкаст | Слушать
Если задуматься, то за последние почти уже три года, как мы все живем в новой реальности, где в айти-индустрии кроме ИИ и обсудить-то нечего, самое яркое событие — это появление DeepSeek, про который сейчас говорят немного. Появление было красивым, китайский маркетинг, обычно крайне беззубый (вспомним, например, совершенно кустарный маркетинг в спортивном сегменте), смог все подать в искаженной перспективе под очень удачным углом так, что многие до сих пор уверены, что это была схваткой Давида и Голиафа, где на схватку с разжиревшим самодовольным Голиафом OpenAI вышел голодный китайский Давид, эффектно совершивший бросок через бедро если не на иппон, так уж на вадзари — наверняка.
Феномен DeepSeek во многом был срезанием углов: вместе с классическим обучением на том, что получилось достать, DeepSeek провели масштабную дистилляцию флагманской модели ChatGPT: под роем аккаунтов задавали ей массу синтетических вопросов и обучали на ответах модели. Дистилляция существенно, возможно на порядок или даже два, дешевле, чем обучение на реальных данных для получения сравнимого результата. Дистилляция не является полноценным обучением в том смысле, что модель может быть чрезвычайно хороша в каких-то конкретных ситуациях (обычно отчего-то связанных с бенчмарками), но резко теряется в прочих. А еще дистилляция — это серая зона.
Появление DeepSeek, опенсорсного Давида, послужило таким шоком и унижением для OpenAI, что обнаружив «плагиат», Сэм Альтман даже заговорил о суде, однако через недельку остыл, и больше к этой теме не возвращался.
А почему так? Насколько дистилляция законна? Как я говорил несколько ранее, правовая сторона текущего момента ИИ-бизнеса несколько причудлива, и местами даже шизофренична, но то объясняется тем, что регулярная практика и правовая база физически не успевает за резким взлетом отрасли. Прямо сейчас, в моменте, дистилляция совершенно законна. Эта законность, как и феномен DeepSeek, основывается на простом факте: вывод LLM не попадает под копирайт. Дело в том, что копирайт по всем законодательным нормам определяется через авторство человека, и только человека, замечательным примером чему может служить классическая история об обезьяне, стащившей камеру и снявшей видео. Так вот, LLM — не человек. Следовательно, продукция работы LLM не может быть предметом копирайта по текущим законодательствам большинства стран. А раз этот выхлоп не попадает под копирайт, то в процессе дистилляции вы в принципе не можете нарушить никаких прав.
Внимательный читатель задает вопрос: «а как быть с TOS»? А тут дело в том, что Terms Of Service не являются законом, это оферта. Вы выполняете вот такие пункты, а мы обвязываемся предоставлять свои услуги. Вы нарушаете оферту — мы прекращаем предоставлять вам сервис, и, условно, блокируем. В случае, когда в процессе нарушения оферты вы не нарушаете никаких законов, то бан — худшее, что могут сделать.
Отсутствие копирайта на выхлоп LLM еще приводит к интересному свойству текущего момента: вы не можете накладывать копирайт на те картинки, музыку или видео, которые были произведены моделями. То есть, если вы просто сгенерировали логотип и использовали как есть; сгенерировали видео, и тоже использовали прямо так, без существенной человеческой редактуры, то вы не можете использовать эти вещи как объекты авторского права. Любой другой человек может на основе вашей картинки сгенерировать нечто похожее, и вставить к себе, запутав тем самым потенциальных клиентов, и вы ничего с этим сделать не сможете. Возможно, хоть я и не нашел тому никакого подтверждения, сгенерированные картинки можно даже просто воровать.
Безусловно, это скоро все изменится. Но в моменте я бы немножечко сдерживал свой энтузиазм по поводу генерации всего на свете.
Post #12
137