В коммерсанте вышел материал про модели с открытыми весами с моими небольшими комментариями. Пользуясь случаем, опубликую тут полную версию моих ответов, вдруг вам будет интересно почитать и с чем-то поспорить...
1. Сейчас на глобальном рынке мы видим, что крупнейшие игроки не просто публикуют открытые модели, но и сами строят продукты на чужих весах. Считается ли это нормой рынка? Можно ли сказать, что сегодня конкурентоспособность, экономическая ценность ИИ-продукта определяется не самой базовой моделью, а тем, что компания строит вокруг неё — данными, памятью, инструментами, сервисами и интеграцией в продукт?
Действительно, для крупных компаний существует много поводов использовать модели с открытыми весами. Во-первых, это может быть предоставление доступа к таким моделям в рамках легально доступной облачной платформы, как это делают Yandex Cloud и другие облачные провайдеры. Во-вторых, на базе моделей с открытыми весами можно сделать и собственные модели, лучше адаптированные к особенностям русского языка за счет обучения на русскоязычных датасетах. В-третьих, компании могут адаптировать модели с открытыми весами для использования на базе меньших вычислительных ресурсов с помощью квантования или дистилляции, что позволяет ускорять модели и удешевлять их без существенного падения качества, а также делает их пригодными для эксплуатации в небольших датацентрах (например, проект Ollama). Наконец, модель может быть вписана в более сложную сервисную инфраструктуру (Yandex AI Studio, которая включает в себя целый спектр инструментов для создания агентов на базе открытых и проприетарных моделей) или использоваться в рамках готового агентного решения.
2. Если все-таки ценность ИИ-продукта создается на этапе применения — насколько отказ от открытых моделей может повлиять на развитие технологий на российском рынке? Может ли это быть критично с учетом санкций и ограниченного доступа к вычислительным мощностям?
Запрет открытых ИИ-моделей действительно сильно замедлит развитие ИИ как отрасли, причем не только в России. Справедливости ради, в России есть свои обученные "с нуля" LLM, и соответствующие компетенции создания больших моделей есть как минимум у двух больших компаний. Хотя, как это всегда и бывает, конкуренция в среде моделей с открытыми весами способствует их быстрому совершенствованию и развитию.
3. Есть стереотип, что открытая модель по умолчанию опаснее закрытой. При этом Национальное управление по телекоммуникациям и информации США пришло к выводу, что риск моделей с широко доступными весами недостаточен, чтобы оправдывать ограничения на их распространение. Что вы думаете на этот счет? Стоит ли компаниям отказываться от открытых моделей или использовать их, но при это брать ответственность за безопасность их внедрения? Что именно в таком случае необходимо проверять перед использованием модели в продакшене?
На мой взгляд, основная опасность открытых моделей состоит в том, что они могут быть использованы злоумышленниками, и нет возможности проконтролировать их использование, в отличие от проприетарных моделей, использование которых может регламентироваться фильтрами, тарифами и т.д. Использовать же открытые модели в контуре своей компании - это правильная идея (с точки зрения обеспечения безопасности данных и полного контроля над системой), и тут основная сложность заключается в построении вокруг модели достаточно надежной инфраструктуры, выдерживающей нагрузку. С точки зрения безопасности проприетарные модели также страдают от большинства проблем, присущих любым LLM - галлюцинации, непрозрачное выравнивание, когнитивные искажения, промпт-инъекци и т.д. Поэтому проверять модель на корректную работу в той области, в которой её внедряют, всё равно придется вне зависимости от того, используется ли проприетарная или открытая модель, и говорить о существенно большей опасности моделей с открытыми весами я бы не стал. К слову, облачные провайдеры, предоставляющие модели с открытыми весами как сервис, берут на себя значительную часть проблем, включая масштабирование нагрузки, возможность добавить ограничительные правила на определённые запросы, а также как правило они имеют сертификаты безопасности, позволяющие использовать облачные модели даже в критичных областях.
Post #953
1.01K
- ❤ 3
- 👍 2