Успех DeepSeek сложился из нескольких факторов (и китайцы на самом деле хорошо поработали!), но ничего сверхъестественного в них нет.
Во-первых, DeepSeek принадлежит хэдж-фонду High-Flyer, целиком профинансировавшему разработку и предоставившему для нее свое «железо»: огромные массивы видеокарт, применяемых для прогноза колебаний рынка. Так что реальные суммы, вложенные в DeepSeek, могут на порядки отличаться от заявленных – никто и никогда не получит информации о бухгалтерии китайских инвестиционных компаний и проверить это невозможно (джентльменам и китайцам верят на слово).
Естественно, никаких уникальных копеечных и сверхмощных оригинальных китайских чипов в природе также не существует – обучена модель, как и ее конкуренты, в колоссальных датацентрах на NVIDIA предыдущего поколения, всё еше доступных КНР (разница с новыми там не катастрофическая).
Во-вторых, в основу DeepSeek положены множественные разработки, в том числе, находящиеся в открытом доступе уже несколько лет. Ее «фишка» – показывать рассуждения пользователю, взята из Meta LLaMa 3, разработанной в недрах Facebook достаточно давно и имеющей открытый код, вторая «фишка» – методология т.н. «совета экспертов» (Mixture of Experts, MoE) – из открытой модели Mixtral от Mistral AI. Для обучения, вполне возможно, использовалось множество синтетических, а не реальных данных (получать которые куда сложнее и дороже). Но на таких данных модель обучится хуже, поэтому (вишенка на торте!)... DeepSeek подстраховались и в качестве основы выкачали себе сам ChatGPT.
Об этом косвенно говорит несколько фактов: во-первых, дословно совпадающий API, во-вторых, полгода назад OpenAI зафиксировала аномальную активность на своих серверах – через их приложение кто-то выкачал колоссальные объемы данных (расследование этого инцидента продолжается с тех пор). В-третьих, DeepSeek, как заметили пользователи, страдает от особенной галлюцинации - иногда она принимает себя за ... ChatGPT, например, цитирует ее политику использования, говоря о себе, как о модели от OpenAI.
В результате, наиболее вероятна следующая ситуация. Китайцы создали собственную нейросеть на основе Meta LLaMa 3 и Mixtral, а затем прибегли (с целью огромной экономии) к т.н. «дистилляции знаний» (knowledge distillation): выкачали ChatGPT как он есть и заставили обучать свою модель, на что ушло всего несколько месяцев и были сэкономлены огромные средства и вычислительные мощности.
Если этот факт подтвердится – получится еще одна отличная демонстрация азиатского подхода к инновациям, не подводившего их с 1960-ых: взять созданное на Западе, скопировать, улучшить и по низкой цене продавать обратно на Запад.
Посему, любопытно будет посмотреть на новый ответ со стороны США.
@atomiccherry 💯
Post #706
53K