🐳 Вчера с @uburov обсуждали тему, почему DeepSeek пошел в опенсорс и пришли к интересным выводам.
DeepSeek сделали значительное открытие в области LLM (отказ от SFT в пользу RL с максимально простой reward-моделью и другие улучшения, которые сокращают стоимость обучения и инференса в 20-50 раз). Но почему DeepSeek выложили это в открытый доступ, нивелировав свое конкурентное преимущество?
Сначала у меня были такие предположения:
- У них на руках уже есть еще более мощные модели, так что поделиться ради PR было не жалко
- Публикация в рамках ценностей научного сообщества
- Компания не знает быстрого способа монетизировать свою находку
Но если мы посмотрим на биографию Liang Wenfeng, то становится понятно, что вряд ли. Дядя миллиардер, 10 лет управляет хедж-фондом и много чего еще.
Так что наша гипотеза, почему deepseek опубликовал свое открытие, такая:
- Открытие значимое, но долго прятать его не получится. У компании было 1-3 месяца до того, как этот подход нащупали бы остальные.
- За это время монетизировать или как-то выгодно применить его было нельзя
- DeepSeek пошли по пути дизрапта. 2 недели назад они были "одними из многих", уровня mistral-ai
- Сейчас это "китайский OpenAI" - все внимание им, все лучшие специалисты им
- А тут еще и $137b китайцы выделяют на AI. Ясно, кто будет главным кандидатом на роль "китайского Альтмана".
Момент выбран идеально и коллеги из DeepSeek прекрасно им воспользовались! Респект! 🫡
Post #68
1.34K
- 👍 38
- 🔥 1