TGViewer
𝐀𝐓𝐎𝐌𝐈𝐂 𝐂𝐇𝐄𝐑𝐑𝐘 𝐀𝐓𝐎𝐌𝐈𝐂 𝐂𝐇𝐄𝐑𝐑𝐘 @atomiccherry · 69.1K subscribers
Post #706 53K
Успех DeepSeek сложился из нескольких факторов (и китайцы на самом деле хорошо поработали!), но ничего сверхъестественного в них нет.

Во-первых, DeepSeek принадлежит хэдж-фонду High-Flyer, целиком профинансировавшему разработку и предоставившему для нее свое «железо»: огромные массивы видеокарт, применяемых для прогноза колебаний рынка. Так что реальные суммы, вложенные в DeepSeek, могут на порядки отличаться от заявленных – никто и никогда не получит информации о бухгалтерии китайских инвестиционных компаний и проверить это невозможно (джентльменам и китайцам верят на слово).

Естественно, никаких уникальных копеечных и сверхмощных оригинальных китайских чипов в природе также не существует – обучена модель, как и ее конкуренты, в колоссальных датацентрах на NVIDIA предыдущего поколения, всё еше доступных КНР (разница с новыми там не катастрофическая).

Во-вторых, в основу DeepSeek положены множественные разработки, в том числе, находящиеся в открытом доступе уже несколько лет. Ее «фишка» – показывать рассуждения пользователю, взята из Meta LLaMa 3, разработанной в недрах Facebook достаточно давно и имеющей открытый код, вторая «фишка» – методология т.н. «совета экспертов» (Mixture of Experts, MoE) – из открытой модели Mixtral от Mistral AI. Для обучения, вполне возможно, использовалось множество синтетических, а не реальных данных (получать которые куда сложнее и дороже). Но на таких данных модель обучится хуже, поэтому (вишенка на торте!)... DeepSeek подстраховались и в качестве основы выкачали себе сам ChatGPT.

Об этом косвенно говорит несколько фактов: во-первых, дословно совпадающий API, во-вторых, полгода назад OpenAI зафиксировала аномальную активность на своих серверах – через их приложение кто-то выкачал колоссальные объемы данных (расследование этого инцидента продолжается с тех пор). В-третьих, DeepSeek, как заметили пользователи, страдает от особенной галлюцинации - иногда она принимает себя за ... ChatGPT, например, цитирует ее политику использования, говоря о себе, как о модели от OpenAI.

В результате, наиболее вероятна следующая ситуация. Китайцы создали собственную нейросеть на основе Meta LLaMa 3 и Mixtral, а затем прибегли (с целью огромной экономии) к т.н. «дистилляции знаний» (knowledge distillation): выкачали ChatGPT как он есть и заставили обучать свою модель, на что ушло всего несколько месяцев и были сэкономлены огромные средства и вычислительные мощности.

Если этот факт подтвердится – получится еще одна отличная демонстрация азиатского подхода к инновациям, не подводившего их с 1960-ых: взять созданное на Западе, скопировать, улучшить и по низкой цене продавать обратно на Запад.

Посему, любопытно будет посмотреть на новый ответ со стороны США.

@atomiccherry 💯
More from @atomiccherry
  1. Jun 23, 2026Полагаю, топливный кризис в Российской Федерации можно рассматривать уже как событие оформ…
  2. Jun 22, 2026Итак, открытая статья месяца. Последние недели Сеть полнится комментариями об ударах ВСУ п…
  3. Jun 22, 2026Тема новейших украинских дронов Hornet по очевидным причинам не дает покоя блогосфере — и…
  4. Jun 19, 2026В качестве дополнения к высказанным вчера тезисам я хотел бы привести для читателей отрыво…
  5. Jun 18, 2026В 1917 году, когда немецкие бомбардировщики «Гота» начали методично превращать кварталы Ло…
  6. Jun 18, 2026Воздушная война — один из самых интеллектуалоёмких типов боевых действий. По обыкновению э…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →