Гораздо меньше знают о том, откуда она взялась и как так получилось, что она вывела Китай в мировые лидеры в разработке ИИ. А история это довольно интересная🤓
⚪️ Зарождение DeepSeek и финансовый успех Лян Вэньфэна
История DeepSeek начинается с Лян Вэньфэна, человека, который первоначально добился успеха и значительного состояния в мире финансов. После окончания университета в период финансового кризиса 2008 года Лян заинтересовался поиском закономерностей в хаосе с помощью машинного обучения.
В период с 2013 по 2016 год Лян основал несколько компаний, кульминацией чего стало создание в феврале 2016 года хедж-фонда Highflyier. Основной целью его предприятий было
использование машинного обучения для выявления микроскопических закономерностей на финансовых рынках, которые были незаметны для людей
Это было, по сути, искусственным интеллектом до того, как этот термин стал широко распространен.
Подход Ляна оказался весьма успешным. К концу 2021 года Highflyier управлял активами на 9,4 миллиарда долларов и показывал доходность, значительно превышающую показатели фондового рынка. К 35 годам Лян стал миллиардером. Все рыночные стратегии Highflyier были основаны на искусственном интеллекте и работали на суперкомпьютере с 10 000 GPU Nvidia.
⚪️ Переход к исследованию общего интеллекта и основание DeepSeek
Однако амбиции Ляна простирались за пределы финансов. Несмотря на свой успех, он стремился к исследованию общего интеллекта. Это привело к созданию в апреле 2023 года DeepSeek, первоначально как исследовательской организации.
На ранних этапах своего развития летом 2023 года DeepSeek значительно отставал от западных AI-лабораторий, таких как OpenAI, которые уже выпустили GPT-4. DeepSeek обратил особое внимание на Llama 2 от Meta из-за ее открытых весов, что обеспечивало больший доступ и возможности для адаптации.
В мае 2023 года Лян заявил, что цель DeepSeek - сосредоточиться на исследованиях, а не на вертикальных доменах и приложениях. Он также отдавал предпочтение молодым и любознательным китайским специалистам, даже недавним выпускникам, ценя способности выше формальных квалификаций.
В DeepSeek была создана среда с минимальным управлением, поощряющая исследования и свободу совершать ошибки, что, по мнению Ляна, было крайне важно для истинных инноваций.
⚪️ Первые модели и фокус на долгосрочные цели
Первые модели AI от DeepSeek, выпущенные в ноябре 2023 года, включая DeepSeek Koda и V1, не отличались новаторством, причем V1 был во многом вдохновлен Llama 2.
Однако уже тогда проявлялся фокус на долгосрочных целях. Например, DeepSeek намеренно исключил вопросы с множественным выбором из своих обучающих данных, чтобы избежать переобучения на бенчмарках и обеспечить лучшую производительность в реальных условиях. В DeepSeek считали, что
переобучение на бенчмарках не будет способствовать достижению истинного интеллекта модели.
⚪️ Прорывные инновации в 2024 году
К началу 2024 года DeepSeek добился значительных успехов. В январе они разработали новый подход к повышению интеллекта моделей при меньших затратах, усовершенствовав подход "mixture of experts". Определенные экспертные подсети всегда активировались в любом ответе, что позволяло остальным экспертам сосредоточиться на своих сильных сторонах. Это стало одним из секретов базовой модели, лежащей в основе DeepSeek R1.
Окончание здесь