Post #1844
487




Начало
По пунктам:
1. DeepSeek это компания, ChatGPT это сайт. Что с чем сравниваем? Если R1 c o1, то она не "мощнее". Результаты бенчмарков есть выше на скриншоте из пейпера самого DeepSeek. https://github.com/deepseek-ai/DeepSeek-R1/blob/main/DeepSeek_R1.pdf. По бенчмаркам она где-то лучше, где-то хуже, где-то равна. Но у OpenAI уже есть o3, для примера, выбивающая 71.7 на SWE-verified бенчмарке против 49.2 у R1. При этом на ChatBot арене (так себе так лидерборд, но что имеем), модель на 5 месте в категории HardPrompts
2. По первой половине фразы написал выше, по цене - частичная правда. В веб-интерфейсе бесплатная, по API - действительно сумасшедше дешевле. При этом API лежит, ну да ладно, OpenAI тоже ронял свои сервисы, бывает. https://status.deepseek.com/. Модель опенсорсная, веса лежат в открытом доступе, так что мы можем пойти на openrouter, и посмотреть, сколько стоит реальный инференс (запуск) этой модели, не субсидируемый (судя по всему) самим DeepSeek...И получаем цену входного токена всего в два раза дешевле o1, а выходной выходит (извините за тавтологию) в такую же цену! При всём этом, сам DeepSeek: Лежит, хостит с маленьким контекстным окном (мало токенов можно передевать), а также с маленькой скоростью (0.12 токена в секунду! Это шутка?!).
3. Откуда вообще взялась цифра в 6 миллионов? Это просто финальный запуск обучения обошёлся в 6 миллионов. Там же была ещё куча предыдущих экспериментов, закупка огромного количества железа (у NVIDIA, конечно), а также тысячи и тысячи часов работы инженеров. Это всё равно, что оборудовать завод, нанять работников у конкурентов, сделать глубокий ресёрч, сделать сотню неудачных экземпляров, а потом всем рассказывать, что ты сделал свою вундервафлю за 100 баксов и 14 спасибо от инвестора. И эти 6 миллионов - норм, вроде как, прайс для таких моделей (таких размеров)
4. Что? Требуется, конечно. Нет, их не нужно меньше, их нужно ещё больше. Желательно от NVIDIA. А ещё снимите санкции плез, нам очень нужны необрезанные карты в Китае. Ну и модель получилась удачная, давайте делать больше и лучше! Дайте ещё железа.
5. Нет, это не ударило по NVIDIA, это ударило по мозгам инвесторов, которые ведутся на всякую херню и любые инфоповоды. Они как не смыслили ничего, так и не смыслят. Очередной квартальный\годовой отчёт всё расставит по местам. Да и падение-то там не такой большое, если что. за два дня акции упали со 142 до 128 долларов за штуку. Это 10%.
6. Ох лол. Это просто какая-то голословная чушь.
Итого, пост на двачике - полный бред, не подкреплённый ничем.
Тем не менее, нужно отметить вот что:
1. DeepSeek представили хорошую reasoning-модель. Она среди лучших frontier-моделей на сегодня. Модель очень и очень и очень крутая.
2. Это OpenSource - такие модели в свободном доступе это всегда событие. Это даст буст всей отрасли, это поможет росту инженеров, от
этого выигрывают буквально все
3. Бесплатный доступ в официальном интерфейсе (даже из РФ без ВПН). Это круто, это покажет людям, насколько сильно нейросети продвинулись с момента релиза первой бесплатной версии ChatGPT. Да и просто халява это хорошо. Правда все данные хранятся в Китае и будут использоваться ими для обучения и анализа, но это уже наши проблемы :)
4. Они также релизнуди дистилляты в модели маленького размера, которые можно будет запустить локально в какой-нибудь LM Studio на вашем пк\маке\микроволновке или с чего вы там в интернет выходите.
5. Она не дешёвая в инференсе (только по оф.апи), оне не дешёвая в тренировке, она просто не дешёвая. Но. Она создана в условиях санкций со стороны США и не в США. Китай стронг и подкрепил статус сильнейшего игрока на поле, пока мы в Европе делаем несъёмные крышки у пластиковых бутылок.
Итого, релиз такой модели это буст для всего AI, всей сферы, всей индустрии, а также бюджетов, вливаемых в отрасль
По пунктам:
1. DeepSeek это компания, ChatGPT это сайт. Что с чем сравниваем? Если R1 c o1, то она не "мощнее". Результаты бенчмарков есть выше на скриншоте из пейпера самого DeepSeek. https://github.com/deepseek-ai/DeepSeek-R1/blob/main/DeepSeek_R1.pdf. По бенчмаркам она где-то лучше, где-то хуже, где-то равна. Но у OpenAI уже есть o3, для примера, выбивающая 71.7 на SWE-verified бенчмарке против 49.2 у R1. При этом на ChatBot арене (так себе так лидерборд, но что имеем), модель на 5 месте в категории HardPrompts
2. По первой половине фразы написал выше, по цене - частичная правда. В веб-интерфейсе бесплатная, по API - действительно сумасшедше дешевле. При этом API лежит, ну да ладно, OpenAI тоже ронял свои сервисы, бывает. https://status.deepseek.com/. Модель опенсорсная, веса лежат в открытом доступе, так что мы можем пойти на openrouter, и посмотреть, сколько стоит реальный инференс (запуск) этой модели, не субсидируемый (судя по всему) самим DeepSeek...И получаем цену входного токена всего в два раза дешевле o1, а выходной выходит (извините за тавтологию) в такую же цену! При всём этом, сам DeepSeek: Лежит, хостит с маленьким контекстным окном (мало токенов можно передевать), а также с маленькой скоростью (0.12 токена в секунду! Это шутка?!).
3. Откуда вообще взялась цифра в 6 миллионов? Это просто финальный запуск обучения обошёлся в 6 миллионов. Там же была ещё куча предыдущих экспериментов, закупка огромного количества железа (у NVIDIA, конечно), а также тысячи и тысячи часов работы инженеров. Это всё равно, что оборудовать завод, нанять работников у конкурентов, сделать глубокий ресёрч, сделать сотню неудачных экземпляров, а потом всем рассказывать, что ты сделал свою вундервафлю за 100 баксов и 14 спасибо от инвестора. И эти 6 миллионов - норм, вроде как, прайс для таких моделей (таких размеров)
4. Что? Требуется, конечно. Нет, их не нужно меньше, их нужно ещё больше. Желательно от NVIDIA. А ещё снимите санкции плез, нам очень нужны необрезанные карты в Китае. Ну и модель получилась удачная, давайте делать больше и лучше! Дайте ещё железа.
5. Нет, это не ударило по NVIDIA, это ударило по мозгам инвесторов, которые ведутся на всякую херню и любые инфоповоды. Они как не смыслили ничего, так и не смыслят. Очередной квартальный\годовой отчёт всё расставит по местам. Да и падение-то там не такой большое, если что. за два дня акции упали со 142 до 128 долларов за штуку. Это 10%.
6. Ох лол. Это просто какая-то голословная чушь.
Итого, пост на двачике - полный бред, не подкреплённый ничем.
Тем не менее, нужно отметить вот что:
1. DeepSeek представили хорошую reasoning-модель. Она среди лучших frontier-моделей на сегодня. Модель очень и очень и очень крутая.
2. Это OpenSource - такие модели в свободном доступе это всегда событие. Это даст буст всей отрасли, это поможет росту инженеров, от
этого выигрывают буквально все
3. Бесплатный доступ в официальном интерфейсе (даже из РФ без ВПН). Это круто, это покажет людям, насколько сильно нейросети продвинулись с момента релиза первой бесплатной версии ChatGPT. Да и просто халява это хорошо. Правда все данные хранятся в Китае и будут использоваться ими для обучения и анализа, но это уже наши проблемы :)
4. Они также релизнуди дистилляты в модели маленького размера, которые можно будет запустить локально в какой-нибудь LM Studio на вашем пк\маке\микроволновке или с чего вы там в интернет выходите.
5. Она не дешёвая в инференсе (только по оф.апи), оне не дешёвая в тренировке, она просто не дешёвая. Но. Она создана в условиях санкций со стороны США и не в США. Китай стронг и подкрепил статус сильнейшего игрока на поле, пока мы в Европе делаем несъёмные крышки у пластиковых бутылок.
Итого, релиз такой модели это буст для всего AI, всей сферы, всей индустрии, а также бюджетов, вливаемых в отрасль
- 👍 24
- ❤ 1











