TGViewer
DataWorkshop - AI & ML DataWorkshop - AI & ML @data_work · 1.88K subscribers
Post #510 494
DeepSeek - модель LLM, заслуживающая внимания. Правда! Потрать 30 секунд и убедись 🙂

Контекст

Под ёлочку 🎄 появился "подарок" DeepSeek v3, который произвел большое впечатление.

Почему? Потому что...
--> обучение прошло значительно дешевле, чем у моделей LLM подобного качества (всего $5-6 млн, а не $50 млн или даже более $100 млн, как принято в отрасли), добавлю, что эта модель имеет 600B параметров (для сравнения, самая большая Llama имеет 400B)
--> использование (инференция) дешевле, чем у аналогичных моделей LLM
--> много других интересных особенностей, например, умеет прогнозировать два токена вперед (не только один)

Но это оказалось только началом... Китайцы создали новую модель DeepSeek r1, вдохновленную "размышляющими" моделями OpenAI (o1/o3). Механизм размышления - тема для отдельного обсуждения.

Правда, в этом случае стоимость "использования" тоже выросла.

Поясню.

В наших тестах в Lab DataWorkshop проверяются десятки моделей LLM, и модели DeepSeek v3/r1 показывают результаты лучше большинства моделей LLM (включая коммерческие). Они стабильно входят в TOP 3 среди открытых моделей.

При выборе модели "AI" ключевыми факторами являются как качество результатов, так и затраты. Иногда для бизнеса лучше выбрать более дешевую модель с немного более низким качеством, если она соответствует базовым требованиям. А с ценами бывает по-разному:
--> Claude Opus 3: $1000
--> Claude Sonnet 3.5: $90
--> Deep Seek v3: $10
--> Deep Seek r1: $300

Интересно, что например Opus 3, несмотря на самую высокую цену, дает самые слабые результаты (из моделей выше). Важно! Эта цена учитывает не только стоимость токена, но и необходимость многократного повторения запросов для получения удовлетворительного ответа, то есть это финальная (реальная) цена.

Модель r1 заняла в одном из рейтингов первое место! Wow 😱. Так бывает не всегда! Этот рейтинг был связан с "логическими" задачами (назовем их так) в определенной отрасли на польском языке, поэтому можно сказать, что знания были довольно "специфическими" для всех моделей LLM. Модель r1 обошла все (да-да - все) модели, включая коммерческие модели OpenAI, Gemini, Anthropic, Grok... 😱😱😱. Конечно, это зависит от задачи, не всегда r1 будет на первом месте, но в этом случае так получилось. Замечено (что, кстати, логично, но в мире LLM нельзя верить на слово, поэтому в DataWorkshop проверяем на практике), что действительно r1 очень хорошо справляется там, где нужно "подумать", например, найти какие-то логические зависимости прямо в тексте или в знаниях, которыми обладает модель.

Стоит отметить, что обе модели DeepSeek v3 и r1 довольно хорошо справляются не только с английским (например польским).

Интересный факт (на фото): модель r1 якобы научилась "останавливаться" и ловить "момент озарения" как человек, хотя этому её не учили. Хотя тема вызывает дискуссии, это имеет смысл с логической точки зрения. LLM все лучше справляются с логикой.

Что думаешь об этом?

P.S. Хочешь быть в курсе новостей LLM? Следи за моими постами 🙂
P.P.S. Open AI лежит, но наши тесты уже выключены, должно скоро встать 😉

---
Хочешь освоить LLM с практической стороны? Есть решение! В курсе "Практический LLM" раскрываются секреты построения надежных, достоверных систем AI. Познакомишься с эффективными методами валидации данных, стабилизации RAG, Агентами AI и объединением классического ML с LLM. Записывайся.

#llm #deepseek
@data_work
  • 🔥 8
  • 👍 3
More from @data_work
  1. Jul 16, 2025Помнишь, как прятали невидимые команды (prompt injection) в статьи на arXiv, чтобы влиять…
  2. Jul 14, 2025👆👆👆 Исследователи из 14 университетов (в том числе ведущие учреждения!) начали “взламыв…
  3. Jul 14, 2025Думаешь, что схитришь, поручая ИИ читать 100-страничные отчеты? Что может пойти не так, пр…
  4. Apr 7, 2025👆👆👆 (часть 1) Теперь конкретно, по моделям: 1️⃣ Llama 4 Scout: Это «младшая» версия с 1…
  5. Apr 7, 2025🚨 Вышла Llama 4 — проверил лично и делюсь впечатлениями! 🔥 TLDR: Давно ждал Llama 4 — и…
  6. Apr 6, 2025Закончился первый поток курса "Практический LLM". В нём прежде всего уделяется больше вним…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →