TGViewer
Осцилляции WaveCut Осцилляции WaveCut @wavecut_vibin · 1.05K subscribers
Post #333 1.58K
🐳 DeepSeek V4 (Preview)

Пока западные лабы надувают свою важность удваивают цены на API, китайцы просто дропают веса двух новых SOTA моделей в опенсорс даже не обновив официальный вебсайт, лол.

В релизе сразу две версии: гигантская V4-Pro на 1.6T параметров (49B активных) и быстрая V4-Flash (284B параметров, 13B активных). Обе поддерживают 1 миллион контекста "из коробки". Без мультимодальности.

Главное по технике и цифрам:
ℹ Гибридное внимание:
Внедрили CSA и HCA (Compressed Sparse Attention). Результат — KV-кэш при контексте в 1 миллион токенов занимает в 10 раз меньше места, чем у версии V3.2. Это делает длинный контекст не просто возможным, а дешевым и быстрым.

ℹ Производительность Pro:
Модель официально стала сильнейшим опенсорсом. На SWE-Bench Pro выдает 55.4%, на Terminal-Bench 2.0 — 67.9%. В кодинге и математике (Codeforces 3206, IMOAnswerBench 89.8%) она идет на уровне или выше GPT-5.4 и Claude Opus 4.7.

ℹ Thinking Modes:
Теперь в API три режима: Non-think (мгновенный ответ), High и Max. В режиме Max модель "думает" до победного, что позволяет Flash-версии по ризонингу вплотную приближаться к Pro.

ℹ Оптимизация:
Юзают микс FP4 и FP8 (эксперты упакованы в 4 бита), новый оптимизатор Muon и архитектуру mHC для стабильности сигнала между слоями.

ℹ Бенчмарки: где победа, а где нет
DeepSeek V4-Pro ожидаемо разрывает в математике и STEM-задачах. Но если смотреть на SimpleQA-Verified (фактология), модель выбивает 57.9%. Это огромный скачок относительно V3, но Gemini 3.1 Pro с ее 75.6% все еще далеко впереди. Галлюцинации на редких фактах — все еще слабое место.


💲 Цены:
Прайс на Flash — смешные $0.14 за вход и $0.28 за выход миллиона; у Pro — 1.74/3.48, соответственно.
Для сравнения: вчерашняя GPT-5.5 от OpenAI стоит $30 за выход, а 5.5 Pro — $180. Разница в 50-100 раз при сопоставимых результатах в кодинге и логике.

Китайская лаборатория поступила довольно смело, зарелизив веса в день релиза GPT-5.5.

Отдельный респект за поддержку API в форматах и OpenAI, и Anthropic. Модель бесшовно подкидывается в Claude Code, OpenClaw и любой агентский тулинг.

Пока одни строят закрытые сады и повышают налоги на интеллект, DeepSeek делает 1М контекста и топовый ризонинг копеечным товаром. "Налог на бренд" OpenAI становится слишком дорогим удовольствием.

Технический отчет
Веса моделей (включая базовые)
Попробовать онлайн
  • 👍 10
  • ❤ 8
More from @wavecut_vibin
  1. Oct 7, 2026Post #573
  2. Oct 6, 2026думайте
  3. Oct 6, 2026Астрономическое явление 1561 года над Нюрнбергом
  4. Oct 6, 2026Post #570
  5. Oct 6, 2026Post #569
  6. Oct 5, 2026Post #568
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →