Сегодня DeepSeek анонсировал наконец релиз V4: компания одновременно выпустила и полностью открыла исходный код двух версий флагманской модели DeepSeek-V4.
🤖 Две модели под разные задачи
• DeepSeek-V4-Pro (размерность 1.6 трлн параметров, активация 49 млрд, контекст 1M) — топовая модель для самых сложных задач.
• DeepSeek-V4-Flash (размерность 284 млрд параметров, активация 13 млрд, контекст 1M) — более быстрая и экономичная версия.
Контекст в 1 миллион токенов теперь стал стандартом для всех сервисов DeepSeek.
🧠 Ключевые инновации архитектуры
• Гибридная архитектура внимания: сочетание сжатого разреженного внимания (CSA) и высокосжатого внимания (HCA), что значительно сокращает вычислительную сложность при обработке длинных контекстов..
• Muon-оптимизатор: ускоряет схождение и повышает стабильность обучения.
• Пост-тренировочный пайплайн: DeepSeek-V4-Flash обучен на 32 трлн токенов, DeepSeek-V4-Pro — на 33 трлн токенов.
• Эффективность длинного контекста: по сравнению с DeepSeek-V3, FLOPs снижены на 73%, а размер KV-кэша уменьшен на 90%.
📊 Улучшенные способности
• Agent-возможности: внутри компании DeepSeek V4 уже используется как Agentic Coding модель, и по отзывам сотрудников, она превосходит Sonnet 4.5, а по качеству близка к Opus 4.6 (но пока уступает режиму мышления Opus 4.6).
• Мировое знание: значительно превосходит другие открытые модели и лишь немного уступает топовым закрытым аналогам, таким как Gemini-Pro-3.1.
• Логические рассуждения: в тестах по математике, STEM и конкурсному программированию DeepSeek-V4-Pro превосходит все известные открытые модели и сравнима с лучшими закрытыми.
💻 Поддержка AI-агентов
V4 оптимизирован для популярных Agent-платформ: Claude Code, OpenClaw, OpenCode, CodeBuddy. Доступен как через OpenAI ChatCompletions, так и через Anthropic интерфейс.
API уже доступен, цены конкурентные. Для сложных Agent-сценариев рекомендуется использовать режим мышления с параметром
reasoning_effort, установленным на max.💪 Переход на Huawei Ascend
Подтверждено использование чипов Huawei. Сегодня в в Китае запланирована трансляция запуска DeepSeek V4 на платформе Huawei Ascend. Кроме того, компания Cambricon уже обеспечила Day 0 адаптацию обеих моделей на основе vLLM.
В конце анонса компания процитировала философа Сюнь-цзы: «Не льстись на похвалу, не бойся клеветы, следуй Пути и оставайся собой».
Сайт | HuggingFace | Технический отчет | GitHub
🎙️ Что дальше?
Старые названия моделей «deepseek-chat» и «deepseek-reasoner» будут отключены через три месяца (2026-07-24).
#DeepSeek #DeepSeekV4 #OpenSource #LLM