⚡️ DeepSeek V4 Flash 0731 — прорыв в post-training моделей или переобучили на бенчах?
Архитектуру не меняли с прошлой версии — тот же 284B MoE с ~13B активных параметров, 1M контекст. DeepSeek провёл новый цикл post-training, именно он дал взрывной рост на агентных бенчмарках.
По бенчмаркам модель обходит V4-Pro Preview (1.6T параметров) на всех девяти опубликованных агентных тестах — при том, что активирует вчетверо меньше параметров на токен:
— Terminal-Bench 2.1 — 82.7 против 61.8 у preview (и 72.1 у Pro Preview)
— DeepSWE — 54.4 против 7.3 у preview — рост в 7.5× только за счёт post-training
...
Также на опубликованных DeepSeek бенчах оставляет позади себя GLM 5.2.
Мы замерили на своём бенче через нашего агента (выборка заданий из SWE-bench Verified). Результаты на картинке. Метрика выше GLM 5.2 и Sonnet 5. Также недавно мы замеряли Kimi K3, и оказалось, что с нашим харнесом модель показала невысокий результат и совсем не рядом с Opus 4.8.
DeepSeek V4 Flash 0731 добавили в KodaCode. Можно тестить.
PS: Кстати, ранее добавили Claude Opus 5 в KodaCode, и он по метрикам нашем сете — 88% vs Opus 4.8 — 83%.
@kodacoderu
Post #108
5.24K


- 🔥 23
- 👍 7