DeepSeek-V4.1-Flash вышла с открытыми весами - в отдельных агентских тестах она обходит Opus 5 и GPT-5.6 Sol
По результатам, опубликованным DeepSeek:
* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.
Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.
В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.
Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.
Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Post #5743
4.22K



- 🔥 15
- ❤ 9
- 👍 8
- 😱 1