🐋 Кит вернулся: DeepSeek выпустила V4.1 Flash
DeepSeek представила новую модель для программирования и ИИ-агентов — и цифры получились интересными.
На DeepSWE v1.1 разработчик заявляет 74,2% против 74,0% у Claude Opus 5 и 73,0% у GPT-5.6 Sol. В CyberGym новая DeepSeek получила 88,1% против 84,5% у Sol, а в AutomationBench вышла вперед с результатом 54,8%.
Но хоронить конкурентов рано. В других тестах ситуация меняется: GPT-5.6 Sol и Claude Opus 5 остаются сильнее в части задач на рассуждение, работу в терминале и информационную безопасность. А результат 74,2% на DeepSWE пока опубликован самой DeepSeek — в независимой таблице теста V4.1 Flash еще нет.
Под капотом тоже интересно. Основная модель содержит 552 млрд параметров, плюс еще 196 млрд параметров Engram, но при обработке входа задействуется около 8 млрд параметров на токен, а при генерации — 16 млрд. Контекст — до 1 млн токенов, есть работа с изображениями.
DeepSeek также почти в четыре раза уменьшила KV-кеш по сравнению с прошлой Flash. Для агентов, которые часами таскают за собой огромную историю работы, это напрямую влияет на стоимость.
Цены вне часов пик — $0,15 за миллион входных токенов и $0,60 за миллион выходных. В часы пик — $0,30 и $1,20.
Компания настолько уверена в новой Flash, что с 14 сентября собирается временно перенаправлять на нее даже запросы к V4 Pro — до выхода V4.1 Pro.
https://anonhaven.com/news/deepseek-v41-flash-oboshla-flagmany-v-agentnyh-testah/
@Anonhaven | anonhaven.com
Post #447
32