У меня есть бенчмарк, где модель проходит разные стадии реализации реальной задачи из моего проекта. Он конечно очень не совершенен, но тем не менее видно разницу между сильными и не очень моделями. И результаты почти не дрейфуют при нескольких запусках.
Прогнал сегодня бенчмарк на новом Deepseek V4.1 Flash, в таблице он отображается как deepseek-flash. Он набрал больше баллов чем v4 flash, но меньше чем Sol у которой самый лучший результат из всех.
Эти цифры бенчмарков конечно не покажут насколько модель стала умнее. А вот что реально можно измерить и оценить - это цена за выполнения всех заданий, она у v4.1 в 2 раза меньше чем у v4. По общему времени выполнения новый флэш быстрее на четверть, но если смотреть на на задачи где надо только читать код, мы видим прирост в 2 раза. А там где модель пишет код, довольно много времени занимает сборка и запуск тестов.
В итоге мы имеем модель, которая в 2 раза дешевле по расходу токенов, и в 2 раза быстрее. Круто.
И ещё она при первом прогоне взломала мой бенчмарк, потому что в ворктри у нее была возможность посмотреть ветки с другими прогонами, и набрала 98% там где Sol набрал 92%, ни одна модель до нее до этого не догадалась (убрал такую возможность и модель набрала 89% - всё нормально). То есть это ещё модель, которая любит читерить, будьте аккуратны.
🧐Подписаться на канал
Post #169
200

- 🔥 5
- ❤ 1
- 🤔 1