DeepSeek представила экспериментальную
DeepSeek-V4-Flash-Vision-Exp — мультимодальную модель для агентов, которым нужно не только читать текст, но и понимать изображения и интерфейсы.Самое интересное — результаты на visual-agent бенчмарках: по заявленным тестам модель уже приближается к Opus 4.8, а в некоторых сценариях даже обходит её.
И всё это у Flash-версии, то есть у более лёгкой и дешёвой модели.
Если результаты подтвердятся шире, это хороший сигнал для рынка: сильные visual agents могут стать заметно дешевле и доступнее без необходимости использовать самые тяжёлые frontier-модели.
https://x.com/Machinelearrn/status/2090746817042362667
