Ant Group выпустила Ling-3.0-flash-VL, зрячую версию своей Ling-3.0-flash: MoE, 5,1 млрд активных из 124, теперь с пониманием картинок и визуальными агентными задачами. Сравнивают с Qwen3.8-27B, Gemini 3.5 Flash-Lite и Step-3.7-Flash, таблица на картинке.
Впереди по подсчёту объектов, распознаванию документов в OmniDocBench, агентным задачам с картинками (ClawEval-MM с заметным отрывом, WebVoyager) и на собственном тесте по чтению медицинских заключений, в MMMU-Pro вровень с Gemini. Отстаёт от Qwen3.8-27B в математике по картинкам, Humanity's Last Exam, чтении графиков и вёрстке по скриншоту, а в WorldVQA сильно уступает Step-3.7-Flash.
Весов и страницы модели пока нет: ни на HuggingFace, ни на ModelScope. У текстовой Ling-3.0-flash лицензия MIT.
@neuro_channel
Post #2828
1.82K

- ❤ 2