Alibaba представила сразу две новые мультимодальные модели, которые уже привлекли внимание исследователей — Qwen3-VL-2B и Qwen3-VL-32B. И если первая модель привнесла значительные улучшения, то вторая сразу же побила рекорды по производительности и вывела на новый уровень задачи, связанные с визуальными вопросами, анализом видео и распознаванием текста.
✔️ Что отличает Qwen3-VL-32B?
Хотя модель обладает «всего» 32 миллиардами параметров, ее результаты впечатляют. Она не просто конкурирует с более мощными системами, которые могут иметь до 235 миллиардов параметров, но и превосходит их на ряде бенчмарков, включая OSWorld.
Главная причина такого успеха — новая архитектура с иерархическим вниманием, которая позволяет модели эффективно интегрировать текст, изображение и видео в едином контексте. Это делает Qwen3-VL-32B не просто инструментом для анализа изображений, но и мощной системой для решения сложных задач в области STEM (наука, технологии, инженерия и математика), видеовопросов (VQA), а также анализа видеопотоков и даже автономных агентов.
▶️ Что может эта модель?
Qwen3-VL-32B демонстрирует способность не просто распознавать кадры на видео, но и понимать сюжет и причинно-следственные связи. Это открывает возможности для более глубокого анализа видео, создания автономных агентов и разработки образовательных платформ, где важно не только понимать контент, но и делать логические выводы.
И, конечно, на этом Alibaba не остановилась. Оба продукта, Qwen3-VL-2B и Qwen3-VL-32B, доступны для тестирования и интеграции через Hugging Face и Qwen Studio, где можно опробовать их возможности и подключить к собственным проектам с помощью демо-версий и API.
Data Science
