Qwen3.8-Omni-Flash теперь понимает и работает с видео
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
Post #8555
2.26K

- 🔥 11
- ❤ 6
- ⚡ 3
- 🤩 1