Интереснее всего, как она смотрит длинное видео. Раньше запись прогонялась от начала до конца, даже если ответ лежит в паре минут. Теперь агент сам решает, какие куски посмотреть и послушать, и подбирается к ответу в несколько заходов от грубого к точному. На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал со 145 736 до 79 117.
Весов нет, модель живёт только в API. Зато открыли Qwen-MM-Plugins, набор, который добавляет звук и видео в готовые агентные харнессы, и Qwen-Live Harness под реалтайм-версию, он ставится командой
npm install -g qwen-live-harness. Попробовать можно на платформе Qwen.@neuro_channel