Qwen-MM-Plugins уже есть
18 сентября 2026 года MarkTechPost сообщил о запуске Alibaba Qwen3.8-Omni-Flash: мультимодальной API-модели с контекстом в 1 млн токенов и агентным анализом аудио и видео. Для инженерной команды это была бы заметная новость: длинные записи инцидентов, демо и созвоны можно было бы разбирать не полным прогоном, а итеративным поиском релевантных фрагментов.
В материале портала приведены конкретные цены, лимиты, бенчмарки и заявления о доступности, однако первичный анонс Qwen, карточка модели в официальной документации и API-спецификация для Qwen3.8-Omni-Flash при проверке не обнаружены.
В организации QwenLM есть открытый репозиторий Qwen-MM-Plugins под Apache-2.0. Это набор Skills и MCP-серверов для мультимодальных сценариев, включая чтение видео, память для длинных роликов и интеграции с агентными оболочками. Документация прямо указывает внешние зависимости: для работы с видео нужен ffmpeg, а часть функций завязана на ключи сторонних поисковых и модельных API.
Практический вывод уже сейчас: если команда хочет подключать анализ видео к агенту, стоит отдельно оценивать стоимость передачи медиа, хранение артефактов, доступ MCP-сервера к локальным файлам и воспроизводимость версий Skills.
Почему это важно: решение о внедрении мультимодального API влияет на бюджет инференса, контур доступа к записям и локальным файлам, зависимости CI/agent harness и требования к воспроизводимости.
Какие записи ваша команда готова отдавать внешнему мультимодальному API: демо, логи инцидентов, обучающие видео или вообще никакие?
Источник: MarkTechPost
Post #728
51

- 🔥 3