🇨🇳🤖 Alibaba представила Qwen3.8-Omni-Flash – мультимодальную ИИ-модель для работы с текстом, изображениями, аудио и видео
Команда Qwen 18 сентября представила Qwen3.8-Omni-Flash – новую модель, ориентированную на мультимодальных ИИ-агентов и обработку информации сразу в нескольких форматах. В отличие от обычных мультимодальных моделей, основным направлением развития стала не просто обработка изображения или видео, а выполнение длительных задач с использованием аудио- и видеоматериалов, программных инструментов и внешних сервисов.
📌 Архитектура
Qwen3.8-Omni-Flash построена на архитектуре Qwen3.8-Flash-Next, открытая версия которой была представлена в августе.
Модель поддерживает:
– контекст до 1 млн токенов;
– одновременную обработку текста, изображений, аудио и видео;
– до 131 тыс. выходных токенов;
– режим рассуждений;
– вызов программных инструментов;
– встроенный веб-поиск;
– работу с многоканальным и пространственным аудио.
Текущая версия через обычный API формирует текстовый ответ. Количество параметров и полный состав Qwen3.8-Omni-Flash разработчики пока не раскрыли.
📌 Главная особенность – мультимодальные ИИ-агенты
Модель может не только анализировать видеозапись или аудиофайл, но и самостоятельно определять необходимые этапы работы, обращаться к инструментам, выбирать нужные фрагменты материала и продолжать анализ на основании полученных результатов.
В качестве основных сценариев разработчики называют программирование, работу с документами и графическими интерфейсами, анализ длительных видеозаписей, мультимедийное реферирование, монтаж видео, создание музыкальных клипов и обработку аудиовизуальных материалов.
📌 Программирование
Несмотря на значительно более развитую работу с аудио и видео, показатели модели в программировании практически не отличаются от Qwen3.8-Flash-Next. Таким образом, расширение мультимодальной части практически не привело к снижению возможностей основной модели при решении программных и логических задач.
🔺 Qwen3.8-Omni-Flash фактически переносит архитектуру Flash-Next на значительно более широкий класс мультимодальных задач. Главное изменение заключается не просто в возможности загрузить аудио или видео, а в использовании этих данных непосредственно в ходе длительной агентной работы: модель может анализировать материал, выбирать необходимые фрагменты, вызывать инструменты и на основании результатов продолжать выполнение задачи.
Справочно. Контекст – до 1 млн токенов. Стоимость QwenCloud API составляет 0,15 доллара за 1 млн входных токенов, 0,47 доллара за 1 млн выходных и 0,016 доллара за 1 млн входных токенов из кэша. Открытые веса Qwen3.8-Omni-Flash не опубликованы; локально доступна родственная Qwen3.8-Flash-Next.
Post #1835
83

- ❤ 1