Alibaba выпустила Qwen3.5-Omni — мультимодальный ИИ, который слышит, видит и говорит
Alibaba выпустила Qwen3.5-Omni — модель, которая понимает текст, изображения, аудио и видео одновременно, а отвечать может как текстом, так и синтезированной речью. Обучена на 100+ млн часов аудиовизуальных данных, поддерживает контекст на 10 часов аудио или 400 секунд видео за раз.
По бенчмаркам на аудио и видео Plus-версия превосходит Gemini 3.1 Pro. Есть занятная фича: показываешь рукописную схему, голосом объясняешь задачу — модель пишет код. Три версии (Plus/Flash/Light) доступны через Alibaba Cloud API уже сейчас.
🔗 Читать: https://mltimes.ai/alibaba-vypustila-qwen3-5-omni-multimodalnyy-ii-kotoryy-slys/
Post #6474
414
