У любой компании сегодня два конвейера: контент и обучение. По утрам прямые эфиры и вебинары, к обеду — пачка шортов и клипов, к вечеру — обновление базы знаний и онбординг для новых людей. Из задач — переозвучить лекцию на испанский и арабский, нагенерить сабы, вычистить токсик, размечать скринкасты, выдать автотезисы и тесты, собрать курс «вчера на завтра».
Тем временем продукт выкатывает апдейт — половина инструкции устарела, карточки и подсказки надо пересобрать. Контент летит сотнями единиц в день, знания протухают каждую неделю, а людей жалко — монтажёр горит, методист захлебнулся правками, саппорт тонет.
Логичный ответ — отдать рутинистику нейросетям. Но зоопарк убивает темп и бюджет: один сервис слушает речь, другой переводит, третий озвучивает, четвёртый понимает картинки, пятый модерирует, шестой помогает кодом. Разные ключи, разные задержки, разные счета, интеграции тянутся неделями, юристы правят DPA, а в пике всё разваливается из-за лимитов. В итоге не конвейер, а свалка.
На этой картинке и въезжает Alibaba с Qwen3 — пакет из шести моделей, который закрывает весь конвейер одной рукой и меняет экономику такого цеха уже на следующем спринте.
Alibaba выкатывает Qwen3 как единый комплект под конвейер «контент + обучение». LiveTranslate-Flash закрывает синхронный голосовой перевод в звонках и на стримах; по техотчёту Omni первый аудиопакет отдаёт за ~234 мс, речь понимает на 19 языках и генерирует на 10 — то, что нужно, чтобы за вечер собирать дубляжи и субтитры без студии. Qwen-VL берёт на себя поиск по видео и скринам, OCR и таймкоды; из коробки — длинные ролики, точная разметка и интерфейсные скриншоты. Guard — модерация UGC до публикации. Coder — автотесты и фиксы прямо в CI. А сверху — Qwen-Max на >1 трлн параметров для агентных сценариев: собрать тезисы, план урока, чек-листы и вопросы для квиза на лету.
Матчасть. Qwen3-Max — >1T параметров, фокус на кодинг и «агентов»; компания параллельно наращивает капексы: 380 млрд юаней на AI-инфраструктуру за три года, что объясняет темп релизов.
По свежим бенчмаркам Max и Omni показывают сильные результаты на Tau2-Bench, VoiceBench и др., местами обгоняя западные закрытые модели. Публичных цен за минуту/запрос пока нет — считаем экономику после прайса.
Кому больно и почему — по цехам, с цифрами.
Перевод и дубляж: DeepL — $185,2M выручки в 2024 и >100k B2B-клиентов; LiveTranslate-Flash + Omni вшиваются в звонки и студии и уводят задачи локализации ближе к продакшену. Otter.ai — >25M пользователей и $100M ARR — теряет уникальность «встреч» там, где перевод и сабы уезжают в платформу.
Речь/ASR-API: AssemblyAI — $10,4M выручки ’24 — рискует по realtime-кейсам, если Omni/LiveTranslate стабильно держат задержку и качество на многоязычии.
Видео-поиск/понимание: Twelve Labs — enterprise-ниша с дорогими пайплайнами; если Qwen-VL даёт сравнимое качество и длинный контекст, часть M&E-заказов уйдёт в Qwen-стек.
Модерация: Hive — один из крупных провайдеров, работает с социальными платформами; появление Guard как «встроенного фильтра» в том же стеке, где крутится контент, бьёт по внешним модераторам.
Код-ассисты: GitHub Copilot — 20M пользователей all-time — держит монополию в IDE, но Coder + Max «в CI» отжимают рутину на уровне пайплайна, где платёжку контролирует инфраструктурная команда.
Почему сейчас. Alibaba официально смещает фокус в AI и поддерживает это деньгами и релиз-каденсом: «тяжёлый» Max, мультимодальный Omni, VL для визуалки и сервисы вокруг. Это ровно под рынок, где контент нужно клепать сотнями единиц в день, а знания тухнут еженедельно. Китайский темп релизов закрывает дыру между «нужно вчера» и «подождите до квартального апдейта».
Post #1898
898

- ❤ 3