TGViewer
CV Time CV Time @timeforcv · 3.47K subscribers
Post #293 1.94K
Что нового в архитектуре Alice AI ART 2.0

В Алисе AI и Шедевруме теперь работает Alice AI ART 2.0 — это большой шаг к созданию unified-модели, которая одинаково хорошо умеет генерировать и редактировать картинки. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на пути к решению — удачных и не очень. В этом разборе сосредоточимся на архитектурной части.

Несколько вводных

В мультимодальном ассистенте Алиса AI есть два базовых сценария: T2I и I2I. До релиза они жили как два разных стека — каждый со своими моделями, данными и метриками. И сейчас мы сделали большой шаг их объединению в модели.

В Alice AI ART 1.0 был классический для T2I диффузионный свёрточный генератор с текстовым энкодером на базе LLM. А редактирование работало на своей базовой модели и своём пайплайне инференса. Это приносило много сложностей в разработке и продуктизации.

Хотелось свести две модели в одну и при этом поднять качество каждой.

Unified-претрейн

Главный герой решения — общий претрейн на данных обоих типов («текст → картинка» и «картинка + инструкция → картинка»). Была гипотеза, что общий визуальный и текстовый контекст перетекает между задачами и улучшает качество. Например, концепты, выученные на T2I, становятся доступны в I2I без дополнительного сбора данных. И это действительно подтвердилось.

Что поменялось в архитектуре

🔴Заменили бэкбон со свёрточной модели на MMDiT‑трансформер с single‑stream‑архитектурой. Теперь текст и входная картинка представляются как токены в одной последовательности, и обрабатывать оба сценария проще.
🔴Использовали общий аттеншн для текстовых и визуальных токенов вместо двух раздельных.
🔴Добавили U‑RoPE — позиционное кодирование, которое поддерживает разные разрешения и конкатенацию «картинка + текст».
🔴Увеличили размер модели для совместной задачи T2I + I2I;
🔴Заменили текстовый энкодер с LLM на VLM, обученный на паре «текст + картинка»). Это улучшило понимание связи текста и изображения.

Результаты

В обеих задачах модель стала заметно лучше прошлой версии и по нашим замерам сейчас занимает второе место после Gemini 3.1 Flash.

Ещё один показатель — это реакция пользователей. Число скачиваний результатов генерации и редактирования выросло на 37 %, а запросов на генерацию с персонажем стало больше на 23 %.

Больше подробностей найдёте в хабростатье.

CV Time
  • 🔥 15
  • 👍 8
  • ❤ 6
  • 😐 2
  • 🤝 1
More from @timeforcv
  1. Sep 16, 2026When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virt…
  2. Sep 14, 2026Trustworthy Image Authentication using Forensic Knowledge Graphs На ECCV 2026 прослеживали…
  3. Sep 11, 2026Мы всё ещё на ECCV: репортаж с воркшопа о квантовых вычислениях в компьютерном зрении Наш…
  4. Sep 10, 2026Больше CV на ECCV! Наши инженеры поделились ещё двумя интересными работами на тему компьют…
  5. Sep 9, 2026Интересные доклады с ECCV 2026 С 8 сентября в шведском Мальмё проходит ECCV — Европейская…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →