🔎 Как мы объединили фичи картиночной Алисы
На связи команда генеративных моделей в компьютерном зрении Поисковых сервисов и ИИ. Вместе с коллегами мы делаем мультимодального ассистента «Алиса AI». У модели Alice AI ART, которая отвечает за визуальную генерацию, есть два базовых сценария:
🔴 Text-to-Image (T2I) — генерация фото по текстовому описанию
🔴 Image-to-Image (I2I) — редактирование по картинке с инструкцией
Всё это время эти сценарии жили как два разных стека: свои базовые модели, данные, метрики и своя отдельная боль в разработке и поддержке. Поэтому мы решили объединить их в одну модель, которая одинаково хорошо умеет и в T2I, и в I2I.
🅰️ Как мы проводили обучение
➕ I2I-задача редактирования требует от модели понимания референса: входное изображение всегда содержит конкретный объект, который нужно сохранить, трансформировать или дополнить.
➕ T2I-задача сильно прокачивает релевантность. Промпты для генерации с нуля, как правило, детальнее editing-инструкций: они описывают всё, что должно быть на изображении.
Ключевая особенность обучения uni-модели — общий для обеих задач претрейн. T2I- и I2I-данные перемешаны, чтобы визуальный и текстовый прайоры были едиными.
🅰️ Как мы провели показательный эксперимент
Взяли набор концептов, которые отсутствовали в наших данных для редактирования, но которые ранее собирались для T2I. Затем смешали данные и провели совместное обучение, а после проверили, что станет с I2I.
Результат оказался такой, на какой мы и надеялись: концепты, выученные из T2I, становятся доступны в редактировании по инструкции. Специфические запросы начинают работать без необходимости повторять работу по сбору узких срезов данных.
📖 А в статье на Хабре мы рассказали:
🔴 На каких метриках мы измеряем качество моделей
🔴 Что изменилось в самой модели
🔴 Что планируем реализовать в будущем
Подписывайтесь:
💬 @Yandex4Developers
Post #1797
3.19K

- ❤ 5
- 🔥 4
- 🦄 3
- 👍 1