TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #284 882
VIBE: Visual Instruction Based Editor [2/2]

Первая часть обзора статьи, в которой мы посмотрели на архитектуру модели и то, как она соединяет VLM и диффузионную систему, уже доступна в канале @timeforcv. Теперь разберём, как всё это обучается и какие данные используются.

Как обучается модель

В статье описана четырёхстадийная схема обучения:

1. Connector alignment — обучаются коннектор и meta tokens.
2. Претрейн — обучается диффузионная модель и коннектор.
3. SFT — дообучаются meta tokens.
4. DPO — дообучается только диффузионная модель.

Само по себе многостадийное обучение — стандартная практика. Внимания заслуживает аккуратно подобранная схема с попеременной разморозкой разных частей системы, в том числе в части с meta tokens. Здесь авторы опираются на работу MetaQueries. В ней описывается проблема обучения общего представления между VLM и диффузионной моделью. Их нужно соединить так, чтобы при инференсе мультимодальный вход, проходящий через VLM, давал максимально богатое представление для генерации. В идеале — настолько информативное, что картинку на вход диффузионке можно было бы вообще не подавать. Подход позволяет увеличивать информативность входных представлений, не размораживая VLM. Подробнее в разборе.

Данные

Любопытно, что практически на всех стадиях, кроме DPO, в том или ином количестве используются text-image-данные. Авторы объясняют это двумя причинами. Во-первых, такие датасеты обычно содержат более качественные изображения. Во-вторых, это позволяет модели не забыть режим text-to-image.

Основной эдитинг-датасет — около 21 млн триплетов (изображение, инструкция, результат), в основном собранных из опенсорсных источников. После фильтрации осталось 7,7 млн триплетов. Для фильтрации данных использовались модели Gemini 2.0 Flash и Qwen-2.5-VL-7B.

SFT-датасет довольно большой — порядка 6,8 млн примеров. DPO — 176 тысяч.

Отдельно отметим, что авторы заморочились по поводу датасета UltraEdit. Они отфильтровали изображения низкого разрешения и, судя по описанию, перегенерировали таргеты более сильной моделью.

В статье также упоминаются Autonomous self-mining pipelines — около 3 млн примеров, полученных генерацией через Qwen-Image и другие проприетарные модели. В датасеты старались добавить реальные editing-триплеты, но их получилось немного — всего несколько тысяч.

Дополнительные данные

Также использовались видеоданные. Пайплайн стандартный: из кадров извлекаются эмбеддинги, сцены группируются по близости, после чего автоматически кэпшенятся небольшой моделью.

Авторы пытались разбить эдитинг-задачи на 50 подкатегорий с помощью кластеризации эмбеддингов, но финальной таблицы кластеров в статье нет.

Результаты

Авторы показывают результаты на опенсорсных бенчмарках, таких как GEdit и ImageEdit. По этим метрикам модель сопоставима по качеству с Z-Image.
  • 🔥 6
  • ❤ 2
  • 👍 1
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →