TGViewer
CV Time CV Time @timeforcv · 3.47K subscribers
Post #74 1.99K
InsightEdit: Towards Better Instruction Following for Image Editing

Авторы сегодняшней статьи рассказывают о том, как построили модель InsightEdit для трёх задач редактирования изображений — добавления, удаления и замены объекта. Для этого:

— собрали автоматический пайплайн генерации данных для обучения задаче редактирования изображений по промпту;
— сгенерировали с помощью этого пайплайна датасет AdvancedEdit;
— на собранном датасете обучили модель InsightEdit.

Сначала авторы сгенерировали caption для исходного набора картинок: простые описания (вида «голубая футболка») и сложные (вида «футболка на мужчине, похожая на хлопковую, содержит голубые элементы»). Потом использовали LLM, чтобы создать список объектов, сгенерировали каждому из них маску с помощью GroundedSAM и отфильтровали маски с низким скором уверенности. И, наконец, составили простые инструкции, как и что заменить, и с помощью инпейнтинга сгенерировали отредактированное изображение. А чтобы модель не переобучилась, добавили в датасет перефразированные LLM формулировки.

Такой автоматизированный пайплайн использовали для создания датасета AdvancedEdit. В качестве исходных данных взяли датасет Pixels, который содержит более 1 миллиона фотографий высокого разрешения.

Модель InsideEdit состоит из трёх модулей: понимания, объединения и генерации. Модуль понимания использует MLLM, чтобы понять по промпту, что нужно редактировать. Модуль объединения улучшает взаимодействие промпта и исходного изображения. А модуль генерации — создаёт целевое изображение: редактирует исходное, обуславливаясь векторами признаков из предыдущих модулей.

Для оценки качества обученной модели авторы сравнивают CLIPScore объекта редактирования с эмбеддингом целевого объекта. А чтобы убедиться, что модель не изменила остальные объекты, применяют PSNR, SSIM и LPIPS по фону изображения. Для более точной оценки эффектов редактирования и соответствия человеческим предпочтениям — используют VIEScore.

Обзор подготовил ❣ Александр Шишеня
CV Time
  • 👍 8
  • 🔥 5
  • ❤ 4
More from @timeforcv
  1. Sep 29, 2026Четыре способа испортить предсказание диффузионной модели Сегодня делимся обзором четырёх…
  2. Sep 25, 2026Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation Разбираем стат…
  3. Sep 16, 2026When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virt…
  4. Sep 14, 2026Trustworthy Image Authentication using Forensic Knowledge Graphs На ECCV 2026 прослеживали…
  5. Sep 11, 2026Мы всё ещё на ECCV: репортаж с воркшопа о квантовых вычислениях в компьютерном зрении Наш…
  6. Sep 10, 2026Больше CV на ECCV! Наши инженеры поделились ещё двумя интересными работами на тему компьют…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →