TGViewer
The Layer The Layer @layercv · 852 subscribers
Post #89 735
Классная статья по диффузионным моделям – ELLA

Общий смысл: в качестве текстового энкодера для диффузионок всё ещё часто используется модель из CLIP'а. Создавался CLIP для других задач - сопоставления изображений и короткого текста, а потому длина контекста ограничена 77 токенами, да и соображалкой модель не блещет.
Из-за этого людям приходится мучаться с тегами и промптами, которые очень специфичны и не всегда следуют человеческой логике. Все вот эти "8k, dslr...".
Хорошо было бы иметь умную LLM и свести дизайн промпта к простым правилам. Этим многие сейчас занимаются, но в данной конкретной работе один из самых интересных подходов.

Центральная вещь в исследовании – это адаптер между LLM и генеративной моделью, который называется Timestep-Aware Semantic Connector (TSC)⏳ См. схему.

Зачем он такой сложный? Есть статьи, которые показывают, что диффузионные модели при восстановлении (генерации) изображения из шума сначала фокусируются на низкочастотном содержимом (основные формы, структуры, контуры), а на высокочастотном уже на более поздних этапах (листья, травинки, элементы одежды).
Поэтому, в модуле TSC в AdaLN слои (из DiT) интегрирован временной шаг диффузионной модели, что позволяет извлекать адекватные ему семантические запросы (queries), а не всё сразу. Дальше, конечно, эти запросы идут через cross-attention в Unet, задавая условие генерации.

Очень крутая и логичная идея. Авторы доказывают экспериментально, что другие коннекторы работают хуже: пробуют MLP и разные вариации Perceiver Resampler из Flamingo.
Приятно и то, что ничего, кроме коннектора тренировать не нужно. Его размеры, в зависимости от вариации StableDiffusion, на основе которой пайплайн строится, могут быть от 60кк (SD1.5) до 470кк (SDXL) параметров.
В работе создают, также, свой небольшой (1.065 примеров), но таки бенчмарк – Dense Prompt Graph Benchmark (DPG).

Экспериментируют с разными LLM: TinyLlama, LLaMA-2, T5-XXL. На всех результаты 🔥 и сильно лучше клипа. Для сравнения, на DPG бенчмарке у CLIP 63.18 очков, у LLaMA-2 72.05.
  • 👍 9
  • 🔥 4
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →