TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #248 985
Тексты для T2I претрена

Тема актуальная потому что сильно влияет на качество. Статей по ней мало потому что аблейтить дорого. Казалось бы, не жили нормально, нечего и начинать. Но за последний месяц, как манна небесная, на нас снезошли аж две работы по теме, которые хочется обсудить.

Важно напомнить, что естественные кепшены (прикартиночные тексты из интернета) уже давно мало кто воспринимает всерьез из-за их низкого среднего качества. Иными словами, вопроса кепшенить ли картинки для обучения не стоит. Тем не менее, в том как именно это делать есть много нюансов.

1. Structured Captions Improve Prompt Adherence in Text-to-Image Models
Авторы этой работы исходят из предположения, что ключ к хорошим кепшенам — наличие в них строгой структуры:
- Всегда 4 предложения на картинку;
- Каждое предложение имеет свой фокус: объект, локация, эстетика, настройки камеры;
- Порядок предложений тоже задан и всегда одинаков.

Для верификации гипотезы дообучают PixArt на пофильтрованном сабсете LAION размера 19М, кепшены для которых делают двух видов: с заданным порядком как выше и без него. Последующие генерации верифицируют с помощью вопросом VQA модели о том находится ли некий объект на изображении. Из большего числа правильных ответов делают вывод, что структурированные кепшены полезны.

2. How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
Авторов этой работы больше интересует длина и разнообразие кепшенов. Важно, для своих экспериментов они кепшенят сабсет LAION-aesthetics, при этом в качестве бейзлайна для проверки некоторых гипотез используют оригинальные прикартиночные тексты (оч слабый бейзлайн).

Из странностей отмечу SDv1.1 в качестве стартового чекпоинта для дообучения моделей. Мне кажется, это вообще первый на моей памяти случай такого выбора.

Итак, что выяснили авторы: длинные и очень подробные кепшены не всегда хороши. Если использовать только их, может проседать разнообразие и эстетичность генераций. Частично это можно чинить уменьшением температуры семплирования либо увеличением вариативности кепшенов.

Есть и другие минорные и более очевидные наблюдения. Например, кепшены должны быть вариативны внутри каждой эпохи обучения. Также понятно, что через кепшены можно вносить в модель всякие байесы.
  • 👍 6
  • ❤ 1
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →