TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #302 570
Тексты для T2I, второй акт: переписывание промтов, агенты и Context Gap
[кода нет, новый бенч]

Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions. Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регулярнее текст в обучении, тем лучше модель учит соответствие текст-картинка.

Побочный эффект - модель ждёт на входе огромную портянку, а пользователь приходит с "make a cool poster". Между распределением тренировочных текстов и распределением реальных юзер-запросов появляется разрыв. И это только первый род проблем. Второй в том что юзер часто опускает в промте контекст, без которого задачу в принципе нельзя решить.

Свежий тех-репорт от Qwen называет суммарный разрыв между предоставленным и необходимым контекстом и предлагает закрывать его не одним репромтером, а агентом. Почему так? Потому что простые репромтеры уже давно делаются и у них есть предел качества

Baseline

В DALL-E 3 учили собственный кепшенер на парах картинка-длинный детальный кепшен. Потом в CogView3 повторили схему на своём датасете. Схема никак не адресует разрыв между распределениями промтов, поэтому в DALL-E 3 API между юзером и моделью используют GPT-4, который ту же короткую фразу расширяет до длинного промта. Работало zero-shot, давало хорошие результаты для своего времени.

Обученный ризонящий rewriter (PromptEnhancer)

Вместе с тех репортом по генеративной модельке команда Hunyuan выкладывала отдельную папиру про PromptEnhancer (обе разбирали тут). Эта модель сначала рассуждает в свободной форме о том, чего в промте не хватает и где проблемы у конкретного T2I, потом выдаёт переписанный промт. Учат через RL: на 24 аспектах (биндинг атрибутов, отрицания, композиция, счёт и т.д.). Получается промтилка, заточенная под слабые места одного конкретного генератора. Минус в переносимости: при смене T2I надо переобучать промтилку и пересобирать реворд модель.

Полноценные агенты с тулами (GenSearcher, MindBrush, GEMS, SCOPE, T2I-Copilot)

Параллельно вышли несколько систем, которые навешивают на генератор агентский слой и расширяют действия за пределы переписки

• В GenSearcher делают упор на RAG: если промту нужен реальный референс (лицо знаменитости, лого, конкретный продукт), агент идёт в поиск и подсовывает топ-найденное в генератор
• В MindBrush добавляют ризонинг перед генерацией . Они же сделали MindBench в котором запрос требует промежуточного вывода
• SCOPE про планирование сложных сцен. Напоминает работу про расписание с увеличением сложности промтов и добавлением деталей по ходу генерации
• В T2I-Copilot пытаются сделать агентную систему (без дообучений) разделением ролей (интерпретатор, генератор, оценщик)

Каждая работа хороша в своём кусочке, но ни одна не покрывает целиком все действия: планирование / ризонинг / поиск / памать / фидбек. Команда Qwen называет их фрагментированными и говорит, что унификация назрела

Qwen-Image-Agent

Авторы формализуют генерацию как условный рендеринг: у нас есть контекст пользователя (промт + опционально доп картинки-кондишены), а нужен генеративный контекст, то есть именно то что нужно для генерации. Чтобы ее устранить агент строит траекторию и на каждом шаге выбирает одно из пяти описанных выше действий. К моменту вызова генератора у системы есть детальный промт + при необходимости визуальные референсы + чек-лист желаемых атрибутов.

В работе есть много технических деталей про то как именно устроить каждое действие. Важно, что они ничего не тренируют, всё работает зеро шот поверх GPT-5.5 для агентской обвязки и Qwen-Image-2.0 как генератора. К фреймворку отдельно сделали бенч IA-Bench.

IA-Bench

Фишка бенча — специально убраны запросы, которые модель может решить мемоизацией (например, исключают слишком известных персонажей), плюс есть замеры промежуточных состояний, по которым можно смотреть правильно ли модель рассуждает.
  • 🔥 3
  • ❤ 1
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →