TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #282 786
End-to-End Training for Unified Tokenization and Latent Denoising
[код и веса]

Современные LDM почти всегда двухступенчатые: сначала отдельно учат токенизатор (автоэнкодер), потом замораживают его и сверху учат генератор в зафиксированном латентном пространстве. Это удобно инженерно, но генеративная часть никак не влияет на то, каким получается латентный код и приходится подстраивать генератор под чужое пространство признаков.​

UNITE предлагает рассматривать токенизацию и генерацию как одну и ту же задачу вычисления латентов, просто в разных режимах: в одном случае модель видит исходное изображение почти целиком и должна выдать его компактное представление, в другом — стартует с шума и слабых подсказок и должна прийти к тому же типу представления. Важный шаг — один и тот же энкодер используется и как токенизатор, и как генератор в латентном пространстве, а обучающие сигналы от задачи реконструкции и от задачи генерации совместно формуют одно общее пространство признаков.​

За счёт этого авторы показывают, что можно обойтись одним обучающим запуском и одной моделью вместо каскада токенизатор + генератор, сохранив почти SOTA качество как по реконструкции, так и по генерации. Анализ промежуточных представлений показывает, что даже без внешних учителей токенизация и генерация естественно выравниваются: внутренние слои модели переиспользуются обеими задачами, а не расходятся в две несвязанные подсистемы.​

Интересно, что совместное обучение ведёт себя немного адверсариально: критерии реконструкции и генерации местами конфликтуют, но именно этот конфликт заставляет модель искать латентное пространство, которое одновременно и достаточно информативно для восстановления деталей, и достаточно устойчиво, чтобы по нему было удобно генерировать.

В итоге UNITE показывает, что можно тренировать end-to-end LDM с нуля, не разбивая на два этапа и не привлекая DINO-учителей. Это открывает путь к обучению генеративок в узкоспециализированных областях (робототехника, биология), где нет готовых VAE.
  • 🔥 4
  • ❤ 3
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →