TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #142 2.02K
⚡️⚡️⚡️Generating Images with Multimodal Language Models
(от создателей FROMAGe)


Команда Carnegie Mellon University представила новое мультимодальное решение, которое позволяет использовать изображения в контексте языковой модели не только в качестве input’а, но и для генерации output’а. Другими словами, генерация изображений доступна теперь нативно. Всего обучается несколько небольших линейных мапперов и GILL трансформер, а остальные части архитектуры заморожены.

🔥Понимание изображений - обычный линейный маппинг на эмбеддингах замороженных картиночном энкодере и LLM (обучение на парах данных для задачи image captioning)

🔥Генерация спецтокенов - добавляется r [IMG] токенов для обогащения словаря LLM и учится небольшой трансформер - маппер, который позволяет модели понимать изображения. Учится отдельная матрица весов E, а LLM остаётся замороженной

🔥Генерация изображений - обучается GILLMapper - энкодер-декодерный трансформер из 4х слоёв, который использует в качестве condition - скрытые состояния токенов IMG из языковой модели. На выходе он позволяет получать L обучаемых эмбеддингов языковой модели для входа генеративной text2image модели (StableDiffusion) - принцип похож на DETR и BLIP-2. То есть по сути учится маппить hidden state спецтокенов в пространство текстового энтодерма text2image модели

🔥Image retrieval - добавляются еще два линейных маппинга t2i и i2t и соответствующий InfoNCELoss для задачи retrieval.
Все 4 режима объединяются в одной функции потерь и учатся на датасете ConceptualCaptions3M

📌Языковая модель - OPT-6.7B
📌Визуальный энкодер - CLIP ViT-L
📌Генератор изображений - SD 1.5
📌Обучаемых параметров - 50M
📌Обучение - 20k итераций с bs=200, 2 дня на 2xA6000

Статья
GitHub

@complete_ai
  • 👍 21
  • 🔥 9
  • ❤‍🔥 3
  • 👏 1
  • 🎉 1
  • 🏆 1
More from @complete_ai
  1. Oct 9, 2026Приходите послушать Бориса Заикина — он расскажет про наши исследования в области RL обуче…
  2. Oct 9, 2026Время ИИшницы! Приглашаем на митап, который пройдёт 22 октября в 18:30⤵️ В честь юбилейног…
  3. Oct 7, 2026🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших модел…
  4. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  5. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  6. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →