GLM-Image: Auto-regressive for Dense-knowledge and High-fidelity Image Generation
[Модель][Блог]
z-ai (наши 🐘) выпустили гибридную авторегрессионную картиночную модель с диффузионным декодером.
Авторегрессия обучается с инициализации 9B VLMкой, и учат 7B диффузионный трансформер.
Низкие частоты отвечающие за общую семантику генерятся авторегрессией, а диффузия дополняет высокие частоты.
Как утверждается, оно умеет довольно хорошо в lettering, на уровне SOTA.
Post #621
1.73K