Ant Group выложила LLaDA-Image, открытую модель с диффузионным трансформером на 6 млрд параметров, которая и генерирует картинки, и редактирует их по инструкции одним чекпоинтом. Устройство необычное: и языковой бэкбон, и картиночная часть здесь диффузионные, обучены в одной рамке. Есть базовая версия на 50 шагов и Turbo на 4 шага, обе рисуют текст на английском и китайском.
На Qwen-Image-Bench модель первая среди открытых, впереди Z-Image Turbo и HunyuanImage 3.0, но до закрытых не дотягивает: FLUX.2 Max, Seedream 5.0, Qwen-Image 2.0 Pro и Nano Banana 2.0 выше, GPT-Image 2 впереди почти на 12 баллов, график на картинке.
Веса лежат на HuggingFace под Apache 2.0, есть FP8-варианты и демо Turbo. Код обучения обещают позже.
@neuro_channel
Post #2829
1.78K

- ❤ 3