Как Sony AI обучила модель за $1890, маскируя 75% изображений
◯ Исследователи из Sony AI представили новый подход к обучению моделей
◯ Использование отложенного маскирования снижает вычислительные затраты
◯ Модель типа "sparse transformer" имеет 1,16 млрд параметров
◯ Обучение проводилось на 37 млн изображений (22 млн реальных и 15 млн синтетических)
◯ Всего на обучение потратили $1890, что в 118 раз меньше по сравнению с аналогами
◯ Достигнута производительность 12,7 FID при zero shot learning на COCO
◯ Архитектура: sparse DiT-XL/2 с использованием VAE и патч-миксера
◯ Доступны предобученные модели с разными показателями FID
◯ Репозиторий содержит полный код и конфиги для тренировки
@EF9MERA
Источник (GitHub)
Post #390
26