Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
[Статья][Блог]
Ранее в работе REPA было показано, что выравнивание внутренних представлений сети с неким внешним энкодером, обученном на большом обьеме данных, ускоряет сходимость и улучшает качество.
Однако, возникает вопрос - а какой энкодер брать, и как именно выравнивать признаки? Да и как-то оно не из первых принципов.
Ребята из Black Forest Labs предложили Self-Supervision на основе признаков самой диффузионной модели с более низкого уровня шума.
Post #663
1.56K

- 👍 5