Как мне кажется, есть некоторая несправедливость в том, что на разные инкрементальные улучшения авторегрессии (yet another sparse attention, новые residual connections, gating в аттеншене) и их ablation находится ресурс на обучение в более-менее практически релевантной постановке (модели размером 10B-100B параметров на бюджетах порядка триллиона токенов), а куда концептуально более интересные работы по текстовой диффузии в основном обучаются в игрушечных сетапах а-ля ~100M модель на нескольких миллиардах токенов.
Впрочем, возможно, лучше синица в руке, чем журавль в небе...
Post #753
1.49K
- ❤ 15
- 👏 2