Нашу с Pleias статью про data efficiency взяли на NeurIPS:
https://arxiv.org/pdf/2609.37891
Мы с помощью синтетики в один проход учим модели, которые перформят также или лучше, размером в 10^2 меньше альтернатив. Теперь будем до 10^4 бежать.
Post #458
1.21K