Обычные looped-модели могут тратить больше compute, многократно обновляя hidden state, но truncated backprop плохо обучает ранние шаги: то, что модель выучила в начале, часто не остаётся полезным позже.
Авторы предлагают другой подход — обучать recurrence через последовательность denoising-задач с постепенно уменьшающимся шумом.
Идея:
noise → промежуточное состояние → всё более чистое решениеПри этом recurrent state переносится между шагами и постепенно уточняется.
Результаты:
- более стабильный test-time scaling
- 58,8% на ARC-AGI-1
- 12,2% на ARC-AGI-2
- в целом лучше предыдущих looped-моделей
Интересный сдвиг: reasoning здесь рассматривается не как цепочка токенов, а как постепенное движение внутреннего состояния модели от шума к решению.
https://alphaxiv.org/abs/2609.11801
