Недавно писал про прикольный подход Recirculation, а тут уже и его развитие подоспело (от конкурирующей команды)
Write Back the Δ: Revisiting the Same Tokens with Fresh Representations
Wencheng Ye, Anning Hu, Xiangdong Zhang, Tianyi Wang, Yikang Li, Hengyu Jin, Bing Li, Junchi Yan
Paper: https://arxiv.org/abs/2609.32457
Review: https://arxiviq.substack.com/p/recirculation
Code: https://github.com/gooogleshanghai/reflux
ЧТО сделали: Авторы представили ReFlux — метод, который возвращает вычисленные инкременты глубины из глубоких слоёв трансформера в более ранние слои через разреженный обучаемый граф обратной связи, зависящий от входа, поверх замороженной языковой модели.
ЧТО получили: На восьми бенчмарках на рассуждение ReFlux улучшает среднюю точность на 2.1–2.3 процентных пункта относительно базовых чекпоинтов (прирост на 4.7 п.п. на 2WikiMultiHopQA с 38.5% до 43.2% на Gemma3-4B против 38.6% у Recirculation и 38.9% у TF-Loop). Перплексия на C4 для Gemma3-4B снизилась с 23.8 до 20.9. В потоковом режиме эти улучшения сохраняются при 1× теоретических FLOPs бэкбона и задержке декодирования 1.02×–1.08×.
ПОЧЕМУ это важно: Языковые модели могут уточнять промежуточные репрезентации без повторного прогона всех слоёв и без траты лишних токенов на длинные цепочки рассуждений. Однако для продакшена потребуются кастомные ядра, чтобы убрать накладные расходы при декодировании.
Подробнее тут: https://t.me/gonzo_ML_podcasts/4818
Post #6072
1.45K