Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
Post #1203
552
Forwarded from Вайб-кодинг
