LLM заранее знает, что ей пора что-то забыть или вспомнить.
Представьте агента, который уже полчаса что-то делает: читает файлы, запускает команды, получает результаты, исправляет ошибки. Вся эта история постоянно лежит у него в контексте и постепенно разрастается.
Обычно памятью такого агента управляют довольно топорно: например, «накопилось 50 тысяч токенов — сжимаем старую историю».
Авторы решили проверить другое: а может быть, сама LLM ещё до следующего действия уже понимает, что ей пора почистить память?
Они взяли внутреннее состояние модели прямо перед тем, как она собирается сделать следующий шаг, и поставили сверху очень линейный датчик.
И оказалось, что по внутренним векторам действительно можно определить:
— пора ли выкинуть часть старой истории;
— понадобится ли сейчас что-то из старой истории обратно.
Причём модель чувствует это не просто потому, что контекст стал длинным. Если смотреть только на количество токенов и число уже сделанных шагов, результат заметно хуже.
Ещё интереснее другой эксперимент.
Авторы выкинули почти всю историю и оставили модели только исходную задачу и два последних шага работы.
Например:
модель открыла файл → получила его содержимое;
потом запустила тесты → получила ошибки.
Всё, что происходило до этого, убрали.
В результате в контексте осталось примерно четверть исходного текста, но внутренний сигнал «пора заниматься памятью» почти не исчез.
То есть модели необязательно постоянно таскать за собой всю историю, чтобы понимать, где она сейчас находится и что ей понадобится дальше.
Старую информацию можно сложить отдельно и доставать только тогда, когда она снова нужна.
На этом авторы сделали систему PaMER. Она работает примерно так:
LLM работает → датчик смотрит внутрь модели → понимает, что память пора почистить → старая история сворачивается и убирается наружу.
Если позже понадобится что-то старое, нужный кусок можно вернуть обратно.
В одном из экспериментов такой подход уменьшил количество обрабатываемых токенов примерно на 73%, практически не ухудшив результат агента.
Но самое смешное: авторы нашли внутри модели ещё и сигнал «мне сейчас нужно что-то вспомнить», но в самой системе пока почти его не используют.
Для меня здесь самое интересное вообще не память.
Это ещё один пример того, что внутри LLM можно искать служебные сигналы, которые появляются раньше действия модели.
Например:
«мне не хватает информации»
«я не уверен»
«надо перепроверить»
«надо поискать ещё»
«пора остановиться»
«пора почистить память»
А дальше небольшой внешний контроллер уже решает, что делать: дать модели больше времени на рассуждение, отправить её в поиск, запустить проверку или почистить контекст.
То есть вместо того чтобы пытаться понять состояние LLM по её ответам, можно просто поставить датчики прямо на её внутренние состояния.
И похоже, внутри трансформера таких лампочек намного больше, чем мы пока умеем читать.
Memory Control Signals Emerge Before Action in Long Horizon Agents
https://arxiv.org/abs/2609.27286
Post #67
82