TGViewer
ИИ лоботомия ИИ лоботомия @ai_lobotomy · 168 subscribers
Post #67 82
LLM заранее знает, что ей пора что-то забыть или вспомнить.

Представьте агента, который уже полчаса что-то делает: читает файлы, запускает команды, получает результаты, исправляет ошибки. Вся эта история постоянно лежит у него в контексте и постепенно разрастается.

Обычно памятью такого агента управляют довольно топорно: например, «накопилось 50 тысяч токенов — сжимаем старую историю».
Авторы решили проверить другое: а может быть, сама LLM ещё до следующего действия уже понимает, что ей пора почистить память?

Они взяли внутреннее состояние модели прямо перед тем, как она собирается сделать следующий шаг, и поставили сверху очень линейный датчик.

И оказалось, что по внутренним векторам действительно можно определить:
— пора ли выкинуть часть старой истории;
— понадобится ли сейчас что-то из старой истории обратно.

Причём модель чувствует это не просто потому, что контекст стал длинным. Если смотреть только на количество токенов и число уже сделанных шагов, результат заметно хуже.

Ещё интереснее другой эксперимент.
Авторы выкинули почти всю историю и оставили модели только исходную задачу и два последних шага работы.

Например:
модель открыла файл → получила его содержимое;
потом запустила тесты → получила ошибки.
Всё, что происходило до этого, убрали.

В результате в контексте осталось примерно четверть исходного текста, но внутренний сигнал «пора заниматься памятью» почти не исчез.
То есть модели необязательно постоянно таскать за собой всю историю, чтобы понимать, где она сейчас находится и что ей понадобится дальше.

Старую информацию можно сложить отдельно и доставать только тогда, когда она снова нужна.

На этом авторы сделали систему PaMER. Она работает примерно так:

LLM работает → датчик смотрит внутрь модели → понимает, что память пора почистить → старая история сворачивается и убирается наружу.

Если позже понадобится что-то старое, нужный кусок можно вернуть обратно.
В одном из экспериментов такой подход уменьшил количество обрабатываемых токенов примерно на 73%, практически не ухудшив результат агента.

Но самое смешное: авторы нашли внутри модели ещё и сигнал «мне сейчас нужно что-то вспомнить», но в самой системе пока почти его не используют.

Для меня здесь самое интересное вообще не память.
Это ещё один пример того, что внутри LLM можно искать служебные сигналы, которые появляются раньше действия модели.

Например:
«мне не хватает информации»
«я не уверен»
«надо перепроверить»
«надо поискать ещё»
«пора остановиться»
«пора почистить память»

А дальше небольшой внешний контроллер уже решает, что делать: дать модели больше времени на рассуждение, отправить её в поиск, запустить проверку или почистить контекст.

То есть вместо того чтобы пытаться понять состояние LLM по её ответам, можно просто поставить датчики прямо на её внутренние состояния.
И похоже, внутри трансформера таких лампочек намного больше, чем мы пока умеем читать.

Memory Control Signals Emerge Before Action in Long Horizon Agents
https://arxiv.org/abs/2609.27286
arXiv.org Memory Control Signals Emerge Before Action in Long Horizon Agents Long horizon language model agents continuously accumulate interaction history, increasing computational cost while making relevant information harder to preserve and reuse. Existing context...
  • 🔥 2
  • ❤ 1
More from @ai_lobotomy
  1. Sep 25, 2026Не знал, что в Яндексе тоже любят ковыряться в LLM на уровне инференса. Причём довольно гл…
  2. Sep 25, 2026DeepSeek V4.1 Flash Часть #3. Огромная шпаргалка на 196 миллиардов параметров Допустим, мо…
  3. Sep 24, 2026DeepSeek V4.1 Flash Часть #2. Как перестать 40 раз на токен искать иголку в стоге сена. В…
  4. Sep 22, 2026Сегодня в рубрике «лоботомия»: у GLM-5.3 отрезали треть экспертов и проверили, насколько х…
  5. Sep 20, 2026DeepSeek V4.1 Flash Часть #1. Можно ли сэкономить на фазе чтения промпта моделью? Помните,…
  6. Sep 19, 2026Post #63
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →