TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.6K subscribers
Post #5256 4.25K
У агентов снова нашли слабое место: память может портиться прямо во время «самоулучшения».

В новой работе Useful Memories Become Faulty When Continuously Updated by LLMs исследователи из University of Illinois, Tsinghua University и других лабораторий проверили, что происходит, когда агент постоянно переписывает свой опыт в аккуратные заметки.

Идея выглядит логично: агент решил задачу, сжал опыт в короткий урок, сохранил его в память и в следующий раз должен работать лучше. Но на практике такие пересказы постепенно ломают исходный смысл.

LLM часто превращает конкретный успешный эпизод в слишком общий совет. Потом эти советы группируются, обновляются, переписываются и начинают смешивать разные типы задач. В итоге память выглядит красиво, но работает хуже, чем сырые попытки с реальным контекстом.

Авторы тестировали это на веб-шопинге, симулированных средах, работе с приложениями и ARC-подобных задачах. Самый жёсткий результат: GPT-5.4 решала 100% небольшого набора ARC-AGI без памяти, но после построения памяти из правильных решений качество падало примерно до 54%.

Что ломалось:

- разные задачи склеивались в одну группу
- частные правила становились «универсальными»
- важные детали терялись при пересказе
- память переобучалась на узкие примеры
- новые обновления затирали полезные старые факты

Для агентных систем это неприятная проблема. Долгая память сама по себе не делает агента умнее. Если каждое действие автоматически превращать в саммари, агент может звучать увереннее, но действовать хуже.

Более рабочая схема - хранить сырые эпизоды как доказательства: реальные попытки, ошибки, решения и контекст. А обобщения делать осторожно, не превращая память в бесконечно переписываемый конспект.

Paper: https://arxiv.org/abs/2605.12978
  • ❤ 15
  • 🔥 7
  • 🥰 4
  • 😁 4
More from @data_analysis_ml
  1. Sep 29, 2026Anthropic готовится к IPO с необычным предупреждением для инвесторов: её модели могут пред…
  2. Sep 28, 2026В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude. Мало…
  3. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и по…
  4. Sep 28, 2026🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту John McCarthy (1927–…
  5. Sep 28, 2026📊Платформа данных в корпоративном контуре компании Когда компания строит собственную плат…
  6. Sep 28, 2026🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американски…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →