Мне ближе био-мотивированные системы памяти
Markdown, конечно, нравится: просто, наглядно, редактируемо руками. Но хочется, чтобы агент не просто хранил факты, а становился лучше после взаимодействий со мной.
Самый ценный сигнал — неудачные моменты, где я явно дал обратную связь голосом:
— «не так, я просил короче»
— «сначала уточни, потом делай»
— «ты опять перепутал даты»
То есть голосовой интерфейс даёт supervision layer нахаляву. Если агент не умеет такие эпизоды отдельно переваривать, значимая часть опыта просто пропадает.
Daydreaming и два режима мышления
В студенческое время я заинтересовался вопросом эффективного обучения и прошёл курс Learning How To Learn на Coursera. Мало того, что в моменте сильно помогло с учёбой, так ещё базу получил о том, как мозг работает вообще.
🥱 мозг переключается между двумя режимами работы:
👊 Focused mode — концентрированный, целенаправленный. Ты решаешь конкретную задачу, мозг задействует определённые нейронные связи, нужные под эту задачу.
🦋 Diffuse mode — рассредоточенный, ассоциативный. Мозг «бродит», строит дальние связи, которые не видны при фокусировке. Это то, что происходит, когда ты моешься в душе и такой: «окак надо было сказать ей тогда в 2016».
И вот когда начал ковырять тему памяти, дизайнить какое-то своё решение, — вспоминаю про эти два режима. Окей, focused mode понятен — просто работа агента в моменте, working memory, горячий контекст все дела. Но вот diffuse похоже на то, чего не хватает, чтобы память стала живым инструментом! Надо просто времени от времени её консолидировать — «блуждать» по истории взаимодействий и делать какую-то оценку.
То есть помимо обычного retrieval мне захотелось отдельный режим, где агент сам проходит по прошедшим сессиям и пытается понять:
— где я его поправлял чаще всего
— какие ошибки повторяются
— какие предпочтения уже устойчивы
— что стоит поднять в long-term memory
— что можно превратить в рецепт на будущее
В самом простом виде это выглядит так:
[днём]
поговорили → агент накосячил → я его поправил голосом → эпизод пометился
[ночью]
агент прошёлся по спорным эпизодам → нашёл повторяющийся паттерн →
сжал его в правило / preference / recipe → перенёс в долгосрочную память
Когда вообще агенту уместно консолидировать память:
• между сессиями
• в простое
• когда внутри сессии подбираемся к лимиту контекстного окна
• пользователь попросил «подумай над своим поведением»
Похожую логику я увидел в препринте Active Dreaming Memory: там есть wake phase, где агент копит сырые эпизоды, и sleep phase, где они оффлайн консолидируются в более общие правила.
Потом нашёл тот самый Hebbs (сорри, люто прогрел). К слову, тогда же попалась классная статья на Хабре про похожий пет-проект.
Короче, меня всё меньше интересует память, которая просто ищет. И всё больше — память, которая умеет переваривать опыт. В следующем посте как раз разберу Hebbs подробнее — почему он мне кажется очень удачной серединой между graph memory layer™ и нейрокогнитивным космолётом.
коллеги, прикрепляю ссылки!
• Learning How to Learn
• Learning How to-Learn: Book [Excerpt]
• Focused vs Diffuse Thinking
• Memory Consolidation
• Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers
• AI Meets Brain: A Unified Survey on Memory Systems from Cognitive Neuroscience to Autonomous Agents
• Active Dreaming Memory: Biologically-Inspired Episodic Consolidation for Lifelong Learning in Autonomous Agents
• Научил ИИ-агента помнить важное и забывать лишнее в SQLite
