В моем старом видео я делал обзор на систему памяти агента, а в этом посте я распишу поминутно кто где соснул..
Душнить в очередной раз про контекст и токены не буду. Оставим это тем, кто вообще ничего не понимает в нейросетях.
Более прошаренный читатель может сказать, что агент каждый раз заново читает заметки о чем угодно. Будь то ваши личные данные, архитектура проекта или заметка о последнем этапе работы перед вашим сном.
Но отсюда и возникает ключевое — каким образом он читает. Вернее в какой форме ему подаются знания. Подборочкой таких инструментов и занят данный пост, работает в поте лица.
LLM WIKI
Тут смотри в чем магия, мы можем в целом записывать заметки просто в .md файлах, которые потом удачно читать через Obsidian. Агент просто знает в своих системных инструкциях куда сходить почитать.
Правила ведения вики прописаны в ней и скиллах/тулзах/настройках агента, например как это реализовано в моем ObsidianDataWeave.
Агент просто пишет текст, пишет что там записал, потом в ходе работы ищет подходящий текст и вычитывает его. Ничего сложного.
Но данный метод не подойдет для быстрого поиска огромнейшего массива данных + точного цитирования, если вы хотите "научить" агента каким-то знаниям.
А сам метод описал Карпаты.
Воспринимай это стилем ведения записей, но не самой технологий для работы с ними.
Hermes (FTS5)
Метод похож на обычную запись .md файлов, но прикол в том, что он ведет SQL базу данных через FTS5. Искать похожее по смыслу он не умеет, но способен за секунды доставать по ключевым словам целые чаты за 2 месяца.
Именно поэтому Hermes Agent всегда все помнит: свои скиллы, твои проекты, что вы обсуждали, что ты за тварь такая. Он буквально все записывает и супер быстро находит.
Но тут нельзя быстро найти дословную цитату по смыслу (семантике). Этот метод просто подойдет в 90% случаев.
Изучить подробнее можешь тут.
Считай это супер универсальной технологией не требующей никаких ресурсов
RLM (RAG)
Тут в чем суть, сам по себе классический RAG это объединенный термин векторных баз данных.
Их магия в том, что можно выгрузить целые книги и нейросеть сможет делать поиск по семантике — глубокий и логичный поиск по смыслу.
Недостаток в том, что требуется постоянно отдавать оперативную память, например 2 толстых книги будут занимать всегда 3 ГБ ОЗУ. Следовательно для дешевых VPS огромные заметки это смэрть.
Другой недостаток в том, что RAG задумывался как схема где ты загрузил кучу говна и оставил его, чтобы агент ссылался на говно бесконечно.
RLM — решает часть проблем, он делает векторную БД динамичной и агент всегда обновляет там данные на актуальные.
То есть с таким подходом агент в целом ничего забыть не может и всегда способен находить нужное. Но остается фундаментальный недостаток: прожор оперативной памяти.
И я подчеркну, что RLM это грубо говоря аналог LLM WIKI, который именно что задает систему для агента, как работать с памятью. Это и прокачивает классический RAG, если мы под него вкорячиваем.
Вариант в RAG покопаться.
Почитать подробнее вот тут.
Бери эти подходы если тебе нужно на 99.9% зафиксировать знания и ссылаться на книги, документы, товары, политику компании. И ты готов повайбкодить свое решение из готовых фрейморков/библиотек.
