Докручиваю стек для работы суперагентов🤖
Чутка устал за эти дни от вайбкодинга, но закрыл фундаментальную задачу — собрал идеальную память для своих ИИ-агентов.
Если юзать память "из коробки" (дефолтные RAG-плагины или встроенные решения), быстро упираешься в потолок. Это всегда черный ящик: ты не контролируешь логику, они не видят сложных неочевидных связей, слепнут на картинках и сжигают сотни тысяч токенов на перечитывании одного и того же мусора.
Кто гоняет агентов плотно, понимает, как быстро можно улететь в рейт лимиты из-за раздутого контекста.
Собрал кастомный сетап, который дает жесткий контроль над расходами и логикой.
Что реально стоит внедрить:
• Мозг системы (RAG): mem0. Дирижирует потоками данных. Не сваливает всё в одну тупую свалку, а умно решает, что реально стоит запомнить, а что выбросить.
• Связка баз: Qdrant (векторы) + Neo4j (графы). Векторы моментально тянут смыслы и Tone of Voice, а графы строят многомерные связи — что, откуда взялось и как связано. Это мастхэв, именно на графах сыпятся все коробочные решения.
• Раздельные эмбеддинги: Qwen для текста (отлично сечет сложный сленг) и Gemini Embedding 2 для картинок. Агенты больше не «слепые» и намертво вшивают в память смыслы со скриншотов.
• Автономность: Посадил GPT-5.4-nano чисто на роль «дворника». Срезает нагрузку на основную модель.
Все решения опенсорс, ставятся на сервак и не тратят сотни $ на подписки, как в коробочных решениях типа ZEP.
Потестил на своих задачах — полет нормальный. Может находить данные из больших выгрузок каналов и личных сообщений моментально, удобно для формирования контента и создания своего цифрового двойника.
Как вам такой сетап памяти?
🔥 — Годно, утащил архитектуру
⚙️ — Слишком гиковская история, я вот только гугл освоил
P.S. Данный стек к примеру очень хорошо подойдет для адаптации контента и автопостинга в X. Или общения с клиентами в моем стиле.
Post #3030
696

- 🔥 8