🧠 Долгосрочная омнимодальная память
Нужный факт может остаться в старом диалоге, быть на фотографии или в прошедшем видео-звонке. Как его вспомнить? Просто складывать всё в один промпт — не хватит контекста.
На AI RnD Day наш сотрудник Андрей Безбородов рассказал, как команда сравнивала подходы к памяти для разных доменов и модальностей — диалогов, видео и робототехники.
📌 TLDR
В докладе память моделируется через две операции: ingest — принять и сохранить информацию, search — найти эту информацию по запросу. Большое контекстное окно LLM само по себе такой системы не даёт, но служит стартовой отправной точкой. В диалоговых тестах обычный RAG оказался достаточно успешным и сильным решением, причем более сложные схемы не всегда выигрывали.
Для других модальностей, типа видео, критично сохранять визуальную информацию, а не только текстовое саммари, иначе теряется смысл, который зачастую нельзя сохранить простым кепшенингом кадров.
⚙️ RAG
Длинный контекст разбивают на фрагменты, строят для них векторные представления и по вопросу извлекают подходящие куски. Модель получает не всю информацию, а только таргетные знания. У RAG тоже есть слабые места: сведения могут оказаться на границе фрагментов, а похожий по смыслу факт — быть устаревшим. Найти, что пользователь когда-то любил, и понять, что он любит сейчас, — разные задачи. Результаты:
SimpleRAG: На LongMemEval с Qwen3-VL-8B оценка выросла с 41,2% до 50,8%. Подход MemOS дал 53,2%: он хранит память в структуре MemCube, разделяя графовые связи и векторные данные между двумя базами. Однако такую систему сложнее развернуть!
Схема SGR + File Tools с циклом "рассуждение → действие → наблюдение" получила 32,2% — ниже обоих вариантов. То есть наличие агента с инструментами ещё не делает память лучше.
🗜 Почему не сжать найденный текст в вектор?
В xRAG вместо текста документа в модель передают его вектор через обучаемый проектор. В итоге открытая xRAG-7B незначительно обошла RAG на бенче TriviaQA: 58,9% против 56,1%. На внутреннем бенчмарке команды результат составил уже 8,8% против 50,2% у RAG. Успех на одном домене не перенёсся на другой.
🎬 Видео нельзя без потерь превратить в пересказ
WorldMM строит 3 вида памяти: эпизодическую — о конкретных событиях, семантическую — обобщённые факты и связи, визуальную — представления видеофрагментов. Видео режется на клипы по 30c. Qwen-VL описывает кадры, Whisper распознаёт речь. Из описаний формируются тройки вида "объект — отношение — объект", а визуальные представления строит VLM2Vec.
Со всеми типами памяти WorldMM оставался примерно на уровне подачи полного контекста. При отключении визуальной памяти оценка падала с 50% до 41%. Важно отметить, что текстовое описание не сохраняет каждую деталь кадра, и это проблема. Нужные редкие детали или события из кадров уже не из чего восстановить.
🤖 А если это память робота?
M3 Agent объединяет распознавание лиц, транскрибацию и записи эпизодов на базе Qwen-Omni. На бенчмарке M3-Bench-Robots оценка выросла с 18% до 33% у M3 Agent. Но обработка видео занимала примерно столько же времени, сколько оно длится, а формирование ответа — около 30 секунд. Это очень долго и для роботов может быть неприемлимо.
🔚 Выводы
Память стоит выбирать под тип информации и вопросы к ней: поиск по переписке, понимание видео и воспоминания робота требуют разных решений. Начать полезно с простого RAG и сравнения с полным контекстом. Затем можно усложнять систему, когда понятен выигрыш в качестве и его цена по времени.
🔗 Более подробно — в презентации Андрея (в комментариях файлом) и в записи выступления (тайминг: 3:04:55).
#memory #RAG #agents #conference #paperwatch
Post #500
1.89K

- ❤ 4
- 👍 3
- 🐳 1