MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv)
Забавная статья, в которой исследуют влияние памяти в LLM.
Обычно и часто проверяют точность, полноту и релевантность извлечения. Но нужно еще проверять общие бизнес-метрики. И о чудо: если память нерелевантная, например все кейсы были про output с XML, а сейчас простой базовый вопрос, то это роняет метрики.
Например, для Gemini 3.0 Flash без памяти средний score 85,2%, а с разными memory-подходами он падает до 54,7-71,2%.
Решение в проверке необходимости текущей памяти модели.
Post #251
671

- 🔥 4
- 👍 2
- 😁 2