IBM Research проверила агентную память на восьми моделях. Агентам давали не старые диалоги, а правила, автоматически извлечённые из успешных и провальных запусков.
Результат оказался неочевидным:
— сильные модели лучше работали со всем набором правил;
— более слабые путались в большом объёме памяти, но заметно улучшались при выборочной подаче нужных правил;
— модели, уже достигшие потолка на тесте, не получили пользы вообще.
У
gpt-oss-120b выборочная память повысила долю выполненных задач на 16,1 процентного пункта при росте расхода токенов всего на 5%. Передача всей памяти дала меньший результат и стоила примерно на 50% дороже.Для тебя вывод простой: память агента — не архив «сохраняем всё», а настраиваемый механизм поиска. Сравнивай хотя бы три режима: без памяти, со всей памятью и с выборкой по задаче. Пока результаты подтверждены только на AppWorld, поэтому на своих сценариях нужны отдельные тесты.
Пруфы:
🔘разбор IBM Research
🔘arxiv
#aiagents #agentmemory #llm #contextengineering #rag #aievals
@data_engi