Как дообучать LLM на лету с помощью памяти вместо файнтюнинга
Один красивый промпт давно не спасает: сложные задачи требуют планов, инструментов и памяти, а текущие агенты либо жестко заскриптованы, либо стоят дорого из‑за дообучения.
Цель AgentFly — научить агента улучшаться «на лету» без трогания весов модели.
Метод простой по идее и аккуратный в реализации: агент хранит прошлые удачные шаги как кейсы, формализует процесс как MDP с памятью, планировщик извлекает нужные примеры и пишет краткий план, исполнитель решает задачу с инструментами (веб, код, MCP), а мягкое Q‑обучение учит выбирать по‑настоящему полезные кейсы.
Результат: GAIA — 87.88%, SimpleQA — 95%, в HLE — 24.4% и второе место.
Вывод: небольшая, тщательно отобранная память дает перенос на новые домены и стабильный рост качества — без дорогого дообучения, по‑человечески копя опыт.
📜 Полный обзор
Post #17
138