Одно из исследовательских направлений, в которое сейчас вкладывается много ресурсов — continual learning (непрерывное обучение).
Несмотря на большое количество работ в этой области, прогресс в его измерении остаётся минимальным.
Поэтому возникает простой вопрос. Действительно ли специализированные системы памяти позволяют агентам учиться на собственном опыте?
Согласно Continual Learning Bench — пока нет. В шести экспертно валидированных предметных областях с общей обучаемой структурой обычный in-context learning часто работает лучше, чем навороченные системы памяти, которые специально проектировали для обучения на опыте.
CL-Bench вводит метрику gain, которая отделяет реальное обучение от уже имеющихся способностей модели, и показывает, что агенты часто либо переобучаются на недавних наблюдениях, либо не могут повторно использовать знания между разными экземплярами задач.
Если обычный ICL-бейзлайн обходит вашу архитектуру памяти, значит архитектура добавляет накладные расходы, а не обеспечивает обучение. 🤔
Post #3282
17K
